Opinión Algoritmos que razonan con incertidumbre: la nueva ventaja competitiva en la era de la IA
La victoria de Ataraxos en Stratego con 16 GPUs demuestra que la frontera ya no es el cómputo, sino la capacidad de decidir con información incompleta. Para ejecutivos en Latinoamérica, la oportunidad está en modelar sus propios tableros de negocio.
Durante décadas, la narrativa dominante en inteligencia artificial fue una carrera armamentista de hardware: quien tuviera más GPUs, más datos y más presupuesto ganaría. DeepMind lo demostró con AlphaGo y DeepNash, pero siempre detrás de infraestructura que solo los gigantes podían permitirse. En octubre de 2026, un equipo de Carnegie Mellon, MIT, NYU y Stanford rompió ese guion. Su agente, Ataraxos, derrotó al mejor jugador de Stratego de la historia —Pim Niemeijer— por 15 a 1 con cuatro tablas. El costo de entrenamiento: 16 GPUs y unos pocos miles de dólares.
Stratego no es ajedrez. El rival ve dónde están las 40 piezas, pero no qué son. Solo al chocar se revela la jerarquía: mariscal, general, espía, bomba, bandera. Ganar exige deducción a largo plazo, farol y gestión de información que se revela gota a gota durante 300 turnos. Es un juego de información imperfecta, igual que una negociación comercial, una licitación pública o una ruta logística con demanda volátil. La victoria de Ataraxos no es un truco de laboratorio; es una prueba de existencia: los algoritmos que razonan bajo incertidumbre parcial con garantías teóricas ya no requieren presupuestos de DeepMind.
El salto del equilibrio de Nash al razonamiento en tiempo de prueba
Cuatro años antes, DeepNash había alcanzado el top-3 mundial usando equilibrio de Nash y refuerzo sin búsqueda de árboles. Faroleaba, sacrificaba piezas para ganar información y adaptaba su estrategia sobre la marcha. Pero requería la nube de Google.
Ataraxos da un salto distinto: aprende una política base por gradiente de política con regularización KL y, en cada jugada, reentrena en tiempo de prueba simulando un "juego gadget" que representa la subpartida actual, sin construirlo explícitamente. Los autores —Kubíček, Lisý y Sandholm— demuestran que, manteniendo fija la política de regularización, múltiples pasos de gradiente acotan tanto la mejora como la degradación posible. Es razonamiento en tiempo de prueba seguro. En Battleship, un agente con esta capacidad supera al 80 % a oponentes sin ella.
Paralelamente, el mismo grupo presentó Obscuro, la primera IA superhumana en ajedrez con niebla (Fog of War chess), la variante de información imperfecta más popular en chess.com con 19.000 jugadores activos. Aquí los conjuntos de conocimiento común alcanzan 10¹⁸ posiciones, imposibles de enumerar —el póker heads-up se queda en 1,6 millones. Obscuro evita el problema con KLUSS: muestrea cientos de posiciones compatibles con sus observaciones, construye una subpartida limitada al conocimiento de primer orden y resuelve un equilibrio aproximado. Contra el anterior estado del arte gana 1.000 de 1.000 partidas; contra humanos, incluido el número 1 mundial, gana 120 de 120.
La lección para el ejecutivo latinoamericano
Tres hitos convergen en una misma moraleja: la frontera no la marcan ya los petaflops, sino la capacidad de razonar bajo incertidumbre parcial con garantías teóricas. Un artículo paralelo en IEEE CoG 2025 muestra, además, que representaciones de creencia basadas en restricciones lógicas rinden casi igual que inferencia probabilística completa en juegos con identidades ocultas. Simplificar la estimación de estado no penaliza el desempeño.
Las mismas estructuras —información oculta que se revela en interacciones, horizontes largos, necesidad de farol y señalización— aparecen en la negociación de contratos de proveeduría, el trading de materias primas, la logística de última milla con demanda estocástica o la asignación de capital en mercados volátiles.
Hasta hace poco, resolver estos problemas con IA exigía presupuestos de DeepMind. Hoy, la literatura abierta ofrece algoritmos —gradiente de política regularizado, KLUSS, test-time RL seguro— que corren en clusters modestos y vienen con cotas de explotabilidad. Un equipo de ciencia de datos en Bogotá o Santiago puede prototipar un agente de negociación automatizada o un optimizador de rutas con incertidumbre de demanda usando las mismas ideas que Ataraxos u Obscuro, sin pedir presupuesto para 10.000 GPUs.
El cuello de botella ya no es el hierro. Es dominar el modelo de decisión: definir espacio de estados, observaciones, acciones y función de recompensa para el problema real de negocio. Los papers entregan el motor; la carrocería la diseña quien conoce el terreno.
La historia de la IA en juegos es, en el fondo, la historia de qué tan barato sale razonar bien con información incompleta. Stratego y ajedrez con niebla acaban de caer con presupuestos de pyme. La pregunta para el ejecutivo latinoamericano no es "¿cuándo llegará esta tecnología?", sino "¿qué decisión estratégica mía hoy se parece a una partida de Stratego y sigue delegada en intuición?". La herramienta ya está en el repositorio público. Falta el tablero propio.