El tablero de Stratego tiene 40 piezas por bando. El rival ve dónde están, pero no qué son. Solo al chocar se revela la jerarquía: mariscal, general, espía, bomba, bandera. Ganar exige deducción a largo plazo, farol y gestión de información que se revela gota a gota durante 300 turnos. Durante décadas, ni DeepMind con presupuestos millonarios logró una máquina que batiera consistentemente a la élite humana.
En octubre de 2026, un equipo de Carnegie Mellon, MIT, NYU y Stanford cambió esa historia. Su agente, Ataraxos, derrotó a Pim Niemeijer —considerado el mejor jugador de la historia— por 15 a 1 con cuatro tablas. El costo de entrenamiento: 16 GPUs y unos pocos miles de dólares fuente.
Del equilibrio de Nash al razonamiento en tiempo de prueba
Cuatro años antes, DeepMind había presentado DeepNash, que alcanzó el top-3 mundial en la plataforma Gravon usando un algoritmo basado en el equilibrio de Nash (R-NaD) y aprendiendo por refuerzo sin buscar árboles de juego fuente. DeepNash faroleaba, sacrificaba piezas para ganar información y adaptaba su estrategia sobre la marcha. Pero requería la infraestructura de Google.
Ataraxos da un salto distinto. No solo aprende una política base ("blueprint") por gradiente de política con regularización KL; en cada jugada reentrena en tiempo de prueba simulando un "juego gadget" que representa la subpartida actual, sin construirlo explícitamente. Los autores —Kubíček, Lisý y Sandholm— demuestran que, manteniendo fija la política de regularización, múltiples pasos de gradiente acotan tanto la mejora como la degradación posible: es razonamiento en tiempo de prueba seguro fuente. En experimentos a gran escala, un agente con esta capacidad supera al 80 % a oponentes sin ella en el juego Battleship.
Ajedrez con niebla: el tablero más grande resuelto con búsqueda imperfecta
Paralelamente, el mismo grupo (Zhang y Sandholm) presentó Obscuro, la primera IA superhumana en Fog of War chess (ajedrez con niebla), la variante de información imperfecta más popular en chess.com con 19.000 jugadores activos fuente. Aquí el reto es brutal: los conjuntos de conocimiento común —estados que ambos jugadores saben que ambos saben que son posibles— alcanzan 10¹⁸ posiciones, imposibles de enumerar. El póker heads-up, por comparación, se queda en 1,6 millones.
Obscuro evita el problema con KLUSS (knowledge-limited unfrozen subgame solving): muestrea unos cientos de posiciones compatibles con sus observaciones, construye una subpartida limitada al conocimiento de primer orden y resuelve un equilibrio aproximado. Repite el proceso hasta agotar el presupuesto de tiempo. Contra el anterior estado del arte gana 1.000 de 1.000 partidas; contra humanos —incluido el número 1 mundial— gana 120 de 120.
La lección de la eficiencia: menos hierro, más ingenio
Tres hitos convergen en una misma moraleja técnica:
- DeepNash (2022): equilibrio de Nash vía aprendizaje por refuerzo, infraestructura masiva.
- Ataraxos (2026): gradiente de política + re-entrenamiento en test-time, 16 GPUs.
- Obscuro (2026): búsqueda subpartida escalable sin conocimiento común, hardware commodity.
La frontera no la marcan ya los petaflops, sino la capacidad de razonar bajo incertidumbre parcial con garantías teóricas. Un artículo paralelo en IEEE CoG 2025 muestra, además, que representaciones de creencia basadas en restricciones lógicas (CSP) rinden casi igual que inferencia probabilística completa en juegos con identidades ocultas fuente. Simplificar la estimación de estado no penaliza el desempeño.
¿Qué significa para un CEO en México, Colombia o Chile?
Las mismas estructuras —información oculta que se revela en interacciones, horizontes largos, necesidad de farol y señalización— aparecen en:
- Logística y cadena de suministro: proveedores y clientes ocultan capacidades y urgencias reales; los contratos se ejecutan en pasos donde cada entrega revela información.
- Mercados financieros y *market making*: el libro de órdenes es información imperfecta; la ejecución óptima requiere razonar sobre lo que el contraparte infiere de mis órdenes.
- Negociación contractual y licitaciones: ofertas y contraofertas son movimientos en un juego de información asimétrica.
- Ciberseguridad defensiva: el atacante oculta su posición; el defensor descubre pistas al interactuar.
Hasta hace poco, resolver estos problemas con IA exigía presupuestos de DeepMind. Hoy, la literatura abierta ofrece algoritmos (gradiente de política regularizado, KLUSS, test-time RL seguro) que corren en clusters modestos y vienen con cotas de explotabilidad. Un equipo de ciencia de datos en Bogotá o Santiago puede prototipar un agente de negociación automatizada o un optimizador de rutas con incertidumbre de demanda usando las mismas ideas que Ataraxos u Obscuro, sin pedir presupuesto para 10.000 GPUs.
El cuello de botella ya no es el hierro. Es dominar el modelo de decisión: definir espacio de estados, observaciones, acciones y función de recompensa para el problema real de negocio. Los papers entregan el motor; la carrocería la diseña quien conoce el terreno.
Cierre reflexivo
La historia de la IA en juegos es, en el fondo, la historia de qué tan barato sale razonar bien con información incompleta. Stratego y ajedrez con niebla acaban de caer con presupuestos de pyme. La pregunta para el ejecutivo latinoamericano no es "¿cuándo llegará esta tecnología?", sino "¿qué decisión estratégica mía hoy se parece a una partida de Stratego y sigue delegada en intuición?". La herramienta ya está en el repositorio público. Falta el tablero propio.