Ataraxos vence al mejor jugador de Stratego con US$8.000

Por qué Stratego era la última frontera de los juegos de mesa

A lo largo de casi tres décadas, la IA fue venciendo a la humanidad en los grandes juegos de referencia: Deep Blue a Kasparov en ajedrez en 1997, AlphaGo a Lee Sedol en Go en 2016, y los bots de póker llevan años superando a profesionales. Stratego era la excepción. En 2022, DeepMind presentó DeepNash y, aun con un presupuesto estimado de entre US$3M y US$4,5M según el paper publicado en Nature, no logró superar a los mejores jugadores humanos: en el Mundial de 2023, DeepNash ganó 19 de 28 partidas pero cayó ante la mayoría de los top, incluido Pim Niemeijer.

La razón es que Stratego es un juego de información imperfecta con una escala brutal. Cada jugador coloca 40 piezas boca abajo —de mariscal a espía, más bombas y la bandera— y solo se revelan cuando colisionan en combate. Según The Decoder, hay más de 10^33 configuraciones posibles, frente a las 1.326 manos iniciales del Texas Hold’em. Además, una partida puede durar hasta 2.000 movimientos, muy lejos de las ~40 del ajedrez. Y todo eso se combina con una capa de bluff que vuelve inestable cualquier patrón repetido: si blufas siempre, te descifran; si nunca blufas, te vuelves predecible.

La apuesta técnica de Ataraxos: menos cómputo, más eficiencia

Un equipo de Carnegie Mellon, MIT, NYU y Stanford, con Samuel Sokota como primer autor y Gabriele Farina (MIT) como senior author, construyó Ataraxos —»el que no se altera», en griego— y publicó los resultados en Nature. El contraste presupuestario es el dato más elocuente:

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad
  • DeepNash: 1.024 nodos de TPU durante 2-3 meses, según el paper citado por The Decoder.
  • Ataraxos: una semana en 16 GPUs Nvidia H100, más 4 días adicionales en 4 GPUs para entrenar la belief network. Costo total: menos de US$8.000 a precios de 2025, según The Decoder.

El equipo calcula que Ataraxos usó 1/500 del cómputo, 1/30 de las partidas de self-play y 1/100 de los ejemplos de entrenamiento de DeepNash. No hubo comparación directa porque, según el paper, el código de DeepNash ya no funciona y DeepMind no pudo reconstruir la infraestructura.

¿Cómo lo lograron? Tres piezas técnicas:

  • Self-play con regularización adaptativa. Ataraxos aprende jugando contra sí mismo, pero se lo «empuja» a variar jugadas y setups para no quedarse atascado en una estrategia fija. Los investigadores comparan esta presión con una reserva de energía: si se quema demasiado rápido, el sistema explota pronto pero luego se vuelve fácil de explotar.
  • Belief network generativa. Un modelo estima las piezas ocultas del rival antes de cada movimiento, genera estados plausibles del tablero y hace una mini-búsqueda específica para esa decisión.
  • Decision-time planning. Antes de actuar, Ataraxos refina su jugada con la belief network en lugar de aplicar la estrategia base sin más.

El rival fue una leyenda. Pim Niemeijer suma 4 títulos mundiales, 15 nacionales holandeses, 2 mundiales online y más de 600 semanas en lo más alto del ranking, según The Decoder. Ataraxos le ganó 15-1-4 en una serie oficial de 20 partidas extendida en tres semanas, con un win-rate del 85% (empatando cuenta como media victoria). Niemeijer cobró US$1.000 por participar, más US$100 por victoria y US$50 por empate, según el paper. En la exhibición del Mundial de Stratego de 2025, Ataraxos ganó 38 de 40 partidas contra jugadores de torneo.

Por qué importa más allá del tablero

El método no se quedó en Stratego. Los autores lo aplicaron a otros juegos de información oculta y reportó rendimiento superhumano en todos: en la variante Barrage Stratego venció series de 50 partidas contra campeones mundiales; en Hanabi (juego cooperativo de cartas) marcó nuevos récords en cada variante, y en la versión de dos jugadores usó dos órdenes de magnitud menos cómputo que el líder previo; en Dou dizhu (cartas chino) venció a los benchmarks PerfectDou y DouZero.

El paper cierra con una afirmación ambiciosa: «grandes cantidades de información oculta ya no son un obstáculo para el aprendizaje por refuerzo y la búsqueda». Los propios autores nombran tres campos donde esto puede aterrizar: mercados financieros, conflictos militares y negociaciones. «En las tareas de información imperfecta que enfrentarías en la realidad, no tienes el lujo de enumerar todas las posibilidades. Hay demasiadas. Tener algoritmos de propósito general que rindan tan bien es un gran paso adelante», dijo Farina a MIT News.

Los autores también son francos sobre las limitaciones. El sistema no escala solo con más cómputo, porque la búsqueda imita un único paso de aprendizaje; haría falta un método de búsqueda más sofisticado para seguir mejorando. Y queda pendiente construir interpretabilidad: «los humanos deben tener la última palabra sobre si se sigue una recomendación», según el paper.

Qué significa esto para tu startup

1. Repensar los benchmarks de cómputo. Que un equipo académico entrene un agente superhumano en 16 GPUs y una semana, frente al arsenal de DeepMind, sugiere que la eficiencia algorítmica vale tanto como el presupuesto de infraestructura. Antes de comprar más GPUs, conviene auditar si el pipeline podría mejorar con cambios en regularización, sampling o simulador.

2. La información imperfecta dejó de ser terreno vedado para el RL. Si el producto lidia con escenarios de bluff, negociación, priorización de leads, fraude, pricing dinámico o subastas internas, esta arquitectura —self-play + belief network + planning en tiempo de decisión— es un patrón a estudiar. La pregunta útil para el próximo sprint: ¿qué parte del problema tiene estructura de «información oculta que se revela parcialmente en cada interacción»?

3. Mantener humanos en el loop en áreas sensibles. Los propios autores subrayan que «los humanos deben tener la última palabra». Si Ataraxos funciona en Stratego, también puede funcionar en mercados y conflictos, pero la interpretabilidad todavía no está resuelta. Cualquier despliegue en finanzas, defensa o seguros necesita un humano con poder real de veto.

Conclusión

Stratego cierra una era. Lo que DeepMind no pudo comprar con millones, un equipo universitario lo resolvió con US$8.000 y un simulador custom en GPU. El resultado no es solo una victoria deportiva: es la prueba de que los problemas con mucha información oculta —los más parecidos al mundo real— dejaron de ser inalcanzables para el aprendizaje por refuerzo. Para los founders, la lección es concreta: la próxima generación de productos inteligentes no la van a hacer quienes más cómputo tengan, sino quienes mejor entiendan la estructura del problema.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...