Good Start Labs: entrenar IA con juegos mejora finanzas

Un modelo de 30B aprendió en 1830 y mejoró en finanzas

En un experimento reciente, Good Start Labs, una startup fundada por Alex Duffy y Tyler Marques, entrenó un modelo de 30 mil millones de parámetros dentro del juego de mesa 1830: The Game of Railroads and Robber Barons, publicado originalmente en 1986, y luego lo evaluó en tareas de investigación financiera. Solo el diseño con un agente que usaba herramientas para explorar el entorno mejoró los resultados en el benchmark Finance-Agent; el entrenamiento de pregunta-y-respuesta sobre el estado del juego mejoró la jugada dentro del tablero pero no se trasladó afuera. Es la primera evidencia pública de la propia empresa de que las habilidades adquiridas en un juego pueden transferirse a una tarea estructuralmente parecida fuera del juego.

La cifra importa porque confirma una hipótesis que el sector lleva meses discutiendo: los entornos verificables — juegos, simulaciones, sandboxes — son una vía realista para entrenar capacidades nuevas en los modelos frontier, no solo para ponerlos a prueba.

¿Qué hace exactamente Good Start Labs?

La compañía fue escindida de Every, el medio y estudio de herramientas de IA, en octubre, con US$3,6M de financiamiento de General Catalyst, Inovia, Every e inversores ángel. Su producto principal son datos y entornos de aprendizaje que vende a laboratorios frontier.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Lo que entrega se divide en dos líneas, según explicó Duffy en una entrevista en Latent Space:

  • Trayectorias de agentes jugando juegos: registros de qué observó el agente, qué decidió, qué acciones tomó y qué pasó después. Sirven como datos de reinforcement learning para entrenar otros modelos.
  • Entornos completos: juegos enteros donde un modelo puede jugar de principio a fin. El motor del juego funciona como fuente verificable de recompensas, y los modelos resuelven problemas usando ese motor aunque la forma de resolverlos no sea la obvia.

La tercera pata, más reciente, son datos personalizados para publishers de juegos: agentes que corren dentro de juegos comerciales ya publicados y generan interacciones útiles para entrenar y evaluar modelos, anonimizadas y sin datos personales.

Por qué un juego de Diplomacy cambió el plan

La idea no surgió de un paper sino de un stream. En 2025, alguien transmitió por Twitch partidas de modelos frontier jugando Diplomacy — un juego de negociación que normalmente toma "días o semanas" por turno, según Duffy. Ahí notó dos cosas que se volverían centrales para la tesis de la empresa:

  • El modelo de OpenAI (o3 en ese momento) ganaba todas las partidas planificando una traición futura.
  • El modelo de Anthropic (Claude Opus 4) se negaba a mentir y, en sus palabras, "quedaba destruido".

Esa observación — que distintos frontier models muestran "ejes de personalidad" diferentes cuando se enfrentan a escenarios de juego, como la traición, la colaboración o la teoría de la mente — es la que Duffy llevó consigo al fundar Good Start Labs. "Se volvió realmente claro que los entornos de reinforcement learning eran una de las formas más confiables de enseñar a los modelos cualquier cosa que pudieras verificar", dijo en la entrevista.

El siguiente paso fue probar si ese aprendizaje se quedaba dentro del juego o salía. El paper interno que resume el experimento con 1830 concluye que mejoraron el uso de herramientas en downstream y que el agente entrenado con un harness terminal mantuvo su ventaja en la tarea de finanzas, mientras que el entrenamiento de una sola vuelta no lo hizo.

El paper COS-PLAY y la idea del "entorno como currículum"

Duffy y Marques son co-autores de COS-PLAY: Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks, un paper escrito con investigadores de varias universidades. El sistema propuesto da a un agente decisor acceso a un banco de habilidades aprendible que guía la acción, y un segundo agente estudia la trayectoria y modifica ese banco entre corridas. La idea es que el currículum mismo evolucione con el modelo.

En la entrevista, Duffy resumió la pregunta de fondo de la empresa en una frase: "¿Cómo se diseña un entorno de aprendizaje para enseñar capacidades específicas?". Y agregó una advertencia que suele olvidarse: el diseño del harness — cómo se le presenta el problema al modelo, en texto natural, en imágenes o en Python — cambia por completo lo que el modelo puede aprender.

Qué cambia con los modelos más nuevos

Le preguntaron a Duffy si los modelos más recientes — Claude Fable 5.1 y GPT-6 Astra — ya vienen tan bien entrenados que el entorno y el harness importan menos. Su respuesta fue directa: "Un modelo más capaz necesita menos mano guía para terminar la misma tarea, sin duda". Pero añadió que, justamente porque Good Start Labs trata "el entorno como currículum", el harness "importa más, no menos".

Puso un ejemplo concreto: "GPT-6 Astra reporta hacer menos chain-of-thought y saltar a la respuesta. Si quieres que un modelo trabaje de cierta forma mientras resuelve un problema, el harness es lo que lo fuerza. Astra probablemente puede hacer el cálculo en su cabeza, pero preferís que use código para poder confiar en el resultado".

El contexto: por qué los entornos de RL están de moda

Good Start Labs no está sola en esta tesis. Tres señales de los últimos meses muestran que el entrenamiento por refuerzo en entornos se está volviendo una categoría de inversión propia:

  • Bespoke Labs levantó US$40M en total — US$31,75M en una Serie A liderada por Wing VC, con Mayfield, The House Fund y empleados de Anthropic, más US$8,25M previos en los que participó Jeff Dean, científico jefe de Google DeepMind, según reportó SiliconANGLE el 6 de julio. La empresa vende una plataforma para generar entornos de RL con automatización y expertos humanos.
  • Richard Sutton, coinvestigador principal de The Bitter Lesson y ganador del Turing 2024 junto a Andrew Barto, dejó Keen Technologies (la startup de John Carmack) para fundar Oak Lab con Khurram Javed, según The Next Web. El laboratorio publicó un primer paper con una variante neuronal de su algoritmo IDBD que aprende de flujos de experiencia sin almacenar datos, con el objetivo declarado de entrenar un agente de un billón de parámetros consumiendo 20 vatios.
  • Ineffable Intelligence, fundada a fines de 2025 por David Silver (líder del equipo de RL en Google DeepMind, coinventor de AlphaGo), cerró en abril una ronda semilla récord de US$1.100M co-liderada por Sequoia y Lightspeed, con Nvidia, DST Global, Index, Google y el fondo soberano de IA del Reino Unido, reportó CNBC. La empresa anunció el 13 de mayo una alianza de ingeniería con Nvidia para construir infraestructura de RL a gran escala sobre chips Grace Blackwell y la plataforma Vera Rubin.

El patrón es claro: los nombres más pesados del reinforcement learning clásico están creando empresas nuevas alrededor de la idea de que la experiencia en entornos supera al dataset estático. Good Start Labs aplica esa tesis a un subconjunto muy concreto — juegos de mesa — donde la verificación del éxito es trivial y barata.

Qué dice la evidencia — y qué no

Cuando le preguntaron qué se puede afirmar hoy con respaldo, Duffy contestó: "La evidencia de hoy respalda con bastante claridad que la ejecución orientada a objetivos importa, y que el razonamiento se transfiere". Citó dos referencias externas:

  • Un artículo reciente de Surge AI que muestra que el post-entrenamiento en trabajo de oficina mejoró coding.
  • DeepSeek R1, que según Duffy demostró esa transferencia de forma más amplia.

En sus propios experimentos repitieron el patrón dos veces: la tarea de finanzas con 1830 y el entrenamiento en Diplomacy que, según una publicación previa de Duffy en Every, "mejoró el rendimiento en benchmarks de soporte al cliente y operaciones industriales". Cada entorno que construyeron, agregó, también mejoró el uso de herramientas en downstream.

Lo que no está demostrado es la transferencia amplia y confiable a cualquier tarea del mundo real. La pregunta sigue abierta, y Duffy lo admite.

¿Qué significa esto para tu startup?

Si estás construyendo sobre LLMs y pensás que el prompt engineering o el fine-tuning con tus propios datos es la única frontera, este movimiento te queda lejos. Pero si tu producto depende de que un modelo ejecute tareas largas, use herramientas y no se rompa a la mitad, hay tres cosas concretas que podés mirar hoy:

  • Diseñá el problema como entorno, no como prompt. Si tu agente tiene que rellenar Excel, navegar una base de datos o ejecutar un workflow de varios pasos, pensá en cómo crear un sandbox verificable donde el modelo recibe recompensas por terminar la tarea, igual que en 1830. Es la diferencia entre entrenar al modelo y solo pedirle.
  • Preguntate qué harness necesitás. El propio Duffy dijo que GPT-6 Astra puede hacer el cálculo mental pero querés que use código para que el resultado sea auditable. Si tu producto exige trazabilidad — finanzas, legal, salud — forzá al modelo a usar herramientas explícitas, no a improvisar.
  • Comprá datos de trayectorias si podés. Good Start Labs vende exactamente eso a laboratorios frontier: registros de qué observó, decidió e hizo un agente, con su resultado. Para startups que entrenan modelos verticales, esta categoría de datos sintéticos verificables puede ser más barata y escalable que generar datos humanos. No es accesible para todos, pero vale saber que existe como opción estratégica.

Conclusión

La pregunta del titular — si las habilidades aprendidas en juegos se transfieren al trabajo real — tiene hoy una respuesta condicional: sí, cuando el diseño del entorno está pensado para que la habilidad sea reutilizable, y no cuando se entrena al modelo solo para ganar el juego. Good Start Labs puso un número a eso: en su experimento con 1830, solo el diseño con agente terminal, y no el de pregunta-y-respuesta, mejoró el benchmark financiero downstream. La tesis es estrecha pero verificable, y se apoya en una tendencia sectorial donde Sutton, Silver y los fundadores de Bespoke están moviendo cientos de millones en la misma dirección.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...