GPT-6 Astra logra 99,9% en ARC-AGI-3 y supera a humanos

GPT-6 Astra arrasa en ARC-AGI-3: los números que importan

El modelo GPT-6 Astra de OpenAI obtuvo un 62,7% en ARC-AGI-3 Semi-Private con el harness estándar, a un costo de US$26.098 por corrida, según los resultados publicados por la ARC Prize Foundation el 3 de septiembre de 2026. Cuando se le permitió usar su Provider Adapter harness —el andamiaje nativo de OpenAI que preserva el estado de razonamiento opaco entre llamadas y aplica compactación de contexto— el mismo modelo saltó hasta un 99,9% con un costo de US$19.302. Ambos son récords del estado del arte para el benchmark, según la ARC Prize.

Para poner esa cifra en contexto: en julio de 2026, Claude Opus 5 de Anthropic había marcado el récord anterior con un 30,2% en ARC-AGI-3, casi cuadruplicando el 7,8% que ostentaba GPT-5.6 Sol. En otras palabras, Astra pasó de un techo del 30% a un 99,9% en menos de dos meses y en el mismo benchmark donde la mayoría de los modelos frontera todavía arañaba el dígito porcentual a principios de 2026.

Dos harnesses, dos preguntas distintas

ARC Prize evalúa a los modelos con dos configuraciones que responden a preguntas diferentes. El harness estándar ofrece una interfaz mínima, neutra del proveedor: el modelo recibe toda la información necesaria para resolver cada juego, pero es responsable de decidir qué preservar en sus notas visibles. Es la vara con la que un benchmark “apples-to-apples” se puede comparar entre proveedores.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El Provider Adapter harness, en cambio, deja que el modelo use las funciones de gestión de contexto que su propio proveedor diseñó. Para Astra esto significa preservar el estado de razonamiento opaco entre peticiones y aplicar compactación para conversaciones largas. La diferencia es brutal: los resultados del Provider Adapter fueron 3,66 veces más rápidos por tiempo total transcurrido y consumieron 49% menos tokens en los 167 pares juego-razonamiento que ambos harnesses resolvieron.

La ARC Prize ya anunció que, de aquí en adelante, reportará ambos resultados en el leaderboard, con cada condición claramente etiquetada. El matiz importa: comparar un modelo en su harness nativo contra otro en el estándar no es comparar peras con manzanas.

La hazaña que sí cambia el tablero: eficiencia de acción

Más allá de los porcentajes, el hallazgo que ARC Prize subraya es otro: Astra superó la línea base humana en eficiencia de acción en el 96% de los niveles del benchmark y usó 51,7% menos acciones por nivel en promedio. En el harness Provider Adapter, requirió menos acciones que la mediana de los humanos que completaron cada nivel.

Esto es conceptualmente distinto a simplemente “resolver el problema”. ARC-AGI-3 penaliza con severidad a los agentes que exploran de más: su métrica central, RHAE (Relative Human Action Efficiency), eleva al cuadrado la razón entre las acciones humanas y las del modelo. Si un humano tarda 10 acciones y la IA tarda 100, el modelo obtiene apenas 1%. Solo quien forma un modelo mental rápido del entorno y ejecuta sobre ese modelo consigue un puntaje significativo.

El dato compara con lo que ARC Prize pagó a sus testers humanos durante la calibración: US$115 por sesión de 90 minutos, más US$5 por juego completado, con unos 9 juegos intentados por sesión — un costo aproximado de US$12,78 por juego intentado antes de bonificaciones. Llevado al extremo, el consumo metabólico cerebral (asumido a 20 W y US$0,20/kWh) baja el equivalente monetario a 0,067 centavos por juego, una cifra que ARC Prize ofrece como referencia y no como comparación justa: la mayor parte de ese pago humano remunera el tiempo y la disposición, no la energía del cerebro.

Notación algebraica propia: el idioma que Astra se inventó

El análisis cualitativo de las replays es, para founders, la parte más jugosa. Cuando Astra se enfrenta a un entorno nuevo, lo destila en un modelo simbólico compacto, parecido a código, en el que registra posiciones de objetos, longitudes de mecanismos, planes multi-paso y mapeos de operaciones a coordenadas.

Los ejemplos que ARC Prize transcribió son reveladores. En un nivel registró L8: hub q2 (8↓). Lengths: 14=1… para anotar el nivel, un índice de rotación local y longitudes de mecanismos. En otro construyó planes como extend8 to3; retract10 to2; shorten8 to1 para secuenciar cambios en mecanismos de colores 8 y 10. Mapeó controles con notación tipo 9−=(39,4), rotate=(49,18), 14+=(59,11). Y llevó un contador de turnos más posición y orientación con Turn 5: P=(24,20), empty, facing west.

ARC Prize lo describe como un atajo algebraico sobre la marcha, no como un lenguaje de programación completo. Otros modelos frontier ya mostraron comportamiento similar, pero las notas de Astra se distinguieron por su precisión y densidad de información.

Herramientas a medida: cuando el agente programa sus propias utilidades

Con el harness PRO-LONG —un entorno de red-teaming de ARC-AGI-3 donde Astra tuvo acceso a un sandbox para ejecutar código— el modelo fue más lejos: creó un conjunto de herramientas por juego. En tu93, un laberinto con guardias y patrullas, Astra empezó con navegación y construyó maze_solver.py. Después añadió reglas de combate en combat_solver.py, modeló las patrullas móviles en patrol_solver.py y usó sync_state.py para chequear sus predicciones contra observaciones reales.

ARC Prize aclara que PRO-LONG representa condiciones de evaluación distintas a las del testing humano controlado —los participantes humanos no tenían intérprete de código ni scratch pad—, así que sus resultados deben leerse como el rendimiento combinado del modelo y sus herramientas. Aun así, la implicación es directa: el modelo sabe cuándo merece la pena parar y escribir una utilidad en lugar de improvisar paso a paso.

¿Qué significa esto para tu startup?

Para un founder técnico, este anuncio no es una curiosidad de laboratorio. Cambia el cálculo de qué automatizar y qué delegar a un agente.

  • El costo por tarea cae más rápido que el costo por token. OpenAI ya empuja a pensar en “precio por tarea completada” y no por token: en DeepSWE v1.1, la mejor configuración de Astra supera a la mejor de GPT-5.6 Sol con un costo por tarea estimado 57% menor, según tablas publicadas en la cobertura del lanzamiento. ARC-AGI-3 es otro ejemplo: 99,9% con Provider Adapter por US$19.302 contra US$26.098 del harness estándar, resolviendo más.
  • Los agentes con memoria implícita (provider-side) ganan a los agentes “desde cero” en cada llamada. Si construyes sobre la API estándar, subestimas el rendimiento real de Astra. Diseña tus flujos de producción para que el estado de razonamiento se preserve entre llamadas; el delta puede ser de 3,66× en velocidad y 49% en tokens.
  • Habilidades que parecían imposibles hace un año ya son commodity. En marzo de 2026, los mejores modelos frontera no superaban el 0,37% en ARC-AGI-3 y los humanos resolvían el 100%. Seis meses después, un modelo open-source-adyacente rompe la paridad humana en eficiencia. Lo que hoy es frontera, en 12 meses será línea de base para tu próximo MVP.
  • El mercado paga por agentes, no por chatbots. MarketsandMarkets estima que el mercado de IA agentica pasará de US$19.330 millones en 2026 a US$205.880 millones en 2033, con un CAGR de 40,2%. El segmento de TI y BPO es el de mayor crecimiento. Para una startup, eso significa que vender herramientas para construir, gobernar o auditar agentes es una tesis con viento a favor, no de nicho.

Conclusión

ARC-AGI-3 fue diseñado para que un agente descubriera, sin instrucciones, las reglas de un entorno nuevo y resolviera el juego con la eficiencia de un humano. GPT-6 Astra no solo lo logra: en la mayoría de los niveles lo hace con menos acciones que la mediana humana. Es el primer modelo que cruza esa línea de forma sistemática en este benchmark, y lo consigue con un comportamiento emergente —notación algebraica propia, herramientas a medida— que sugiere algo más profundo que “más cómputo”.

ARC Prize, eso sí, se cuida de no vender AGI: el benchmark tiene un alcance acotado, mecánicas deterministas y entornos cerrados. Saturar la prueba no equivale a AGI, recuerda la fundación. Pero para founders que ya están integrando agentes en sus productos, la pregunta práctica es otra: ¿tu stack actual está diseñado para aprovechar el estado de razonamiento persistente, o todavía lanza cada tarea desde cero?

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...