OpenAI lanza GPT-6 Astra: supera a Claude Fable 5.1 en benchmarks

OpenAI acelera el lanzamiento de GPT-6 Astra

El 3 de septiembre de 2026, OpenAI empezó a desplegar GPT-6 Astra, primero a un grupo reducido de organizaciones y, en los días siguientes, a todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, además de la API de OpenAI y AWS, según el análisis publicado por Simon Willison en su link blog. El precio en la API es de US$10 por millón de tokens de entrada y US$50 por millón de tokens de salida, idéntico al de Claude Fable 5.1 y a Claude Mythos 5.1 de Anthropic — un movimiento que deja a ambos modelos frontera empatados en costo por token, y obliga a competir por capacidad, fiabilidad y coste total por tarea completada.

El lanzamiento se da apenas dos días después de que Anthropic presentara Fable 5.1 y el modelo restringido Mythos 5.1, según Unite.ai, y consolida un 2026 donde la carrera entre los dos laboratorios se mide por semanas, no por meses.

Qué dicen los benchmarks publicados por OpenAI

El reporte recopilado por NextBigFuture a partir de la tabla filtrada con la nota de prensa de OpenAI muestra a Astra por delante de Fable 5.1, Fable 5 y Opus 5 en casi todas las pruebas comparables:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • ARC-AGI-3: Astra alcanza 98,6%, frente al 30,2% de Opus 5 (high reasoning). Anthropic aún no ha publicado resultados para Fable 5 ni Fable 5.1.
  • FrontierMath Tier 4 (v2): 97,6% para Astra, contra 87,8% de Fable 5.1/Fable 5 y 73,2% de Opus 5.
  • AutomationBench: 41,4% para Astra frente a 31,4% de Fable 5.1.
  • Terminal-Bench Science 0.1: 64,6% para Astra frente a 52,6% de Fable 5.1, una prueba que Anthropic había presentado como fortaleza de su nuevo modelo.
  • BenchCAD: 95,9% frente a 84,3% de Fable 5.1.
  • ExploitBench: 100% para Astra frente a 70% de Opus 5; Anthropic no publicó número para Fable.
  • Agents’ Last Exam: 59,3% para Astra frente a 52,7% de Opus 5 y 48,7% de Fable 5.

Simon Willison destaca que Astra logra además 100% en ExploitBench, 42,4% en ExploitGym (frente a 30,3% de GPT-5.6 Sol) y 99,2% en SRE-Bench binary reverse engineering en cuatro intentos, frente a 68,7% de Sol. En contexto largo, según el mismo análisis, Astra consigue 100% en la prueba de ocho agujas de OpenAI entre 256K y 512K tokens, y 96,3% entre 512K y 1M tokens — un resultado que, si se replica de forma independiente, podría acercar el modelo a uno de los problemaspersistentes de los LLMs: mantener precisión con ventanas enormes.

La advertencia sobre el harness de ARC-AGI-3

El resultado estrella de Astra — 99,9% en ARC-AGI-3 — merece una lectura cuidadosa. Simon Willison señala que ese puntaje se obtuvo con el Provider Adapter harness de OpenAI, un arnés que preserva estado de razonamiento opaco entre peticiones y aplica compactación en conversaciones largas para reutilizar trabajo previo. Con el harness por defecto del benchmark, OpenAI alcanzó 62,7% gastando US$26K, frente a 99,9% por US$19K en el harness propietario.

OfficeChai refuerza la cautela: Nvidia también logró 100% en el set público de ARC-AGI-3 usando Claude Opus 5 como modelo subyacente y un sistema propio de scaffolding (AVO), lo que demuestra que una parte importante del puntaje depende del arnés, no solo del modelo. Comparar cifras entre proveedores sin igualar el andamiaje «no es estrictamente comparar peras con peras», concluye el medio.

Dónde Fable 5.1 sigue siendo referente (y dónde no)

El Artificial Analysis Intelligence Index sigue coronando a Claude Fable 5.1 con 66 puntos (max con fallback), tres puntos por encima de Claude Opus 5, según OfficeChai. Astra aparece empatada con GPT-5.6 Sol en 61 puntos, 5 puntos por debajo de Fable 5.1 y detrás también del recién lanzado Muse Spark 1.3 (max) de Meta.

Donde Astra sí lidera es el Coding Agent Index de Artificial Analysis: a máximo esfuerzo, Astra cuesta prácticamente lo mismo que GPT-5.6 Sol (max) y suma 2 puntos más en el índice, mientras que por tarea terminada sale a menos de la mitad que Claude Fable 5, según Simon Willison. Para founders pagando por workflows agénticos completos, ese dato pesa más que cualquier puntaje aislado.

En AA-Omniscience, Fable 5.1 fija el récord de precisión de Artificial Analysis con 67,2%, pero lo logra intentando 93,4% de las preguntas (frente a 87,8% de Opus 5). Esa mayor agresividad se traduce en más alucinaciones entre las respuestas fallidas, un trade-off de fiabilidad clave para casos enterprise, según 24/7 Wall St.

«Welcome to the AGI era»: la narrativa de OpenAI

El presidente de OpenAI, Greg Brockman, cerró la llamada de prensa con un “Welcome to the AGI era” y afirmó que, en su opinión, la compañía podría haber alcanzado AGI con este modelo, según Business Insider. OpenAI describe a Astra como «el modelo más inteligente y alineado del mundo» y un «cambio de nivel en trabajo profesional», y asegura que puede rellenar formularios, dar formato a documentos, agendar citas y operar software de forma autónoma.

La propia OpenAI reconoció en la nota de prensa que retrasó el lanzamiento a septiembre para reforzar las salvaguardas de ciberseguridad: el modelo es el primero que cruza el umbral «Critical» del Preparedness Framework, con 100% en ExploitBench y un test interno de alineación donde nunca intentó evadir sus propios checks automáticos (contra un 0,29% de intentos en GPT-5.6 Sol).

¿Qué significa esto para tu startup?

Hay tres decisiones prácticas que cambian esta semana en cualquier startup que trabaje con LLMs:

  • Replantear el coste total por tarea, no por token. Con el mismo precio por token entre Fable 5.1 y Astra, la diferencia se mueve al coste por tarea completada. Como referencia, Astra termina tareas de DeepSWE v1.1 a alrededor del 57% del coste de GPT-5.6 Sol y a menos de la mitad del coste de Claude Fable 5 para la misma puntuación en el Coding Agent Index, según Simon Willison. Reescribe tus estimaciones internas (benchmarking interno, coste por run, coste por lead, coste por ticket resuelto) antes de renovar contratos.
  • Probar Astra especialmente en código agéntico y seguridad. 100% en ExploitBench, 99,2% en SRE-Bench binary RE, líder en Coding Agent Index según Artificial Analysis: si tu producto depende de agentes que ejecutan código, depuran o hacen pentesting en sandboxes, vale la pena un piloto. Acciones concretas: (1) monta un test ciego con tus tres cargas internas críticas (PR review, generación de tests, resolución de tickets) y mide tasa de éxito, intentos y coste por tarea; (2) si trabajas en cybersecurity, evalúa Astra antes que Fable 5.1, porque Anthropic no publicó número comparable en ExploitBench.
  • No comprar la narrativa AGI al pie de la letra, pero sí planificar el salto. «Welcome to la era de la AGI» es una declaración de marketing, no un benchmark reproducible. Lo que sí es real, según Business Insider, es que Astra mejora de forma notable las capacidades de computer use — rellenar formularios, operar software, agendar tareas — algo que hasta ahora era lento e inseguro. Si tu roadmap depende de agentes que tocan software de escritorio o navegar web, vale la pena empezar a diseñar el producto asumiendo que ese eslabón se vuelve fiable en los próximos seis a doce meses.

Conviene recordar tres caveats antes de elegir proveedor: los números ARC-AGI-3 están inflados por el harness propietario de OpenAI (62,7% con el harness estándar), Fable 5.1 sigue arriba en el Intelligence Index de Artificial Analysis, y Fable 5.1 alucina más pero acierta más que sus antecesores. Una evaluación propia, no un titular, sigue siendo la mejor guía.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...