OpenAI acelera el lanzamiento de GPT-6 Astra
El 3 de septiembre de 2026, OpenAI empezó a desplegar GPT-6 Astra, primero a un grupo reducido de organizaciones y, en los días siguientes, a todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, además de la API de OpenAI y AWS, según el análisis publicado por Simon Willison en su link blog. El precio en la API es de US$10 por millón de tokens de entrada y US$50 por millón de tokens de salida, idéntico al de Claude Fable 5.1 y a Claude Mythos 5.1 de Anthropic — un movimiento que deja a ambos modelos frontera empatados en costo por token, y obliga a competir por capacidad, fiabilidad y coste total por tarea completada.
El lanzamiento se da apenas dos días después de que Anthropic presentara Fable 5.1 y el modelo restringido Mythos 5.1, según Unite.ai, y consolida un 2026 donde la carrera entre los dos laboratorios se mide por semanas, no por meses.
Qué dicen los benchmarks publicados por OpenAI
El reporte recopilado por NextBigFuture a partir de la tabla filtrada con la nota de prensa de OpenAI muestra a Astra por delante de Fable 5.1, Fable 5 y Opus 5 en casi todas las pruebas comparables:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- ARC-AGI-3: Astra alcanza 98,6%, frente al 30,2% de Opus 5 (high reasoning). Anthropic aún no ha publicado resultados para Fable 5 ni Fable 5.1.
- FrontierMath Tier 4 (v2): 97,6% para Astra, contra 87,8% de Fable 5.1/Fable 5 y 73,2% de Opus 5.
- AutomationBench: 41,4% para Astra frente a 31,4% de Fable 5.1.
- Terminal-Bench Science 0.1: 64,6% para Astra frente a 52,6% de Fable 5.1, una prueba que Anthropic había presentado como fortaleza de su nuevo modelo.
- BenchCAD: 95,9% frente a 84,3% de Fable 5.1.
- ExploitBench: 100% para Astra frente a 70% de Opus 5; Anthropic no publicó número para Fable.
- Agents’ Last Exam: 59,3% para Astra frente a 52,7% de Opus 5 y 48,7% de Fable 5.
Simon Willison destaca que Astra logra además 100% en ExploitBench, 42,4% en ExploitGym (frente a 30,3% de GPT-5.6 Sol) y 99,2% en SRE-Bench binary reverse engineering en cuatro intentos, frente a 68,7% de Sol. En contexto largo, según el mismo análisis, Astra consigue 100% en la prueba de ocho agujas de OpenAI entre 256K y 512K tokens, y 96,3% entre 512K y 1M tokens — un resultado que, si se replica de forma independiente, podría acercar el modelo a uno de los problemaspersistentes de los LLMs: mantener precisión con ventanas enormes.
La advertencia sobre el harness de ARC-AGI-3
El resultado estrella de Astra — 99,9% en ARC-AGI-3 — merece una lectura cuidadosa. Simon Willison señala que ese puntaje se obtuvo con el Provider Adapter harness de OpenAI, un arnés que preserva estado de razonamiento opaco entre peticiones y aplica compactación en conversaciones largas para reutilizar trabajo previo. Con el harness por defecto del benchmark, OpenAI alcanzó 62,7% gastando US$26K, frente a 99,9% por US$19K en el harness propietario.
OfficeChai refuerza la cautela: Nvidia también logró 100% en el set público de ARC-AGI-3 usando Claude Opus 5 como modelo subyacente y un sistema propio de scaffolding (AVO), lo que demuestra que una parte importante del puntaje depende del arnés, no solo del modelo. Comparar cifras entre proveedores sin igualar el andamiaje «no es estrictamente comparar peras con peras», concluye el medio.
Dónde Fable 5.1 sigue siendo referente (y dónde no)
El Artificial Analysis Intelligence Index sigue coronando a Claude Fable 5.1 con 66 puntos (max con fallback), tres puntos por encima de Claude Opus 5, según OfficeChai. Astra aparece empatada con GPT-5.6 Sol en 61 puntos, 5 puntos por debajo de Fable 5.1 y detrás también del recién lanzado Muse Spark 1.3 (max) de Meta.
Donde Astra sí lidera es el Coding Agent Index de Artificial Analysis: a máximo esfuerzo, Astra cuesta prácticamente lo mismo que GPT-5.6 Sol (max) y suma 2 puntos más en el índice, mientras que por tarea terminada sale a menos de la mitad que Claude Fable 5, según Simon Willison. Para founders pagando por workflows agénticos completos, ese dato pesa más que cualquier puntaje aislado.
En AA-Omniscience, Fable 5.1 fija el récord de precisión de Artificial Analysis con 67,2%, pero lo logra intentando 93,4% de las preguntas (frente a 87,8% de Opus 5). Esa mayor agresividad se traduce en más alucinaciones entre las respuestas fallidas, un trade-off de fiabilidad clave para casos enterprise, según 24/7 Wall St.
«Welcome to the AGI era»: la narrativa de OpenAI
El presidente de OpenAI, Greg Brockman, cerró la llamada de prensa con un “Welcome to the AGI era” y afirmó que, en su opinión, la compañía podría haber alcanzado AGI con este modelo, según Business Insider. OpenAI describe a Astra como «el modelo más inteligente y alineado del mundo» y un «cambio de nivel en trabajo profesional», y asegura que puede rellenar formularios, dar formato a documentos, agendar citas y operar software de forma autónoma.
La propia OpenAI reconoció en la nota de prensa que retrasó el lanzamiento a septiembre para reforzar las salvaguardas de ciberseguridad: el modelo es el primero que cruza el umbral «Critical» del Preparedness Framework, con 100% en ExploitBench y un test interno de alineación donde nunca intentó evadir sus propios checks automáticos (contra un 0,29% de intentos en GPT-5.6 Sol).
¿Qué significa esto para tu startup?
Hay tres decisiones prácticas que cambian esta semana en cualquier startup que trabaje con LLMs:
- Replantear el coste total por tarea, no por token. Con el mismo precio por token entre Fable 5.1 y Astra, la diferencia se mueve al coste por tarea completada. Como referencia, Astra termina tareas de DeepSWE v1.1 a alrededor del 57% del coste de GPT-5.6 Sol y a menos de la mitad del coste de Claude Fable 5 para la misma puntuación en el Coding Agent Index, según Simon Willison. Reescribe tus estimaciones internas (benchmarking interno, coste por run, coste por lead, coste por ticket resuelto) antes de renovar contratos.
- Probar Astra especialmente en código agéntico y seguridad. 100% en ExploitBench, 99,2% en SRE-Bench binary RE, líder en Coding Agent Index según Artificial Analysis: si tu producto depende de agentes que ejecutan código, depuran o hacen pentesting en sandboxes, vale la pena un piloto. Acciones concretas: (1) monta un test ciego con tus tres cargas internas críticas (PR review, generación de tests, resolución de tickets) y mide tasa de éxito, intentos y coste por tarea; (2) si trabajas en cybersecurity, evalúa Astra antes que Fable 5.1, porque Anthropic no publicó número comparable en ExploitBench.
- No comprar la narrativa AGI al pie de la letra, pero sí planificar el salto. «Welcome to la era de la AGI» es una declaración de marketing, no un benchmark reproducible. Lo que sí es real, según Business Insider, es que Astra mejora de forma notable las capacidades de computer use — rellenar formularios, operar software, agendar tareas — algo que hasta ahora era lento e inseguro. Si tu roadmap depende de agentes que tocan software de escritorio o navegar web, vale la pena empezar a diseñar el producto asumiendo que ese eslabón se vuelve fiable en los próximos seis a doce meses.
Conviene recordar tres caveats antes de elegir proveedor: los números ARC-AGI-3 están inflados por el harness propietario de OpenAI (62,7% con el harness estándar), Fable 5.1 sigue arriba en el Intelligence Index de Artificial Analysis, y Fable 5.1 alucina más pero acierta más que sus antecesores. Una evaluación propia, no un titular, sigue siendo la mejor guía.
Fuentes
- GPT-6 Astra (fuente original)
- OpenAI GPT 6 Astra Limited Release that Beats Anthropic Fable 5.1 on Benchmarks
- OpenAI’s GPT-6 Astra Seems To Comfortably Beat Fable 5.1 In Leaked Benchmarks
- OpenAI does a victory lap for its new AI model: ‘Welcome to the AGI era’
- Claude Fable 5.1 Scores Tops Artificial Analysis Intelligence Index With Score Of 66, Beats Opus 5 By 3 Points
- Anthropic Debuts Claude Fable 5.1 and Mythos 5.1 With Split Safeguards
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













