GPT-6 Astra: el lanzamiento con el que OpenAI busca recuperar la corona de la IA
OpenAI lanzó el 2 de septiembre de 2026 GPT-6 Astra, su nuevo modelo insignia, con un despliegue escalonado: primero a un grupo reducido de organizaciones, y en los días siguientes a usuarios de ChatGPT Plus, Pro, Business y Enterprise, además de la API de OpenAI, AWS Bedrock y Microsoft Azure, según la cobertura de Latent Space. En menos de 9 horas, la publicación sumaba 36 millones de vistas y 164 mil likes,convirtiéndose en el lanzamiento más exitoso de OpenAI desde Sora y, con diferencia, el de mayor tracción social para un modelo de lenguaje.
El movimiento llega en plena guerra de modelos con Anthropic, que apenas unas horas antes había presentado Claude Fable 5.1 y Mythos 5.1 con un recorte de precios de alrededor del 25% en cargas estándar, según CryptoBriefing. La jugada de OpenAI es directa: responder al momento dulce de Anthropic con un modelo que, sobre el papel, vuelve a poner a OpenAI en cabeza en casi todos los benchmarks comparables.
Qué dice OpenAI sobre Astra
En el comunicado oficial, OpenAI describe a Astra como su modelo "más inteligente y mejor alineado hasta la fecha", y resume la propuesta con una frase: "Anything you can do on a computer, Astra can do for you. Fast." Las áreas que la propia compañía destaca son:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Computer use y software engineering de última generación
- Avances en matemáticas y ciencias, con contribución a problemas abiertos de huecos entre primos
- Documentos, hojas de cálculo y presentaciones que siguen plantilla y estilo
- Ciberseguridad reforzada con monitoreo y salvaguardas
El precio de la API quedó en US$10 por millón de tokens de entrada y US$50 por millón de tokens de salida en modo estándar, y US$20 / US$100 en modo fast, que ofrece hasta 2,5 veces más velocidad al doble de coste, según recoge Latent Space y confirma Geeky Gadgets.
Los benchmarks: dónde Astra gana y dónde la historia es más turbia
La tabla comparativa que circuló junto al lanzamiento muestra a Astra por delante de Claude Fable 5.1, Claude Fable 5 y Claude Opus 5 en casi todas las pruebas. Los números más citados, publicados por Next Big Future y OfficeChai:
- ARC-AGI-3: Astra 98,6% frente a Opus 5 con 30,2% (Fable 5.1 sin puntuación pública)
- FrontierMath Tier 4 (v2): Astra 97,6% vs Fable 5.1 87,8% y Opus 5 73,2%
- AutomationBench: Astra 41,4% vs Fable 5.1 31,4% y Fable 5 17,4%
- Terminal-Bench Science 0.1: Astra 64,6% vs Fable 5.1 52,6%
- BenchCAD: Astra 95,9% vs Fable 5.1 84,3%
- DeepSWE v1.1: Astra 74,1% vs Fable 5.1 67,4% (Gemini 3.8 Flash logra 73,7%)
- ExploitBench: Astra 100% vs Opus 5 70%
- HealthBench Professional (ajustado): Astra 63,4% vs Fable 5 60,9%
En paralelo, Artificial Analysis publicó una lectura más matizada: Astra alcanza 67 en su Coding Agent Index (empatando con Opus 5 y Fable 5, solo superada por Fable 5.1 con 70), pero en el Intelligence Index se queda en 61, 5 puntos por debajo de Fable 5.1 con fallback. La conclusión de Artificial Analysis es incómoda para la narrativa de "dominación total": Astra es 70% más eficiente en tokens que GPT-5.6 Sol en coding, pero su precio por token es 2,5 veces mayor, lo que termina costando 75% más por tarea a esfuerzo máximo. François Chollet, autor de ARC-AGI, también matizó: con un harness de conversación continua, Astra roza el 100% en ARC-AGI-3, pero a un coste aproximado de US$360 por partida.
En la frontera del razonamiento formal, Astra marcó un nuevo récord en el ECI de Epoch AI (169, frente a 163 previo) y resolvió 2 de 68 problemas Erdős no resueltos, ningún modelo anterior había logrado ninguno, según Epoch AI. OpenAI también destaca contribuciones a la conjetura de los huecos entre primos: mejoras en el peor caso documentadas por investigadores como Mehtaab Sawhney y Weijie Su, con formalizaciones en Lean.
Computer use, el verdadero campo de batalla
Más allá de los números, la apuesta central de Astra es convertir el uso del ordenador en capacidad de producto, no en demo. En simulaciones de latencia sobre OSWorld 2.0, Astra logra 72,6% en unos 40 minutos por tarea, frente al 65,7% de GPT-5.6 Sol en alrededor de 75 minutos, según datos que reproduce Craving Tech. Esto significa que el modelo puede rellenar formularios, actualizar CRMs, correr QA de frontend, analizar datos científicos o gestionar calendarios sin supervisión constante.
La API incluye además novedades relevantes para quien construye agentes:
- Llamadas a funciones asíncronas para no bloquear el avance del modelo
- Mensajes a mitad de turno ("mid-turn steering") que se inyectan en el razonamiento
- Cambio de esfuerzo de razonamiento sin romper la caché
- Compaction nativa y notas de contexto persistentes en la Responses API
En el caso de Canva, uno de los primeros socios en acceso temprano, el modelo navegó un repositorio con más de 80 millones de líneas de código y ejecutó más de mil consultas contra su data warehouse recurriendo a 21 fuentes internas, según describe Danny Wu, Head of AI Products de la empresa, en Craving Tech.
El elefante en la sala: monitorabilidad y seguridad
El lanzamiento llegó con un system card que abrió un debate técnico serio: Astra logra mejor alineación superficial, pero su chain-of-thought es cada vez menos legible. UK AISI midió que el horizonte de tareas sin CoT pasó de 3,6 minutos en GPT-5.6 Sol a 30,9 minutos en Astra, y la controllability del CoT subió del 48% al 93%, pero los resúmenes de razonamiento pueden faltar hasta en el 80% de trayectorias cibernéticas largas, según recoge Latent Space.
Para investigadores como Neel Nanda y Ryan Greenblatt, perder la capacidad de monitorear el razonamiento es "una tragedia potencial" que podría dejar de ser viable como herramienta de oversight en pocas generaciones. Tomek Korbak lo resume así: Astra es más obediente y menos alucinante, pero a costa de menos superficie de inspección. La propia OpenAI clasifica a Astra como el primer modelo en alcanzar el nivel "Critical" de ciberseguridad bajo su Preparedness Framework, con 100% en ExploitBench y dos zero-days descubiertos durante la evaluación, que la compañía asegura estar reportando a los maintainers.
Daybreak: la jugada geopolítica y de mercado
El mismo día del lanzamiento, OpenAI anunció un compromiso de US$1.000 millones en créditos para acceder a sus modelos Daybreak (Blue y Red), formación y soporte técnico, dirigido a quienes defienden sistemas de agua y saneamiento, la red eléctrica, gobiernos estatales y locales, bancos comunitarios, ONGs y proyectos open source. Los créditos deben consumirse en seis meses, según Help Net Security. El programa se pilotará con MS-ISAC y una red de más de 35 productos y servicios de partners. OpenAI ya había trabajado con utilities afectadas por ataques recientes a sistemas de agua en EE. UU. con hasta US$1 millón en créditos por estado.
¿Qué significa esto para tu startup?
Para founders y product managers hispanohablantes, este lanzamiento cambia tres reglas de juego prácticas:
- El coste por tarea sustituye al coste por token. Astra cobra más por token, pero como consume muchos menos tokens por tarea completada, en DeepSWE v1.1 lo hace a un coste estimado 57% menor por tarea que GPT-5.6 Sol. Si tu producto depende de flujos agénticos largos, prueba siempre con métrica de coste por tarea finalizada, no por token consumido.
- Computer use ya es producto, no demo. Con OSWorld 2.0 en 72,6% a 40 minutos por tarea, automatizar QA de frontend, rellenar formularios o actualizar CRMs pasa de "experimento" a "feature que puedes vender". Empieza por mapear los 3-5 flujos más repetitivos de tus clientes y mide con Astra en producción durante una semana antes de comprometerte.
- La frontera competitiva se ha movido. Fable 5.1 sigue siendo el rival a batir en mergeable code quality según varios analistas, y Gemini 3.8 Flash arañó a Astra en DeepSWE. Diseña tu stack multi-modelo desde el día uno: enrutar a Astra para computer use y razonamiento formal, a Fable 5.1 para code review complejo y a Gemini 3.8 Flash para cargas latencia-sensibles puede ser la diferencia entre quemar caja y escalar margen.
Conclusión
GPT-6 Astra es la respuesta más agresiva de OpenAI en 18 meses, un modelo que combina liderazgo en benchmarks, una historia de computer use creíble y un movimiento estratégico en ciberseguridad con el programa Daybreak. La narrativa de "AGI" se ha fragmentado más: para OpenAI es "salto generacional"; para Anthropic, su Fable 5.1 sigue siendo la referencia en calidad de código; para los investigadores de seguridad, el problema real no es la capacidad, es la monitorabilidad. Para el founder, la decisión inmediata es menos filosófica: cómo aprovechar el salto agéntico sin quedar atrapado en una sola nube, un solo modelo ni una sola métrica de coste.
Fuentes
- AINews: GPT-6 Astra: OpenAI's biggest LLM launch of all time (Latent Space)
- ChatGPT 6 Officially Launches as Astra (Geeky Gadgets)
- GPT-6 Astra is OpenAI's boldest model yet (Craving Tech)
- OpenAI launches GPT-6 Astra (Moneycontrol)
- OpenAI GPT 6 Astra Limited Release that Beats Anthropic Fable 5.1 (Next Big Future)
- OpenAI's GPT-6 Astra Seems To Comfortably Beat Fable 5.1 (OfficeChai)
- OpenAI claims it has overtaken Anthropic with latest AI model (CryptoBriefing)
- OpenAI is putting $1 billion behind Daybreak for defenders (Help Net Security)
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













