GPT-6 Astra controla brazos robóticos: 95% de éxito y la mitad de coste por tarea
GPT-6 Astra, el modelo insignia presentado por OpenAI el 3 de septiembre, colocó un bloque rojo dentro de un cuenco en 19 de 20 ensayos (95%) cuando se le dieron el control directo de dos brazos robóticos YAM, según la evaluación publicada por la organización sin fines de lucro RoboCurve. En el mismo entorno, Claude Fable 5.1 de Anthropic solo completó la tarea en 8 de 20 ensayos (40%), y su predecesor Claude Fable 5 apenas en 1 de 20 (5%), de acuerdo con la misma fuente.
La diferencia importa para cualquier fundador que esté evaluando qué modelo poner detrás de un agente que mueve cosas en el mundo real. No se trata de un benchmark más sobre responder preguntas: es el modelo emitiendo objetivos de movimiento 6-DoF, frame por frame, en hardware físico.
Qué se midió exactamente
RoboCurve ejecutó 120 ensayos (20 por modelo y por tarea) sobre brazos I2RT YAM bajo la misma política de agente definida por el framework open source Inspect Robots. En cada turno, el modelo recibía tres flujos de cámara (una cenital y dos montadas en la muñeca) más el estado propioceptivo, y emitía poses objetivo para el efector final que un solver de cinemática inversa traducía a comandos para los motores, según el reporte de RoboCurve.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLas dos tareas fueron:
- Bloque al cuenco: «Recoge el bloque rojo de la mesa y colócalo dentro del cuenco.» Tarea de manipulación gruesa, sin tolerancias ajustadas.
- Pieza de puzle en la ranura: «Recoge la pieza circular azul por el pomo de su centro y colócala en la ranura circular coincidente del tablero.» Tarea de precisión submilimétrica, con inserción física real.
Cada ensayo fue calificado por un evaluador humano en una rúbrica de cinco niveles (de 0 = «ningún acercamiento útil» a 4 = «colocado en posición final»), de modo que un fallo parcial también registra hasta dónde llegó el modelo.
Resultados en la tarea fácil: Astra aplasta a la competencia
Sobre el cuenco, la brecha fue grande. La fuente reporta una tasa de finalización 2,4 veces mayor que Fable 5.1, un coste por ejecución 2,3 veces menor y una latencia drásticamente reducida:
| Modelo | Finalizaciones | Tasa | Output tokens / ejecución | Coste / ejecución | Minutos / ejecución |
|---|---|---|---|---|---|
| Fable 5 | 1 / 20 | 5% | 19.200 | $2,69 | 8,2 |
| Fable 5.1 | 8 / 20 | 40% | 12.900 | $2,12 | 6,8 |
| GPT-6 Astra | 19 / 20 | 95% | 2.100 | $0,94 | 2,5 |
Datos del reporte de RoboCurve. El coste está calculado al precio de lista ($10 por millón de tokens de entrada y $50 por millón de salida), aunque la nota aclara que OpenAI cachea automáticamente cerca del 20% de los prompts de entrada, por lo que el gasto operativo real de Astra sería aún menor.
La eficiencia en tokens también fue notable. Astra usó 6,2 veces menos tokens de salida que Fable 5.1 y un 89% menos que Fable 5 en la misma tarea, una diferencia que se traduce en bucles de decisión más rápidos y costes unitarios mucho más bajos cuando se ejecutan miles de ensayos, según recoge el mismo reporte.
Resultados en la tarea de precisión: todos chocan en la misma pared
La segunda tarea cambió el guion. Insertar la pieza circular en la ranura apretada exige precisión submilimétrica, y allí los tres modelos fracasaron en la misma proporción:
| Modelo | Finalizaciones | Tasa | Minutos / ejecución | Coste / ejecución |
|---|---|---|---|---|
| Fable 5 | 0 / 20 | 0% | 7,9 | $2,63 |
| Fable 5.1 | 2 / 20 | 10% | 5,9 | $2,18 |
| GPT-6 Astra | 2 / 20 | 10% | 3,4 | $1,36 |
Astra siguió siendo más rápido y más barato, pero el resultado final fue el mismo que Fable 5.1. En la rúbrica de etapas, Astra llegaba consistentemente a la etapa 3 (pieza ubicada encima de la ranura) y luego se detenía o desalineaba en la inserción final, de acuerdo con los datos de RoboCurve.
El reporte señala que los tres modelos comparten un mismo techo cuando falta retroalimentación táctil de alta frecuencia y compliance: los modelos digitales operan en espacios vectoriales sin pérdida, mientras que la manipulación física acumula pequeños errores con cada movimiento que un controlador sin tacto no puede corregir en los últimos milímetros de contacto.
Cómo encaja Astra en el resto de benchmarks del modelo
Los brazos robóticos no fueron la única prueba que aprobó Astra. NextBigFuture reportó el 4 de septiembre que el modelo lidera todas las comparativas cabeza a cabeza publicadas contra Claude Fable 5.1, Fable 5 y Claude Opus 5, con ventajas especialmente amplias en ARC-AGI-3 (98,6% vs 30,2% de Opus 5), FrontierMath Tier 4 v2 (97,6% vs 87,8% de Fable 5.1) y AutomationBench (41,4% vs 31,4% de Fable 5.1), según los datos que reproduce el medio.
El mismo artículo recoge que GPT-6 Astra se entrenó en más de 100.000 GPUs en el sitio Stargate de Texas y fue presentado por el presidente y cofundador de OpenAI, Greg Brockman, con la frase «Welcome to the AGI era», según la cobertura de Techloy del 3 de septiembre. OpenAI también afirma, en la misma presentación, que el modelo ejecuta tareas de computer-use un 47% más rápido que su predecesor GPT-5.6 Sol y alcanzó un 72,6% en OSWorld 2.0, de acuerdo con esa misma nota.
En el frente de programación, CryptoBriefing reportó el 5 de septiembre que GPT-6 Astra ocupa el primer puesto del leaderboard Code Arena WebDev con 1.797 puntos, 35 puntos por encima de Claude Fable 5.1 (1.762) sobre más de 650.000 votos comunitarios en 126 modelos. Ambos modelos usan precio idéntico de $10/M tokens de entrada y $50/M tokens de salida, con ventana de contexto de 1 millón de tokens.
No todo coincide, eso sí. Artificial Analysis sitúa a Astra en 61 puntos de su Intelligence Index, el mismo puntaje que GPT-5.6 Sol y cinco puntos por debajo de Claude Fable 5.1, y su resultado en ARC-AGI-3 oscila entre el 99,9% con un harness personalizado de OpenAI ($18.817) y el 62,7% con el harness estándar ($26.098), según los datos publicados por ARC Prize que cita el artículo de Techloy. La moraleja: en benchmarks sensibles al andamiaje, la cifra de marketing y la cifra reproducible pueden estar lejos.
Limitaciones metodológicas que conviene tener en cuenta
El reporte de RoboCurve explicita varias cautelas que vale la pena leer antes de sacar conclusiones demasiado rápidas sobre el producto:
- Asignación de hardware: mientras todos los ensayos del puzle corrieron en el mismo rig (rig-4), las pruebas del cuenco con Astra se ejecutaron en rig-1 porque rig-3 estaba en mantenimiento y fue donde corrieron los modelos Fable.
- Corrida no intercalada: los ensayos de Astra se ejecutaron dos días después de los de Anthropic, no de forma intercalada y aleatoria.
- Sesgo del evaluador humano: los calificadores conocían qué modelo estaban evaluando en cada ensayo.
- Caching: el cálculo usó precios de lista; el cacheo automático de prompts de OpenAI redujo el gasto real de Astra aún más.
Son limitaciones razonables para una primera publicación de datos, pero un founder que vaya a tomar decisiones de arquitectura sobre estos números debería pedir corridas ciegas e intercaladas antes de firmar un contrato.
Qué significa esto para tu startup
Los resultados dibujan un mapa muy concreto para cualquier equipo que esté construyendo (o evaluando) productos donde un LLM controla hardware físico.
- Si tu producto hace pick-and-place grueso (logística de almacén, ensamblaje simple, manipulación de objetos sin tolerancias críticas), GPT-6 Astra ya parece listo como política de alto nivel sobre brazos comerciales. Los números de RoboCurve muestran 95% de fiabilidad, $0,94 por ejecución completa y bucles de decisión del orden de minutos.
- Si tu producto exige inserción de precisión (electrónica, quirúrgica, ensamblaje micromecánico), todavía no hay modelo base que sirva en zero-shot. Hace falta una capa de control con retroalimentación táctil o un sistema de corrección por fuerza, no basta con pedirle más capacidad de razonamiento al LLM.
- El coste unitario es el verdadero multiplicador. Una operación de fulfilment que hoy cuesta $2,12 por ítem podría caer a $0,94 por ítem solo cambiando de modelo, según los datos del reporte. Multiplicado por miles de picks diarios, la diferencia se vuelve material en el P&L.
- Dos acciones concretas que podés tomar esta semana:
- Si ya usás Claude Fable 5.1 en una pipeline de manipulación física, corré una batería paralela de 50 ensayos con GPT-6 Astra sobre tu tarea más repetitiva y medí coste y latencia reales en tu hardware. La diferencia operativa puede justificar el cambio aunque no te interese el resto del modelo.
- Antes de invertir en un sistema de inserción de precisión sobre LLMs, exigí una demo en condiciones ciegas e intercaladas. Si tu proveedor no puede demostrar fiabilidad por encima de 50% en tu tarea, vas a necesitar un control loop clásico encima del LLM, no debajo.
Fuentes
- GPT-6 Astra on robotic manipulation – RoboCurve
- OpenAI’s GPT-6 Astra Hits 95% on Physical Manipulation Benchmark – Humanoids Daily
- OpenAI GPT 6 Astra Limited Release that Beats Anthropic Fable 5.1 – NextBigFuture
- GPT-6 Astra: 10 Things to Know About ChatGPT’s New Model – Techloy
- OpenAI’s GPT-6 Astra tops Code Arena: WebDev – CryptoBriefing
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













