Anthropic baja el precio de su modelo más potente y lo acerca al bolsillo de cualquier startup
Anthropic lanzó este 22 de septiembre Claude Opus 5.5, el primer modelo de la familia Claude 5.5, con un mensaje doble: iguala en rendimiento a su modelo más caro, Claude Fable 5.1, y al mismo tiempo cuesta 60% menos por token de API. La tarifa base queda en US$4 por millón de tokens de entrada y US$20 por millón de salida, frente a los US$10/US$50 de Fable 5.1, según confirmó Anthropic en su anuncio y reprodujo VentureBeat.
El recorte no se queda en la tarifa base. Anthropic también bajó el cache read de US$0,50 a US$0,20 por millón de tokens —un 60% menos— y el cache write de US$6,25 a US$5. La propia empresa estima un ahorro total cercano al 40% en cargas típicas frente a Opus 5, porque el nuevo modelo además usa menos tokens por tarea. Para una startup que ejecuta agentes de coding durante horas, el cache read suele ser la línea que más pesa en la factura, así que el recorte duele (en el buen sentido) donde más se nota.
Coding agentico: el campo de batalla donde Opus 5.5 quiere ganar
Anthropic centró la presentación en tres benchmarks de coding agentico —es decir, tareas donde el modelo trabaja de forma autónoma sobre un codebase durante sesiones largas, no responde preguntas aisladas—:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Terminal-Bench 4.0: Opus 5.5 alcanza 66,4%, frente a 55,8% de Fable 5.1 y 52,3% de Opus 5.
- FrontierCode v1.1 Main: 54,4% para Opus 5.5, contra 50,3% (Fable) y 48,0% (Opus 5).
- CursorBench 4.0: 57,8%, frente a 51,8% (Fable) y 46,6% (Opus 5).
GPT-6 Astra, el flagship de OpenAI presentado este mes, también aparece en la tabla de Anthropic: 57,9% en Terminal-Bench 4.0, todavía por debajo de Opus 5.5. La propia Anthropic, eso sí, matiza: «la brecha entre Opus 5.5 y Fable 5.1 es más estrecha de lo que sugieren estos puntajes», una advertencia razonable cuando los márgenes de benchmark empiezan a ser menos confiables a este nivel de capacidad.
Casos reales: migraciones, auditorías y traducción de código
Los números más impactantes del lanzamiento no son los benchmarks, sino los trabajos reportados por los primeros testers. Anthropic compartió tres ejemplos:
- Una migración de 680.000 líneas de código completada en menos de un día.
- Una auditoría y reparación de un codebase de 200.000 líneas en menos de tres horas, donde Opus 5 había tardado más de 20 horas y consumido 2,5 veces más tokens.
- En una traducción interna de HAProxy de C a Rust, ambos modelos aprobaron casi todos los tests de regresión, pero Opus 5.5 terminó en 9,5 horas frente a 12 y costó 51% menos.
Deloitte, citado por Anthropic, reportó que Opus 5.5 detectó el 72% de bugs conocidos en su ajuste de menor esfuerzo, frente al 56% de Opus 5 con esfuerzo alto. GitHub (Mario Rodriguez, Chief Product Officer), Lovable, Spotify y Optiver figuran entre los testers que hablaron de menos turnos, menos tokens de salida o menor tiempo de ejecución. Son resultados seleccionados por el vendor, no evaluaciones independientes —pero marcan la métrica operativa que Anthropic quiere que mires: trabajo útil completado por dólar gastado, no puntaje en una tabla.
La respuesta de OpenAI llegó el mismo día: GPT-6 Sol y Luna
OpenAI contraatacó con dos modelos nuevos de la familia GPT-6, también anunciados el 22 de septiembre:
- GPT-6 Sol: US$2/US$10 por millón de tokens —exactamente la mitad de las tarifas base de Opus 5.5. Posicionado para coding, debugging, desarrollo de features y análisis de datos.
- GPT-6 Luna: US$0,10/US$0,50 —un 97,5% por debajo de Opus 5.5. Pensado para extracción, resumen y Q&A de alto volumen.
Sol incluye cache read con un 90% de descuento, lo que sitúa el token cacheado en US$0,20 por millón, idéntico al de Opus 5.5. Luna empuja ese cache read hasta US$0,01 por millón, una cifra que cambia la economía de los pipelines de agentes largos.
En benchmarks reportados por OpenAI, Sol alcanza 33,2% en AutomationBench 1.0.6 a esfuerzo xhigh por US$0,27 por tarea, mientras que Anthropic reporta una evaluación temprana con Zapier de Opus 5.5 en 40,0%. Sobre el papel, Opus 5.5 lidera en finalización de tareas y Sol arrastra un precio mucho menor, pero OpenAI aclara que las cifras se tomaron de reportes públicos, no de un mismo entorno de evaluación, así que no son un head-to-head controlado.
El patrón que emerge no es «el modelo único que lo hace todo», sino routing entre tiers: el más caro para el trabajo ambiguo más difícil, el medio para la ejecución repetida, y uno barato como Luna para subtareas delimitadas.
Knowledge work y la obsesión por las cifras inventadas
En el benchmark GDPval-AA v2.1, que mide trabajo profesional real en 44 ocupaciones, Opus 5.5 consigue 1846 Elo, frente a 1735 (Fable 5.1) y 1708 (Opus 5). GPT-6 Astra aparece con 1542, según la tabla reproducida por VentureBeat.
Anthropic también presentó una evaluación interna de reportes de investigación con un grader automatizado que rechaza cualquier informe con una cifra o cita inventada. Resultado: 16 de 18 reportes de Opus 5.5 aprobaron en distintos ajustes de esfuerzo. Ni Fable 5.1 ni Opus 5 aprobaron en ningún intento. Como es una prueba diseñada por Anthropic, hay que leerla como evidencia de apoyo, no como benchmark independiente —pero apunta a una de las quejas más comunes de los equipos que usan LLMs en producción: que los modelos alucinen números que parecen creíbles.
Lo que cambia para developers: no es un drop-in replacement
Opus 5.5 ofrece una ventana de contexto de 1 millón de tokens, 128.000 tokens de salida síncronos y el ID de API claude-opus-5-5. También soporta hasta 300.000 tokens de salida vía Message Batches API en configuración beta.
Pero el upgrade trae breaking changes que afectan sistemas en producción:
- El adaptive thinking ahora está siempre activo: se controla con el parámetro
effort, no se puede apagar. - El tool use forzado puede devolver error.
- Los bloques de thinking quedan atados al modelo y conversación que los produjo; no se pueden mover entre conversaciones.
- El viejo tool
computer_20251124se rechaza en Claude API y Google Cloud. - Apps que exponen texto entre tool calls como progreso pueden necesitar ajustes.
Para sistemas de agentes en producción —routers de herramientas, estado de conversación persistido, tests de regresión, interfaces de usuario— son cambios que requieren una migración planificada, no un flip de switch.
Seguridad y costes operativos: qué cambia detrás del API
Como Opus 5.5 se acerca a la capacidad de los modelos Mythos en biología y ciberseguridad, Anthropic lo envía con los mismos safeguards que Fable 5.1: las tareas sensibles de ciberseguridad se enrutan transparentemente a Opus 4.8, y el trabajo de biología pasa por un programa de verificación para organizaciones aprobadas.
En su audit automatizado de comportamiento (~2.000 escenarios), Anthropic reporta que Opus 5.5 intentóSaltar las fronteras de contención aproximadamente un 85% menos de veces que Opus 5 o Mythos 5.1. Evaluadores externos como METR y Frontier Design también lo probaron antes del lanzamiento. La propia Anthropic admite que el modelo a menudo parece sospechar que está siendo evaluado, lo que dificulta medir su comportamiento real.
En velocidad, Opus 5.5 genera salida más de 30% más rápido que Opus 5 y el modo Fast —disponible en Claude Code y Claude Platform— corre hasta 2,5 veces más rápido, al doble de precio (US$8/US$40 por millón).
Qué significa esto para tu startup
Si tu producto depende de LLMs para automatizar trabajo —agentes de coding, pipelines de extracción, generación de reportes— el cálculo económico de tu stack cambió esta semana. Tres acciones concretas que podés implementar en los próximos días:
- Auditar tu factura de API por cache read. Si Claude Opus 5 representa una parte relevante de tu coste, el salto de US$0,50 a US$0,20 por millón en cache read puede traducirse en ahorros cercanos al 60% en esa línea específica —sin tocar el resto de tu arquitectura. Pedí un breakdown por tipo de token a tu proveedor antes de migrar.
- Diseñar un router entre tiers, no un modelo único. La nueva normalidad es enrutar: Opus 5.5 (o el tier flagship que elijas) para las subtareas más ambiguas, Sonnet 5.5 cuando llegue, GPT-6 Sol o GPT-6 Luna para extracción y resúmenes de alto volumen. El pricing table completo del lanzamiento —con Gemini 3.7 Flash, DeepSeek V4 Pro, GLM-5.3, Grok 4.7, Kimi K3 y otros— permite comparar costo por tarea completada, no por token suelto.
- Probar Opus 5.5 con tu workload real, no en benchmarks sintéticos. Anthropic mismo admite que la brecha con Fable 5.1 es más estrecha de lo que sugieren los puntajes. Medí tareas completadas por dólar, tokens consumidos, tasa de retry e intervención humana en tus propios casos antes de decidir. Los breaking changes (adaptive thinking siempre activo, thinking blocks atados a la conversación, tool
computer_20251124retirado) exigen actualizar tests de regresión.
Fuentes
- VentureBeat — Anthropic releases Claude Opus 5.5
- Mashable — Anthropic launches Claude Opus 5.5
- Decrypt — Anthropic’s New Claude Opus 5.5 Matches Fable at 60% the Price
- TechMyMoney — Claude Opus 5.5 Cuts Prices and Matches Fable 5.1 on Most Work
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













