Anthropic lanza Claude Haiku 5.5: el modelo pequeño más barato y más capaz hasta la fecha
El 7 de octubre de 2026, Anthropic presentó Claude Haiku 5.5, su nuevo modelo "pequeño" para tareas de alto volumen donde lo que pesa es coste y latencia: resúmenes, clasificaciones, consultas a bases de datos, soporte en vivo y como subagente dentro de flujos de programación más complejos. Según la propia compañía, Haiku 5.5 corre alrededor de un 75% más barato en promedio que su predecesor Haiku 4.5, y los benchmarks publicados lo posicionan por encima de GPT-6 Luna de OpenAI, su rival directo en precio y tamaño.
Para un founder que ya paga factura de API, el número relevante es este: hasta 100.000 tokens de prompt, Haiku 5.5 cuesta US$0,10 por millón de tokens de entrada y US$0,50 por millón de salida, exactamente el mismo precio que GPT-6 Luna. Por encima de 100.000 tokens el precio se quintuplica (US$0,50 / US$2,50), lo que cambia la decisión técnica para ventanas largas.
Qué cambia en precio frente a Haiku 4.5 y frente a GPT-6 Luna
El precio de lista de Haiku 4.5 era US$1 / US$5 por millón de tokens de entrada y salida, relativamente caro incluso en su lanzamiento hace casi un año, según el desarrollador Simon Willison, y ya 10 veces más caro que GPT-6 Luna en ese momento. Con Haiku 5.5, Anthropic no se queda en la franja premium del segmento pequeño: copia el precio de Luna en el tramo bajo (US$0,10 / US$0,50) y lo sube cinco veces sólo cuando se superan los 100.000 tokens.
¿Y esto cómo se aplica en tu negocio?
En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.
👥 Probar 7 díasAhí está la trampa competitiva. GPT-6 Luna mantiene su precio bajo hasta los 272.000 tokens y, a partir de ahí, sólo lo duplica (US$0,20 / US$0,75). Si tus cargas caben en 100.000 tokens, Haiku 5.5 y Luna cuestan lo mismo y Haiku reporta mejores puntajes en los benchmarks de Anthropic. Si tus prompts suelen pasar de 100.000 tokens, el cálculo se invierte y Luna sale más barata, según el análisis de Simon Willison.
La propia Anthropic detalla las bases del "75% menos" que comunica: el precio de lista baja un 90% respecto a Haiku 4.5 en el tramo de hasta 100.000 tokens y un 50% en el tramo superior, y alrededor del 90% de las llamadas a Haiku 4.5 caían en el tramo barato, de ahí el promedio.
Benchmarks: cómo queda Haiku 5.5 frente a sus rivales
Anthropic publicó una tabla con números muy superiores a la generación anterior. Los más citados:
- GDPval-AA v2.1 (trabajo de conocimiento aplicado): 1.620 para Haiku 5.5, frente a 735 de Haiku 4.5 y 1.437 de GPT-6 Luna; Sonnet 5.5 aparece como referencia con 1.840.
- AA-Briefcase v1.1: 1.578 vs 614 de Haiku 4.5.
- OSWorld 2.1 (uso de computador, subconjunto offline): 72,4% vs 15,7% de Haiku 4.5.
- Humanity's Last Exam: 45,9% sin herramientas y 57,4% con herramientas (Haiku 4.5 lograba 10,2% y 18,7%).
- Terminal-Bench 4.0 (coding agéntico): 39,2%, frente a 0,0% de Haiku 4.5.
- FrontierCode 1.1 (Main): 46,4%; Chartography sin herramientas: 46,4% (6,4% en Haiku 4.5).
Las cifras son de Anthropic; en este segmento siempre conviene probar con datos propios antes de migrar, pero seis clientes compartieron casos públicos en el lanzamiento. Asana reportó una reducción de latencia superior al 30% y hasta 2,5 veces más rápido por turno de agente. HubSpot obtuvo 92,8% en su suite simulada de CRM, el mejor resultado y la mayor velocidad que habían medido. AlphaSense mejoró de 0,76 a 0,84 sobre 400 consultas de estilo producción, en un sistema que mueve unas 8 millones de llamadas por semana. Box sumó 11 puntos a la mitad de latencia. Cognition confirmó que Devin Fusion usa Haiku 5.5 como modelo "sidekick" y anota 66,2 en FrontierCode.
La letra pequeña del recorte: el nuevo tokenizador
Un detalle que Simon Willison subraya en su análisis: Haiku 5.5 introduce un tokenizador menos generoso. Su herramienta Claude Token Counter muestra que el mismo prompt largo consume alrededor de 1,25 veces más tokens que con Haiku 4.5. La nota al pie del comunicado de Anthropic lo reconoce: el cálculo del 75% ya descuenta este efecto, similar al aplicado a Sonnet 5.5 y Opus 5.5. En la práctica, parte del ahorro se "come" tokens extra, un argumento más para revisar los prompts largos antes de dar por hecho el descuento.
Además, Haiku 5.5 no permite desactivar el razonamiento: el ajuste thinking_effort está disponible pero viene por defecto en medium. El propio Simon Willison probó el modo low (US$0,000936 en 7 segundos) y max (US$0,033826 en 5 minutos 9 segundos) para la misma tarea de generar un SVG de un pelícano en bicicleta: una diferencia de 35 veces en coste para un resultado funcionalmente equivalente.
Créditos API para suscriptores Max y Team
El otro anuncio del día apunta a quienes ya pagan una suscripción Claude en vez de pagar sólo por uso. Anthropic introduce esta semana un crédito mensual de API para usuarios Max y Team:
- Max 5x: US$100 al mes en créditos para API.
- Max 20x: US$200 al mes.
- Team: hasta US$500 al mes, compartidos entre los usuarios de la organización.
Los créditos no se acumulan mes a mes: se usan o se pierden. Y se puede desactivar la recarga automática, una salvaguarda útil si quieres gastar exactamente el crédito sin sustos de facturación. Como referencia, OpenAI todavía permite usar la suscripción de Codex para llamadas personales a la API, lo que en la práctica sigue siendo mejor para uso intensivo de un solo usuario, como recuerda Simon Willison.
Sonnet 5.5 también baja: cache reads a la mitad
El mismo 7 de octubre, Anthropic recortó a la mitad el precio de los cache reads de Claude Sonnet 5.5: de US$0,20 a US$0,10 por millón de tokens. La compañía estima que esto abarata alrededor de un 20% la ejecución de la mayoría de las tareas agénticas con Sonnet 5.5, porque las lecturas de caché representan una parte grande del consumo total de tokens. Para flujos RAG o agentes con system prompts repetidos, es un descuento silencioso que se nota en la factura de fin de mes.
Qué significa esto para tu startup
Haiku 5.5 no cambia el techo de lo que puede hacer un modelo, pero redefine el suelo. Para un founder hispano que ya está pagando API de un LLM pequeño, hay tres movimientos prácticos:
- Reescala tu mix de modelos. Si hoy gastas más en Sonnet del que necesitas porque Haiku 4.5 "no daba", Haiku 5.5 cubre resúmenes, clasificaciones, extracciones y subagentes a una fracción del precio anterior. El nuevo ajuste
thinking_effortpermite gastar menos por consulta cuando la tarea es repetitiva y reservarmaxpara los casos donde la calidad justifique el coste extra. - Recalibra la frontera de los 100.000 tokens. Si tu pipeline opera siempre por debajo de ese umbral, Haiku 5.5 y GPT-6 Luna cuestan lo mismo: decide por benchmarks propios y latencia, no por precio. Por encima, modela cuánto te costaría migrar a Luna o a Sonnet 5.5 antes de asumir el salto a US$0,50 / US$2,50.
- Aprovecha los créditos si ya pagas Claude Max. US$100 al mes de API incluida en Max 5x es una vía barata para prototipar agentes, conectores MCP y herramientas internas sin abrir tarjeta. En términos de flujo de caja, equivale a tener un entorno "staging" de LLM sin coste adicional.
Conclusión
Claude Haiku 5.5 confirma la tendencia que marcó el DevDay 2026 de OpenAI a finales de septiembre: la carrera ya no es por tener el modelo más grande, sino por tener el modelo pequeño más barato y útil para el grueso del trabajo. Anthropic iguala el precio de OpenAI en la franja baja, lo supera en los benchmarks publicados y, de paso, abarata el uso de Sonnet 5.5. Para una startup con margen ajustado, eso se traduce en una factura de API que puede caer entre un 50% y un 75% sin sacrificar calidad. La pregunta ya no es "qué modelo uso", sino "qué parte de mi flujo delego al modelo barato y qué parte se queda en el grande".
Fuentes
- Introducing Claude Haiku 5.5 — simonwillison.net
- Anthropic Releases Claude Haiku 5.5, Cutting Small-Model API Prices — unite.ai
- Anthropic upgrades Claude with new Haiku 5.5 model, details here — 9to5mac.com
- OpenAI DevDay 2026 Recap: 20+ Launches, One Big Idea and a Quiet Price Reset — memeburn.com
- GPT-6 Luna and Sol Pricing and Availability — note.com
¿Y esto cómo se aplica en tu negocio?
En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.
👥 Probar 7 días














