Qué lanzó Anthropic y por qué importa
Anthropic presentó el 1 de septiembre Claude Fable 5.1 y Claude Mythos 5.1, sus nuevos modelos insignia para coding y knowledge work, según recogió el newsletter Latent Space. Es la primera actualización de la línea Mythos desde el lanzamiento de Fable 5 el 9 de junio, en un ciclo de tres meses que ya había incluido una suspensión de 18 días por controles de exportación y el lanzamiento de Claude Opus 5 en julio.
El movimiento central es práctico: Fable 5.1 mantiene el precio base de US$10 por millón de tokens de entrada y US$50 por millón de salida, pero recorta el precio de cache reads un 75%, pasándolo de US$1 a US$0,25 por millón, según datos de Artificial Analysis citados por Latent Space. En términos brutos, el caché era un componente menor del coste; en workflows agentic, donde el modelo re‑lee una y otra vez el mismo scratchpad, repo o transcript, es el componente dominante. Para cargas agentic pesadas, Decrypt reporta ahorros de hasta 45% en workload total.
Resultados de benchmark: un salto grande, con matices
Fable 5.1 llega al techo de la mayoría de evaluaciones públicas:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Artificial Analysis Intelligence Index: 66 (máx effort), frente a 63 de Claude Opus 5 y 62 de Fable 5.
- Terminal-Bench-Science 0.1: 52,6%, más del doble que Fable 5 (24,7%) y muy por encima de Opus 5 (29,0%), según Decrypt.
- Terminal-Bench 4.0: 55,8%, contra 42,0% de Fable 5 y 52,3% de Opus 5.
- Humanity’s Last Exam: 60,9% sin tools externas y 65,0% con tools.
- GDPval-AA v2: 1853 Elo (+130 vs Fable 5).
- AA-Briefcase: 1694 Elo (+122).
El matiz importante —y el que menos se repite en cobertura rápida— es que ~4% de los tokens de salida de la evaluación de Artificial Analysis fueron servidos por modelos de fallback (Opus 4.8 u Opus 5) cuando los safety classifiers dispararon. Eso convierte parte de la puntuación en un resultado híbrido de sistema, no del modelo en aislamiento.
El detalle incómodo: el coste por tarea sube ~20%
La lógica del recorte en cache reads es buena para sesiones largas. El problema es el otro lado de la ecuación: Fable 5.1 emite ~1,7× más tokens de salida que Fable 5 para resolver la misma tarea, según Artificial Analysis. La combinación da un resultado que contradice el titular:
- Fable 5.1 max effort: US$3,76 por tarea (66 de score)
- Fable 5 max effort: coste menor
- Fable 5.1 xhigh: US$2,72 por tarea (score 65)
- Opus 5 max: US$2,34 por tarea (score 63)
El ahorro por cache compensa el sobrecoste por output: el efecto neto es +20% por tarea, según recoge Latent Space. GPT‑5.6 Sol, por contraste, completa tareas similares a una fracción del coste —US$0,95 por tarea en el desglose que cita el newsletter—, lo que mantiene a Sol como ganador en intelligence‑per‑dollar aunque pierda en techo absoluto.
Fable vs Mythos: ¿el mismo modelo con distinto filtro?
Uno de los debates técnicos más interesantes del ciclo de lanzamiento vino del análisis comunitario —no de Anthropic—:
- Fable 5.1 y Mythos 5.1 serían, según usuarios como @eliebakouch y @nrehiew citados por Latent Space, los mismos pesos con diferente configuración del safety classifier.
- La diferencia radicaría en el umbral de clasificación y la política de escalado a Opus 4.8 para solicitudes marcadas como peligrosas.
- Decrypt confirma la parte oficial: Fable es de acceso general; Mythos 5.1 queda restringido a profesionales verificados de ciberseguridad y ciencias de la vida a través del Cyber Verification Program y el Life Sciences Verification Program.
Para un founder esto importa menos de lo que parece, pero cambia la lectura de cualquier tabla de benchmarks: cuando veas «Mythos» y «Fable» lado a lado, podrías estar comparando rutas de seguridad, no arquitecturas distintas. Y cuando planifiques enterprise, estás eligiendo política de despliegue tanto como modelo.
Enterprise: EFS, ZDR y el «ZDR++» del que habla Anthropic
El lanzamiento vino con dos movimientos empresariales que cambian la decisión de compra:
- Enterprise Frontier Safeguards (EFS): capa de observabilidad para despliegues agentic, presentada por @alexalbert__ como «ZDR++» para entornos corporativos. Permite monitorizar y controlar lo que hacen los agentes a lo largo de sesiones largas.
- Zero Data Retention (ZDR): soporte explícito de no retención, destacado por Dan Shipper como desbloqueador clave para empresas que antes no podían desplegar Claude por compliance.
El patrón es claro: el «modelo» deja de ser un artefacto único y se convierte en un sistema envuelto en política. Eso encaja con cómo Anthropic ya piensa el pricing — el cache cut no es un descuento, es un reconocimiento de que el cuello de botella económico en agentic no está en la inferencia puntual, sino en la repetición de contexto.
Cómo encaja Fable 5.1 en el panorama de precios
Para poner los números de Fable 5.1 en perspectiva, el cuadro competitivo de Tech Times y OnMSFT con datos de Artificial Analysis:
- Claude Fable 5.1: US$10 input / US$50 output / US$0,25 cache read por millón
- Claude Opus 5: US$5 / US$25 (la mitad por token que Fable 5.1)
- GPT‑5.6 Sol: US$5 / US$30, con menor consumo de tokens por tarea
- Grok 4.6 (SpaceXAI): US$2 / US$6, igualando a Sol en score (61) a casi un tercio del precio de Fable
- DeepSeek V4‑Pro: US$0,435 / US$0,87
- Claude Sonnet 5: US$2 / US$10 (precio introductorio vigente al 31 de agosto de 2026)
El patrón de fondo: la frontera de inteligencia y la frontera de eficiencia económica se han separado. Fable 5.1 gana la primera por tres puntos del Intelligence Index; Sol y Grok 4.6 ganan la segunda por un factor de 3× a 4× en coste por tarea completada.
Qué cambia para el founder hispanohablante
Tres movimientos prácticos que puedes aplicar esta semana:
- Audita cuánto cache read consumes realmente. Si tu producto depende de agentes que re‑leen contexto, el cache cut a US$0,25 es una bajada real. Si tu uso es prompt‑respuesta corto, no te afecta — y el +20% por tarea sí.
- Mide coste por tarea, no por token. El benchmark atractivo es el Intelligence Index; la métrica que decide tu runway es coste por tarea completada. Un agente que tarda más y emite más tokens puede ser más inteligente pero romper tu unit economics.
- Evalúa Mythos como opción enterprise separada. Si estás en sector regulado (salud, finanzas, ciberseguridad), el gating de Mythos 5.1 vía Verification Program puede ser ventaja o bloqueo. Fable 5.1 está disponible ya vía API, Amazon Bedrock, Google Cloud y Microsoft Foundry bajo el ID
claude-fable-5-1.
El ciclo también deja una lección de madurez: los benchmarks agregados importan cada vez menos que la composición del sistema que los produce. Saber qué pesos atendieron tu request, qué ruta de seguridad intervino y cuánto del score viene del modelo principal vs el fallback será tan importante como el score mismo.
Fuentes
- Latent Space — AINews: Claude Fable/Mythos 5.1 (fuente original)
- Decrypt — Anthropic Ships Claude Fable 5.1
- OnMSFT — Grok 4.6 Matches GPT-5.6 Sol Performance at Nearly Half the Price
- Tech Times — Claude Fable 5 Free Window Ends Sunday as GPT-5.6 Sol Closes Benchmark Gap
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













