DeepSeek-V4.1-Flash baja la barrera y Occidente adopta la receta en silencio
El 10 de septiembre de 2026, DeepSeek publicó DeepSeek-V4.1-Flash, un modelo MoE de 552.000 millones de parámetros con ventana de contexto de 1 millón de tokens. La cifra que importa no es el tamaño del modelo: es que su caché de clave-valor global cayó a 890 bytes por token, alrededor de una cuarta parte de la generación previa y cerca de 437 veces menos que el DeepSeek-V1 original, según datos del artículo de insufferable.dev y el anuncio oficial reportado por SiliconANGLE. Para founders que construyen productos sobre inferencia, esa cifra se traduce directamente en margen operativo.
Qué es la caché KV y por qué mueve la aguja del costo
Cada vez que un modelo mantiene una conversación larga —agentes de programación, asistentes legales, chatbots de soporte con historial extenso— guarda internamente una memoria intermedia llamada caché de clave-valor (KV). Esa memoria vive en la VRAM de las GPUs y es uno de los componentes más caros del costo de servir un modelo en producción.
DeepSeek atacó el problema en varias capas a lo largo de 2025 y 2026:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- MLA (Multi-Head Latent Attention) comprimió la caché aproximadamente 15 veces frente a arquitecturas tradicionales.
- Compressed Sparse Attention y Heavily Compressed Attention filtraron qué tokens necesitan persistir en memoria.
- En V4.1-Flash, suma CSA2 (atención sparse comprimida de segunda generación), reuso de caché entre capas, una arquitectura codificador-decodificador causal y almacenamiento en FP4, es decir, 4 bits por valor en lugar de los 16 habituales.
El resultado es la huella global de 890 bytes por token y un almacenamiento persistente en SSD cercano a una octava parte de la generación anterior, según el anuncio oficial de DeepSeek reportado por SiliconANGLE.
Anthropic y OpenAI adoptaron la receta sin hacer ruido
El 22 de septiembre de 2026, Anthropic publicó Claude Opus 5.5, un modelo que la compañía presenta como cercano en calidad a Claude Fable 5.1 pero con un costo operativo aproximadamente 40% menor en cargas típicas. El corte más agresivo está en la lectura de caché: bajó 60%, a US$0,20 por millón de tokens, frente a los US$0,50 previos, según el anuncio reportado por Mashable.
Minutos después, OpenAI respondió con GPT-6 Sol y GPT-6 Luna, dos modelos nuevos a la mitad de precio que sus predecesores. Sol quedó en US$2 por millón de tokens de entrada y US$10 por millón de salida, con un descuento explícito del 90% en lecturas de caché, según SiliconANGLE. El artículo original de insufferable.dev estima el recorte entre 80% y 90% frente al precio de GPT-5.6 Sol a fines de julio.
Ambos lanzamientos llegaron sin los preanuncios habituales. Opus 5.5 y GPT-6 Sol salieron con comunicados cortos y sin fanfarria, una señal —según el análisis de insufferable.dev— de que las compañías son conscientes de que sus mejoras de eficiencia replican publicaciones recientes de DeepSeek.
La paradoja: denunciar la destilación y copiar la arquitectura
El mismo día del lanzamiento de V4.1-Flash, Anthropic publicó un informe de inteligencia de amenazas que nombra a DeepSeek entre los siete laboratorios chinos que, según la compañía, ejecutaron campañas de destilación contra Claude. Anthropic atribuyó más de 12,1 millones de intercambios en 14 días de julio a DeepSeek, según el reporte de SiliconANGLE.
La destilación —entrenar un modelo imitando las respuestas de otro— es una práctica que Anthropic viene denunciando como amenaza estratégica. Pero al mismo tiempo, sus propios modelos insignia están adoptando las optimizaciones de caché que DeepSeek liberó como pesos abiertos bajo licencia MIT en Hugging Face.
Por qué los laboratorios chinos publican sus recetas
Hay una restricción estructural detrás del aparente regalo: las sanciones de Estados Unidos restringen el acceso de los laboratorios chinos a GPUs avanzadas, lo que los obliga a exprimir cada FLOP disponible. La consecuencia contraintuitiva es que DeepSeek y compañía están años por delante en eficiencia de inferencia.
Según el análisis de Baseten reportado por Unite.AI, DeepSeek-V4.1-Flash activa solo 8.000 millones de parámetros durante el procesamiento del prompt y 16.000 millones durante la generación de la respuesta, sobre un total de 552.000 millones. Es una arquitectura MoE agresiva que usa 384 expertos enrutados, con 6 activos por token y un experto compartido adicional.
Esa eficiencia se traduce en precios API difíciles de igualar:
| Modelo | Input off-peak (US$/M tokens) | Output off-peak (US$/M tokens) |
|---|---|---|
| DeepSeek-V4.1-Flash | 0,15 | 0,60 |
| Claude Opus 5.5 | 4,00 | 20,00 |
| GPT-6 Sol | 2,00 | 10,00 |
Datos del anuncio oficial de DeepSeek y del reporte de SiliconANGLE sobre Opus 5.5 y GPT-6 Sol. Los precios de DeepSeek se duplican en horarios pico de lunes a viernes.
Qué significa esto para tu startup
La caída de precios no es uniforme: golpea más fuerte a los equipos que ya gastan miles de dólares al mes en APIs de frontera. Tres palancas concretas:
- Reevalúa el costo de tu agente de IA esta semana. Si tu producto depende de cadenas largas de prompts con caché (asistentes de código, agentes que navegan webs, RAG con contexto extenso), el costo por interacción debería caer entre 50% y 80% en los próximos 30 días a medida que los proveedores extiendan los descuentos cache-aware. Negocia contratos plurimensuales antes de que los recortes se consideren el nuevo normal.
- Considera DeepSeek como motor de fallback o segunda marca. Con 890 bytes por token y 1 millón de contexto, V4.1-Flash resuelve razonablemente tareas que antes requerían modelos 10 veces más grandes. Para productos con márgenes ajustados (generación de descripciones de producto, extracción de datos, clasificación), el costo por uso puede caer a una fracción.
- Diseña prompts asumiendo caché persistente. OpenAI confirmó que GPT-6 Sol puede cambiar el nivel de razonamiento y herramientas disponibles sin romper la caché, una capacidad que antes solo estaba al alcance de DeepSeek. Si tu arquitectura no aprovecha los cache hits, estás pagando precios de lista cuando podrías pagar una fracción. Revisa la lógica de invalidación de tu cliente.
La pregunta que un founder debe hacerse ya
DeepSeek creció a partir del fondo de cobertura chino High-Flyer. Según SiliconANGLE, su fundador Liang Wenfeng participó en una ronda de más de US$7.400 millones en junio de 2026 que valoró a la compañía por encima de los US$50.000 millones.
El resultado neto para un founder hispano: el costo de la inferencia de frontera está en caída libre y, por primera vez en dos años, no muestra señales de frenarse. Lo que ayer era un lujo —agentes de código multi-turno, RAG sobre bases enteras, asistentes que mantienen contexto de horas— empieza a convertirse en commodity. La pregunta deja de ser "¿puedo pagar la inferencia?" y pasa a ser "¿qué ventaja de mi producto sobrevive al próximo recorte de precios?".
Fuentes
- The AI Race Just Got Awkward (fuente original)
- DeepSeek releases V4.1-Flash, says it outperforms flagship V4-Pro - SiliconANGLE
- Baseten Adds DeepSeek-V4.1-Flash to Model APIs With 1M-Token Context - Unite.AI
- Anthropic launches Claude Opus 5.5, promising Fable-level performance at a lower price - Mashable
- Anthropic releases Claude Opus 5.5 and OpenAI counters with two cheaper GPT-6 models - SiliconANGLE
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













