DeepSeek V4.1-Flash: 552B params con KV cache a la cuarta parte

DeepSeek-V4.1-Flash: 552B parámetros con la cuarta parte de la KV cache

El laboratorio chino DeepSeek publicó el 10 de septiembre de 2026 el código abierto y los pesos de DeepSeek-V4.1-Flash, un modelo multimodal MoE de 552.000 millones de parámetros que activa solo 8.000 millones durante el prefill y 16.000 millones durante el decode, con una ventana de contexto de 1 millón de tokens. La cifra más llamativa del lanzamiento no es el tamaño total: es que la KV cache global cae a unos 890 bytes por token, frente a los 3.514 bytes por token de la generación anterior, según reportó South China Morning Post y recogió SiliconANGLE. En memoria HBM eso significa usar una cuarta parte; en almacenamiento persistente en SSD, una octava parte.

El movimiento es agresivo incluso para los estándares de DeepSeek: desde el 14 de septiembre de 2026 todas las llamadas al endpoint deepseek-v4-pro se enrutan a V4.1-Flash y se facturan a precio Flash, hasta que llegue una versión V4.1-Pro, según confirmó SiliconANGLE. El comunicado oficial de la compañía, citado por The Decoder, sostiene que V4.1-Flash supera a V4-Pro en todas las métricas internas de rendimiento, costo, velocidad y tiempo total de ejecución.

Qué hay realmente debajo del capó

El informe técnico describe una arquitectura bautizada como Causal Encoder-Decoder (CED). En la práctica es una forma de Recursive Transformer: el modelo se divide en 40 capas, las primeras 20 forman un Causal Encoder y las siguientes 20 un Decoder. La diferencia clave es que el Decoder no genera su propia KV global; la hereda proyectando las representaciones finales del Encoder. Por eso durante el prefill solo se ejecutan 20 capas, lo que reduce casi a la mitad el cómputo del prefill, según el paper.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Sobre esa base, el equipo introduce CSA2 (Compressed Sparse Attention v2), que ataca la KV cache en tres dimensiones:

  • Canal: un vector latente compartido de 512 dimensiones para todas las cabezas de atención, al estilo de MLA.
  • Secuencia: el Encoder fusiona dos posiciones adyacentes en una sola entrada, mientras el Decoder conserva una entrada por posición.
  • Capa: múltiples capas comparten la misma KV global; toda la red retiene solo 3 copias de Encoder y 1 de Decoder.

A eso se suma FP4 KV cache y un mecanismo llamado Decoder SWA Bounded Replay, que reconstruye solo los últimos tokens del sliding window en lugar de recomputar la ventana completa. El resultado, siempre según el paper, es una huella por token 890 bytes para la KV principal más el indexer.

La velocidad también cambia. La nota de Zartbot, basada en pruebas propias, registró cerca de 420 tokens/segundo en V4.1-Flash, un salto notable respecto a V4-Flash.

Benchmarks: gana en código, cede en ciencia e imagen

Los números que DeepSeek publica en la model card (recogidos por Baseten y TechRepublic) posicionan a V4.1-Flash a la par o por encima de modelos cerrados de frontera en tareas agentic:

  • Terminal-Bench 2.1: 90.6, frente a 88.8 de GPT-5.6 Sol, 89.1 de Claude Opus 5 y 87.9 de V4-Pro.
  • DeepSWE v1.1: 74.2, frente a 74 de Opus 5 y 62.7 de V4-Pro.
  • Cybergym: 88.1, frente a 83.3 de V4-Pro.
  • AutomationBench: 54.8, frente a 37.7 de V4-Flash.
  • GPQA Diamond: 90.9, con Opus 5 y GPT-5.6 Sol todavía por delante.
  • Codeforces: rating de 3471.

El propio The Decoder advierte que, según el paper, en benchmarks científicamente exigentes y en lectura de imágenes complejas todavía hay una brecha clara con los modelos cerrados líderes. En el test ZeroBench, V4.1-Flash obtiene 49, frente a 35 de la versión experimental V4-Flash-Vision-Exp; mejor, pero todavía lejos de saturar la prueba.

Precio y disponibilidad: dónde y cuánto cuesta

El modelo está disponible bajo licencia MIT en Hugging Face y en la API de DeepSeek. La nueva tarifa aplicada el 10 de septiembre a las 04:00 UTC, según SiliconANGLE, es:

  • Input no cacheado (off-peak): US$0,15 por millón de tokens.
  • Output (off-peak): US$0,60 por millón de tokens.
  • En horario pico las tarifas se duplican.

Para los usuarios que aún llaman a V4-Pro, la salida cae de US$3,96 a US$1,20 por millón de tokens en pico, un recorte cercano al 70% que no es un detalle menor para cualquier agente de código en producción.

En China, según TechRepublic, DeepSeek bajó el precio de la input cacheada hasta 0,02 yuanes por millón de tokens en horario valle. Los partners oficiales WorkBuddy (incluido CodeBuddy) y OpenCode ya ofrecen soporte completo.

Contexto empresarial: por qué importa más allá del paper

V4.1-Flash llega en un momento inusual para DeepSeek. En junio de 2026 la compañía cerró su primera ronda externa de US$7.400 millones a una valoración post-money de US$52.000 millones, con Tencent, CATL, JD.com, NetEase e IDG Capital entre los inversores, según The Straits Times. Su fundador, Liang Wenfeng, aportó personalmente alrededor de US$3.000 millones y conserva cerca del 78% del equity, lo que llevó al Bloomberg Billionaires Index a estimar su patrimonio en unos US$36.000 millones.

En paralelo, Bloomberg reportó que DeepSeek contrató a CITIC Securities como asesor y prepara un IPO en mainland China que podría presentarse a fines de 2026 para debutar en 2027, con conversaciones para una nueva ronda a una valoración pre-money de al menos 480.000 millones de yuanes (unos US$71.000 millones). memeburn recogió además que el V4-Flash venía siendo el modelo con mayor volumen de llamadas API a nivel global y que datos de Vercel de junio de 2026 mostraban a DeepSeek procesando cerca del 23% de los tokens enterprise en su AI gateway, frente al 32% de Anthropic.

Qué significa esto para tu startup

Si tu producto depende de agentes de código, RAG sobre documentos largos o cualquier flujo con muchas llamadas a herramientas, V4.1-Flash cambia el cálculo unitario de manera medible: pagas por menos memoria, por menos cómputo de prefill y por una API más barata. El costo por tarea puede bajar dos terceras partes solo por el cambio de routing de V4-Pro a V4.1-Flash.

Acciones concretas para founders:

  • Mide prefill vs. decode en tu workload. Si tus agentes generan muchos prefill (tool calls, RAG con chunks grandes, re-prefills por cache miss), el diseño CED de 8B activos en prefill es exactamente tu sweet spot. El paper muestra que la complejidad del prefill pasa de O(L) completo a aproximadamente la mitad, lo que escala casi lineal hasta 1M de tokens.
  • Calcula la huella de KV cache antes de contratar GPU. El corte de 3.514 a 890 bytes/token te deja meter casi cuatro veces más sesiones concurrentes en la misma HBM, según los datos del paper y la cobertura de The Decoder. Para founders en LATAM y España operando con budgets ajustados, eso es la diferencia entre pagar dos H100 o uno solo por nodo.
  • Evalúa latencia real antes de migrar. El paper asume FP4 KV cache y SWA Bounded Replay, dos aproximaciones. Antes de mover producción, prueba en cargas reales con tus prompts largos: el ahorro es enorme, pero la bounded replay introduce una pequeña pérdida de calidad en el KV local del Decoder que conviene medir.
  • Cuidado con la geopolítica del proveedor. SiliconANGLE recordó que, el mismo día del lanzamiento, Anthropic mencionó a DeepSeek en un informe de threat intelligence como uno de los siete laboratorios chinos que habrían realizado campañas de destilación contra Claude. Si tu cliente es enterprise en EE.UU. o Europa regulada, esto puede ser un argumento en contra; si es LATAM o Asia, probablemente no.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...