DeepSeek V4.1 Flash: open weights a US$0,30/M y 8x menos KV

DeepSeek vuelve a la carga con V4.1 Flash: open weights, encoder–decoder asimétrico y costes por token aplastados

DeepSeek presentó V4.1 Flash, su nuevo modelo open-weight insignia enfocado en eficiencia de inferencia y bajo coste. El laboratorio chino publicó los pesos en Hugging Face bajo licencia MIT el 9 de septiembre de 2026, y el cambio ya se nota en el ecosistema: el tráfico del antiguo V4 Pro se enruta automáticamente a V4.1 Flash desde el 14 de septiembre, según Baseten y la propia DeepSeek.

El dato que más ha llamado la atención es el precio: US$0,30 por millón de tokens de entrada y US$1,20 por millón de tokens de salida, con cache input a US$0,006 por millón y un 50% de descuento adicional en horario valle, de acuerdo con los benchmarks de Artificial Analysis citados por Latent Space. Por tarea del Artificial Analysis Intelligence Index, V4.1 Flash cuesta unos US$0,27, frente a los US$2,01 de GLM-5.3 y los US$2,00 de Kimi K3, un factor de aproximadamente 7x más barato en coste total por tarea completada.

Qué trae la nueva arquitectura causal encoder–decoder

V4.1 Flash introduce una arquitectura causal encoder–decoder asimétrica, una vuelta a la idea original de Attention Is All You Need en plena era de modelos decoder-only. El stack se organiza como 40 capas de Transformer: 20 de encoder causal seguidas de 20 de decoder, según la model card descrita por Baseten. El detalle clave es que la caché KV global del decoder se proyecta desde los estados ocultos finales del encoder, en lugar de derivarse capa por capa como en los decoder-only tradicionales.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Esto se traduce en una huella de parámetros activos muy agresiva:

  • 8B parámetros activos en prefill (procesamiento del input).
  • 16B parámetros activos en decode (generación de output).
  • 763B parámetros totales según el conteo en safetensors de Hugging Face que circula en Reddit (incluye backbone + Engram + DSpark opcional + encoder de visión), frente a los 552B del anuncio oficial, que solo cuentan el backbone.

Cada capa MoE tiene un experto compartido y 384 expertos enrutables, con seis activos por token. El laboratorio entrenó el modelo desde cero sobre un corpus multimodal de 45T de tokens, con sparse attention entrenada a 64K de secuencia y extensión a 1M de tokens a partir de 34T de tokens, según la model card.

Sebastian Raschka fue directo: V4.1 es un overhaul enorme y deberían haberlo llamado V5, no un bump 0.1. Esa percepción es la que separa la versión del ruido: es la misma tesis que defiende Latent Space al hablar de whalebros que no se detienen.

KV cache y memoria: donde DeepSeek realmente gana

Para founders construyendo agentes, lo decisivo no es la métrica bruta sino cuánto cuesta mantener el contexto a lo largo de miles de turnos. La model card y el reporte técnico de DeepSeek destacan tres palancas que comprimen la caché KV de forma agresiva:

  • Compressed Sparse Attention 2 con tres modos estáticos por capa (Full, Reindex, Reuse) y un Hierarchical Sparse Indexer en el decoder.
  • KV cache principal en FP4, que reduce la caché global a 890 bytes por token, aproximadamente una cuarta parte de V4-Flash, según la model card recogida por Baseten.
  • SWA Bounded Replay: reconstruye estados KV de sliding-window attention reemitiendo solo los tokens más recientes, llevando la huella persistente a 1/8 de V4-Flash.

El ahorro total reportado por DeepSeek es de 1/4 de HBM y 1/8 de SSD frente a la generación anterior, y de 437x frente al modelo de primera generación, según recoge el hilo de r/LocalLLaMA. En la práctica esto es lo que permite correr un modelo frontera predominantemente desde SSD: el desarrollador Fraser Price reportó 300+ TPS en 4 RTX Pro en precisión completa con menos de 32 GB de RAM del sistema usando un fork de vLLM con soporte SSD, y el propio Salvatore Sanfilippo (antirez) lo confirmó en un M5 Max de 128 GB con streaming SSD, como recoge Latent Space.

Benchmarks: barato no significa débil

Artificial Analysis otorgó a V4.1 Flash un 40 en su Intelligence Index, por encima de V4 Pro y por debajo de GLM-5.3 Flash. En otros benchmarks:

  • AutomationBench-AA: 69%, empatado con GPT-6 Astra y por encima de Grok 4.6 (67%); +15 puntos sobre V4 Flash 0731 y +12 sobre V4 Pro 0813.
  • GDPval-AA v2: 1632 Elo (subida de 164 puntos), superando a Kimi K3 en 1584.
  • AA-LCR v1.1: 84%, al nivel de GPT-5.6 Sol y Gemini 3.8 Flash.

La model card reportada por Baseten añade cifras del propio DeepSeek: 90.6 en Terminal-Bench 2.1 (vs 87.9 de V4 Pro y 88.8 de GPT-5.6 Sol), 74.2 en DeepSWE v1.1 (vs 62.7 de V4 Pro) y 88.1 en Cybergym (vs 83.3 de V4 Pro). Vals lo coronó como nuevo #1 open-weight en su índice, a US$0,30 por test, el más barato del top 10.

Hay un asterisco importante: V4.1 Flash es uno de los modelos más verbosos medidos, con 89k tokens por tarea del Intelligence Index, un 25% más que GLM-5.3, un 62% más que V4 Pro 0813 y por encima incluso de Claude Opus 5. Pero gracias al precio por token, el coste total por tarea sigue siendo el más bajo del tablero.

Por qué DeepSeek jubiló V4 Pro

DeepSeek está haciendo algo inusual: retirar su propio flagship antes de lanzar el sucesor. Desde el 14 de septiembre de 2026, todas las llamadas a deepseek-v4-pro se enrutan automáticamente a V4.1 Flash con la tarifa del modelo pequeño, según Baseten y TechRepublic. El propio Cui Tianyi, jefe del equipo Harness de DeepSeek, lo justificó en X: "Dado que V4.1 Flash supera a V4 Pro en todas las métricas, no sería apropiado cobrar más por el modelo peor", recoge SCMP vía TechRepublic.

Los endpoints deepseek-v4-flash y deepseek-v4-flash-vision-exp también quedan deprecados y enrutados a V4.1 Flash. La señal es clara: DeepSeek está apostando todo a la familia V4.1 y al pricing agresivo por token, no al modelo más grande.

Qué significa esto para tu startup

Para un founder hispanohablante construyendo producto con IA, V4.1 Flash cambia tres cuentas importantes en la hoja de cálculo:

  • Coste por agente de larga duración cae en picado. Si tu agente hace 50 turnos con caché persistente, el KV cache 8x más pequeño convierte un cuello de botella HBM/VRAM en un cuello de botella SSD. Eso significa que puedes correr agentes de producción sin pagar GPUs frontera todo el tiempo.
  • MIT license + open weights = puedes deployar en local. El modelo está en Hugging Face bajo MIT, lo que permite uso comercial, fine-tuning y self-hosting. Si trabajas con datos sensibles de clientes en sectores regulados (salud, legal, finanzas en LATAM), ya no necesitas pasar por la API de un tercero.
  • El benchmark que importa es el tuyo. Latent Space y TeortaxesTex coinciden: V4.1 Flash está optimizado para minimal harnesses, no para harnesses cargados de skills y tools. Antes de migrar, mide con tu propio set de evaluación y tu propio harness.

Acciones concretas que puedes tomar esta semana:

  • Audita el coste de caché en tu pipeline actual. Calcula cuántos tokens de entrada reusables por sesión tienes realmente. Si pasas del 60% de cache hit rate, el precio de US$0,006 por millón de cache input puede recortar tu factura de inferencia entre 5x y 10x.
  • Prueba V4.1 Flash en cargas agentic largas, no en Q&A cortas. El modelo brilla en workflows con mucho prefill y contexto sostenido. Mide coste por tarea completada, no por token aislado.
  • Evalúa el combo "planificador grande + ejecutor chico". En r/LocalLLaMA, varios desarrolladores sugieren usar V4.1 Flash como planificador y modelos destilados (Qwen 27B/35B) para ejecución local. Es el patrón emergente en coding agents de bajo coste.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...