DeepSeek V4.1 Flash sin filtros: 100% ASR, -4.22 pp en MMLU

Una variante sin guardrails aterriza en Hugging Face

El 10 de septiembre, el equipo dealignai publicó en Hugging Face el checkpoint DeepSeek-V4.1-Flash-UNCENSORED-FP8, una versión modificada a nivel de pesos del modelo DeepSeek-V4.1-Flash que Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co. lanzó el mismo día. La descarga aplica el método "abliteration" descrito por la investigadora FailSpy: identificar y podar los pesos responsables del circuito de rechazo, dejando intactos los expertos enrutados, la memoria n-gram Engram, la atención dispersa CSA2, la cabeza de decodificación especulativa DSpark, la torre de visión DeepSeek-ViT, las compuertas del router, las normas y los embeddings.

El README lo presenta como un "drop-in checkpoint": carga exactamente igual que el modelo base, sin hooks de runtime, sin vectores de steering y sin model.py personalizado. La alteración queda grabada en los propios números del tensor.

Qué cambia en la práctica: 100% de respuestas problemáticas

El propio README compara el modelo original ("base") contra la versión sin guardrails ("CRACK") en el benchmark HB-320 con dos niveles de razonamiento. En ambos modos, la variante CRACK contesta el 100% de los 320 prompts de HarmBench. El base, en cambio, cae del 42,81% de respuestas problemáticas con razonamiento apagado al 1,56% con razonamiento al máximo, el patrón típico de los modelos que, al encadenar pensamiento, filtran más a fondo.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

La tabla por categorías muestra 100% en las siete rúbricas del benchmark: químico-biológico, copyright, ciberintrusión, acoso, daño general, ilegal y desinformación, tanto con razonamiento apagado como al máximo. La métrica no se agota en el prompt aislado: el README incluye una prueba multi-turno de 4 turnos sobre un tema sensible en la que el modelo mantuvo coherencia sin "reversión tardía" ni auto-corrección en el último turno.

La factura intelectual: -4,22 pp en MMLU, concentrada en ética

El verdadero trade-off está en qué se pierde cuando se borra el circuito de rechazo. La evaluación MMLU pasa de 86,96% (12.211 / 14.042) en el base a 82,74% (11.619 / 14.042) en el CRACK: -4,22 puntos porcentuales.

Pero el README subraya el detalle clave: si se excluyen las cinco materias ético-legales (moralscenarios, businessethics, professional_law, jurisprudence y philosophy), el delta en las aproximadamente 11.000 preguntas restantes es de -1,1 pp, dentro del objetivo declarado de "preservación de conocimiento" de 3 pp. El grueso de la pérdida sale de los 895 ítems de moral scenarios (76,9% → 37,0%, -39,89 pp) y los 1.534 de professional law (75,9% → 68,8%, -7,04 pp).

En otras palabras: la abliteration no degrada masivamente el conocimiento técnico. Lo que deteriora es el juicio donde el circuito de rechazo estaba haciendo trabajo.

Lo que necesitas para servirlo

El checkpoint es FP8 (e4m3fn, escalas E8M0 por bloques de 32x32) con expertos enrutados en FP4 nativo. Los 552.000 millones de parámetros ocupan aproximadamente 510 GB y caben en cualquier dominio NVLink de 4×H200 o más. El README aporta dos recetas SGLang verificadas, ambas sobre 4×H200:

  • Receta A: contexto 1.048.576 (1M), concurrencia segura ~20 peticiones, motor especulativo DSpark activo.
  • Receta B: contexto 262.144 (256k), concurrencia hasta 256, DSpark apagado porque a batches grandes su coste por paso deja de compensar.

El rendimiento medido en la receta A: 101 tok/s en decode single-stream sin especulación, 113 tok/s con DSpark + cap-accept + tabla SPS perfilada, y 126 tok/s agregados en concurrencia 8-way.

El pool de KV global es de 890 bytes/token (el mismo número que DeepSeek declara para el modelo base); mover las tablas Engram a RAM del host (203 GB) libera unos 46 GiB/GPU a cambio de unos 200 GB de RAM del sistema.

Tres condiciones no obvias del README: (1) --ep-size 4 es obligatorio a TP=4 porque moe_intermediate_size=2304 no es múltiplo de 128 al dividirlo entre 4; (2) ninja debe estar en el PATH o el JIT kernel build muere con FileNotFoundError varios minutos después del inicio; y (3) ambos parsers deben nombrarse explícitamente (--reasoning-parser deepseek-v41 --tool-call-parser deepseekv41) porque el chat template del modelo no incluye resolvers automáticos y el contenido del canal <think> filtraría al content si se omiten.

Por qué DeepSeek publicó el base y esto no sale de su cuenta

El lanzamiento original del 10 de septiembre por Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co. tiene una arquitectura MoE con 552.000 millones de parámetros, 8.000 millones activos durante el prompt y 16.000 millones durante la generación, contexto de 1 millón de tokens, visión nativa y licencia MIT. Según DeepSeek, el modelo supera a su propio V4-Pro en Terminal-Bench 2.1 (90,6 frente a 89,1 de Claude Opus 5 y 88,8 de GPT-5.6 Sol) y en DeepSWE v1.1 (74,2% de tareas resueltas). Los precios API se fijaron en 15 centavos por millón de tokens de entrada fuera de pico y 60 centavos por millón de salida, con el doble durante las ventanas pico; a partir del 14 de septiembre, las llamadas a V4-Pro se enrutan automáticamente a V4.1-Flash y se facturan a la tarifa del modelo pequeño, un recorte aproximado del 70% en coste de salida para los clientes del Pro.

La versión de Hugging Face no es de DeepSeek. Es un fork comunitario bajo la misma licencia MIT, lo que permite redistribuir derivados comerciales con sólo mantener el aviso de copyright y la licencia. Por eso el experimento pudo publicarse sin pedir permiso: lo que el autor hizo está cubierto por la licencia que DeepSeek eligió al subir el base.

Qué significa esto para tu startup

El evento encaja en una tendencia de fondo. En la carta abierta "Open Weights and American AI Leadership" de julio, Nvidia y más de 200 empresas respaldaron los pesos abiertos. Vercel reportó en julio que los modelos abiertos corrieron el 36% de los tokens de su AI Gateway absorbiendo sólo el 8,6% del gasto; DeepSeek ya era en esa medición el segundo laboratorio por volumen de tokens, dato recogido por InfoWorld. El V4.1-Flash base, con licencia MIT, acelera ese desplazamiento.

Tres acciones concretas:

  • Antes de desplegar este fork en producción, asume responsabilidad legal y de marca. Que la licencia MIT lo permita no exime de las consecuencias de servir contenido que varias jurisdicciones tipifican como delito (asistencia para drogas, explosivos, ataques a menores). El propio README lo escribe en su cierre: "Uncensored build… take responsibility for what you generate with it."
  • Evalúa el -4,22 pp en MMLU contra tu propio set de tareas. El delta global enmascara el detalle útil: tu app de soporte al cliente, que vive en miscellaneous y high school world history, verá 0 pp; tu módulo de compliance, que vive en professional law y moral scenarios, verá la caída fuerte. Construye tu eval interno antes de migrar.
  • Si eliges el base oficial, planifica el hosting con la receta B (256k contexto, hasta 256 concurrent), no con el millón de tokens. La diferencia operativa es ~4x en concurrencia segura y suele ser suficiente para agentes y RAG. La ventana de 1M exige 4×H200 y concurrencia capada a 20.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...