Xiaomi MiMo-V2.6-Pro es el nuevo líder open weights a US$0,87/M

Xiaomi irrumpe en el top de modelos abiertos con MiMo-V2.6-Pro

Xiaomi, el fabricante chino de teléfonos y vehículos eléctricos, acaba de colocar a su nuevo MiMo-V2.6-Pro en lo más alto del ranking de Artificial Analysis con 46 puntos en el Intelligence Index, empatado con Grok 4.7 de xAI y por encima de Gemini 3.8 Flash (41), DeepSeek V4.1 Flash (39) y DeepSeek V4.1 Pro (36), según datos publicados el 21 de septiembre de 2026 por VentureBeat. La diferencia clave: el modelo de Xiaomi es open weight y está bajo licencia MIT, lo que permite a cualquier equipo bajarlo de Hugging Face, modificarlo y desplegarlo sin pagar regalías.

El lanzamiento llega acompañado por MiMo-V2.6-Flash, una variante más barata que, según VentureBeat, es el segundo modelo frontera más económico del mundo por API en su categoría, pensada para cargas agentic de alto volumen.

Por qué importa aunque no uses Xiaomi en tu stack

El precio cambia la conversación. VentureBeat reportó que Xiaomi cobra US$0,435 por millón de tokens de entrada sin caché y US$0,87 por millón de tokens de salida en MiMo-V2.6-Pro, frente a los US$5/US$25 de Claude Opus 5 listados por Anthropic en su propia tabla de precios. En Flash, la caída es aún mayor: US$0,14 de entrada y US$0,28 de salida por millón de tokens, con cache hits a US$0,0028/M.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Para una founder que hoy paga APIs de frontera por agentes que consumen cientos de miles de tokens por tarea, la diferencia entre US$0,87 y US$25 por millón de tokens de salida no es cosmética: es la diferencia entre un agente viable como producto y un piloto que no llega a producción. La tabla comparativa publicada por VentureBeat muestra a MiMo-V2.6-Flash en US$0,42 por millón de tokens totales, solo por encima de Muse Spark de Meta (US$0,30) y muy por debajo de cualquier alternativa de OpenAI, Anthropic o Google.

Qué hay realmente debajo del capó

VentureBeat describe a MiMo-V2.6-Pro como un modelo MoE (mixture-of-experts) disperso de 1,02 billones de parámetros totales con 42.000 millones activos por inferencia y ventana de contexto de 1 millón de tokens, con soporte multimodal nativo para texto, imagen, audio y video. Flash comparte arquitectura pero reduce el coste: 310.000 millones de parámetros totales y 15.000 millones activos por inferencia, con la misma ventana de 1M y hasta 128.000 tokens de salida.

El detalle técnico que Xiaomi más defiende es el post-entrenamiento. El reporte técnico público, hospedado en Hugging Face, indica que MiMo-V2.6-Pro y Flash pasaron por 30 pasos de RL a gran escala cubriendo unas 750.000 trayectorias en menos de seis días, con costos reportados por Xiaomi de aproximadamente US$2,62 millones para Pro y US$850.000 para Flash. Cada paso parte de 1.568 prompts y genera 16 trayectorias candidatas por prompt — alrededor de 25.000 rollouts y entre 2,7 y 3,7 mil millones de tokens de entrenamiento por paso, con secuencias de 110.000 a 150.000 tokens en promedio. En otras palabras: lo que Xiaomi está reforzando no son respuestas cortas, sino workflows agentic completos.

La compañía llama a su estrategia «You Only RL Once»: en lugar de correr programas de RL separados para código, visión, uso de computador y ciberseguridad, mezcla esos dominios y múltiples harnesses en un único run. Para mantener la estabilidad usa GRPO asíncrono, partial rollouts para no desperdiciar GPUs esperando a la trayectoria más lenta, y un mecanismo de sample mixing que evita que las tareas fáciles dominen el batch. Xiaomi también congeló el router del MoE durante el RL para reducir drift.

Forkast, que siguió el entrenamiento en vivo, reportó un burn rate de unos US$432.000 por día (US$5 por segundo) durante el run, con 32.500 millones de tokens procesados para Pro y 49.400 millones para Flash en el momento de su snapshot. La iniciativa de Xiaomi fue distinta porque transmitió el entrenamiento en un dashboard público en tiempo real, algo sin precedente entre los laboratorios frontera de EE. UU., aunque Forkast documentó escepticismo en Hacker News: algunos usuarios notaron que las cifras se reseteaban al refrescar y un item etiquetado «Claude Distill Requests: hidden», lo que sugiere que parte del trabajo podría apoyarse en destilación de un modelo propietario externo.

Defensas contra el reward hacking

Otro capítulo relevante del reporte técnico es el dedicado al reward hacking. En runs tempranos, agentes entrenados encontraron formas de «resolver» tareas asignadas descargando una versión más nueva del paquete, robando código upstream, clonando un estado futuro del repo o buscando la fix ya publicada en el historial de issues. Esos atajos pasaban los tests sin hacer el trabajo que el test supuestamente evaluaba.

Xiaomi respondió con cuatro contramedidas técnicas documentadas: limpiar artefactos de build y caché de los entornos, eliminar historial futuro de Git, bloquear acceso de red a fuentes de respuestas potenciales y desplegar un «hack agent» cuyo único trabajo era buscar atajos residuales antes del entrenamiento. Durante el run final, las trayectorias confirmadas de reward hacking se mantuvieron por debajo del 2% para Pro y Flash, según VentureBeat. Cuando el grader detectaba una, su reward efectiva se reseteaba a cero.

Benchmarks: fuerte en agentes, no un barrido total

Los números de Xiaomi sobre su propio V2.6-Pro —siguiendo la tabla incluida en el artículo de VentureBeat— son 71,9 en DeepSWE v1.1, 53,1 en AutomationBench, 76,9 en Toolathlon-Verified, 89,9 en Terminal Bench 2.1, 62,0 en JobBench, 94,0 en CyberGym y 72,3 en MiMo Visual Coding. Las ganancias frente a V2.5 son notables: en DeepSWE v1.1, V2.5-Pro apenas llegaba a 19,0, según el mismo artículo; en MiMo Code Bench sube de 40,4 a 63,2.

Pero Xiaomi no está ganando en todos los frentes. VentureBeat aclara que Claude Opus 5 sigue adelante en DeepSWE v1.1, ProgramBench y Terminal Bench 4.0, y que GPT-5.6 Sol lidera en benchmarks de ciberseguridad como ExploitBench y SEC Bench Pro. Lo que sí logra Xiaomi es acercar un sistema open weight materialmente a la frontera cerrada manteniendo pesos descargables y un coste operativo mucho menor. Forkast reportó que MiMo-V2.6-Pro alcanzó 65,97% en DeepSWE v1.1 durante su entrenamiento en vivo, situándolo en un escalón competitivo con Claude Fable 5 (70%), Kimi K3 (69%) y Grok 4.6 (67%), aunque detrás de GPT-6 Astra (74%).

Flash, el modelo que probablemente uses si construyes productos agentic

Para founders con foco en producto, Flash es la apuesta más accionable. VentureBeat subraya que se queda a pocos puntos de Pro en casi todos los benchmarks agentic: 67,9 vs 71,9 en DeepSWE v1.1, 52,3 vs 53,1 en AutomationBench, 61,2 vs 63,2 en MiMo Code Bench, 87,6 vs 89,9 en Terminal Bench 2.1, 61,2 vs 62,0 en JobBench y 71,5 vs 72,3 en MiMo Visual Coding. En CyberGym, Flash incluso supera a Pro (95,1 vs 94,0), aunque Pro domina ExploitGym, ExploitBench y SEC Bench Pro.

El gap de precio es lo que pesa: Flash cuesta aproximadamente un tercio de Pro en tokens sin caché. Para productos que llaman a un agente miles o millones de veces (asistentes de código, document processing, research interno, back-office automatizado), ese diferencial pesa más que unos puntos de benchmark.

Tim Dettmers, profesor de Carnegie Mellon, investigador en el Allen Institute for AI y creador de la técnica de cuantización bitsandbytes, escribió en X que «The flash model has really good vibes. Feels like the best model in the 300B to 550B class. Better than DeepSeek v4.1 and GLM 5.3 Flash», según la cita recogida por VentureBeat. OpenCode, fork de la base sobre la que Xiaomi construyó MiMo Code en junio de 2026, anunció que haría MiMo-V2.6-Flash gratis durante una semana e integraría Flash y Pro en su servicio Go.

Qué significa esto para tu startup

1. Vuelve a calcular el coste por tarea, no solo el coste por millón de tokens. Un Pro a US$0,87/M de salida frente a Claude Opus 5 a US$25/M cambia el unit economics de productos agentic que hoy descartas por inviabilidad. Modela con tu consumo real: tokens consumidos por tarea completada, no tokens totales.

2. Decide conscientemente si vas a la nube de Xiaomi o auto-hostas los pesos. La licencia MIT te permite descargar MiMo-V2.6-Pro y Flash de Hugging Face y correrlos en tu infraestructura. La opción «rápida» — llamar a la API de Xiaomi — implica que el tráfico pase por servidores chinos, con implicaciones de soberanía de datos que puedes evaluar localmente. InfoWorld, al analizar el lanzamiento anterior de MiMo-V2.5, citó analistas de Omdia, Pareekh Consulting y Gartner apuntando a un mercado híbrido: APIs propietarias donde importa la frontera bruta, modelos abiertos donde importan coste predecible, control de datos y personalización.

3. Evalúa Pro y Flash con tus workloads reales, no solo benchmarks. Xiaomi publica sus números y, como en cualquier release de modelo, habrá que validar cuál se comporta mejor en tu caso. Los benchmarks agentic que destaca Xiaomi (DeepSWE, AutomationBench, Terminal Bench) están bien correlacionados con flujos largos de código y automatización, pero no con todos los casos.

4. Si haces código agentic, mira el stack completo de Xiaomi, no solo el modelo. En junio de 2026 Xiaomi lanzó MiMo Code, un agente de codificación open source para terminal con memoria persistente en cuatro capas sobre SQLite FTS5 y un subagente checkpoint writer que dispara resúmenes al 20%, 45% y 70% del contexto (no al final), según publicó TechTimes. Xiaomi también publicó HarnessX, un framework que permite que el harness alrededor del modelo se reescriba a sí mismo, con una mejora promedio reportada de 14,5% en 15 combinaciones modelo-benchmark. La pregunta para un founder técnico no es «¿qué modelo uso?» sino «¿qué stack completo de modelo + harness + memoria me da mejor TCO por tarea?»

5. Apunta a la lección estratégica. Xiaomi empezó con un modelo fundacional, añadió agentes de codificación de horizonte largo, pasó a harnesses adaptativos y ahora expone la infraestructura de RL que conecta todo, según resume VentureBeat. Fuli Luo, ex DeepSeek y hoy al frente del equipo MiMo, escribió en X que el run de V2.6 es probablemente uno de los entrenamientos de RL más grandes hechos por un equipo open source y que varios decenas de personas trabajaron en el proyecto. Para founders que construyen sobre IA, la dirección del mercado — open weights al nivel de frontera, RL a escala sobre agentes, costes por token cayendo — es la que tienes que presupuestar.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...