Nemotron 3 Ultra: el modelo open-weight más rápido de NVIDIA

Qué es Nemotron 3 Ultra y por qué debería importarte

El 4 de junio de 2026, NVIDIA liberó en Hugging Face su modelo open-weight más ambicioso: Nemotron 3 Ultra, una arquitectura de 550.000 millones de parámetros totales que activa solo 55.000 millones por token, una sparsity cercana al 10%. No es solo otro LLM más grande: es un cambio de enfoque para construir agentes de IA que corren procesos largos sin que el costo de inferencia explote.

La jugada de NVIDIA es doble. Por un lado, entrega los pesos abiertos con licencia permisiva, sin obligar a pasar por una API propietaria. Por otro, lo posiciona como el flagship de la familia Nemotron 3, que ya había descargado más de 50 millones de veces antes del lanzamiento de Ultra, según reportó memeburn citando a NVIDIA. Esa tracción previa explica por qué Accenture, CrowdStrike, Palantir y Perplexity aparecen como adoptantes tempranos.

Para un founder, lo concreto es esto: Nemotron 3 Ultra entrega más de 300 tokens por segundo y completa tareas de SWE-bench y Terminal-Bench 2.0 usando aproximadamente un 30% menos de tokens totales por run, gracias a la decodificación especulativa nativa. Si tu cuello de botella hoy es costo por agente o latencia en cadenas largas, este modelo entra directamente en la conversación.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

La familia Nemotron 3: Nano, Super y Ultra

Nemotron 3 Ultra no llega solo. NVIDIA viene publicando los tres niveles desde diciembre de 2025, y cada uno apunta a un perfil de uso distinto:

  • Nemotron 3 Nano (lanzado el 15 de diciembre de 2025): 30.000 millones de parámetros totales, hasta 3.000 millones activos por token, ventana de contexto de 1 millón de tokens. Está optimizado para dispositivos edge, asistentes on-device y workloads de alto volumen donde cada milisegundo cuenta.
  • Nemotron 3 Super: ~100.000 millones de parámetros totales, hasta 10.000 millones activos por token, entrenado en NVFP4 de 4 bits directamente sobre arquitectura Blackwell. Es el workhorse: razonamiento serio y tareas agénticas a un costo de servicio notablemente menor que Ultra.
  • Nemotron 3 Ultra (el flagship): 550.000 millones totales, 55.000 millones activos por token, pensado para sesiones agentic largas de varios turnos.

En agosto de 2026, NVIDIA añadió Nemotron 3.5 Lightning, una variante de 30.000 millones de parámetros enfocada en agentes always-on que prioriza velocidad de salida y personalización barata: según SiliconANGLE, CodeRabbit entrenó un agente router propio durante una época por USD 85 en alrededor de dos horas. Esa trayectoria de la familia muestra una estrategia clara: misma receta base, diferentes tamaños, cada uno optimizado para una capa del stack.

La arquitectura híbrida Mamba-atención: el truco detrás de la velocidad

El corazón técnico de Ultra es lo que NVIDIA llama Mixture-of-Experts Hybrid Mamba-Attention. La mayoría de las capas de procesamiento de secuencia son Mamba-2, un modelo de espacio de estados que mantiene un resumen comprimido del contexto en un hidden state de tamaño fijo, en lugar de comparar cada token contra todos los demás como hace la atención tradicional.

El efecto práctico: la atención escala de forma cuadrática con la longitud de la secuencia (O(n²)), mientras que las capas Mamba-2 escalan de forma lineal (O(n)). En un prompt corto no se nota. En una traza de agente de 200.000 tokens, la diferencia es enorme. NVIDIA mantiene una proporción menor de capas de atención completa intercaladas, suficientes para preservar retrieval de alta precisión sobre contextos largos, justo lo que necesita un agente cuando debe recuperar la firma exacta de una función vista hace cincuenta pasos.

El resultado: Ultra sirve un contexto de 262.000 tokens en BF16 completo y llega a 1 millón de tokens con cuantización NVFP4 sobre hardware Blackwell, sin que el costo de atención explote.

LatentMoE: por qué los 550B parámetros no se desperdician

Un modelo MoE solo es eficiente si el router reparte tokens entre los expertos de forma útil. Si el router colapsa y manda la mayoría del tráfico a un puñado de expertos, terminas pagando por 550.000 millones de parámetros pero usando una fracción mucho menor en la práctica. Es un modo de fallo bien documentado y que empeora cuantos más expertos agregas.

La solución de NVIDIA se llama LatentMoE routing: en lugar de enrutar mirando el embedding crudo del token (rígido, atado a la forma superficial), el router decide sobre una representación latente aprendida junto al resto de la red. Esto permite agrupar tokens por función o contexto, no por similitud léxica, y soportar un pool de expertos más grande y especializado al mismo costo de inferencia. Es una de esas decisiones de ingeniería silenciosas que no aparecen en el titular pero explican por qué Ultra realmente aprovecha sus 550.000 millones de parámetros en vez de un subconjunto efectivo mucho menor.

Multi-Token Prediction nativa y eficiencia en agentes

El tercer pilar es Multi-Token Prediction (MTP) integrada en el modelo, no como modelo draft externo. La decodificación especulativa clásica usa un modelo pequeño separado que propone varios tokens y el grande los verifica en un solo forward pass. NVIDIA lo construye como capas dedicadas dentro de Ultra.

¿Por qué importa? Porque los agentes emiten salida estructurada: llamadas a herramientas, ediciones de código, comandos de shell. Ese tipo de output es más predecible token a token que la prosa abierta, así que la tasa de aceptación del draft sube, y el ahorro en forward passes totales también. NVIDIA reporta que Ultra completa tareas de SWE-bench y Terminal-Bench 2.0 con aproximadamente un 30% menos de tokens por run. Es una métrica más útil que tokens-por-segundo aislados: refleja terminar la misma tarea quemando menos cómputo total.

Los benchmarks: qué dice el Artificial Analysis Intelligence Index

En el Artificial Analysis Intelligence Index, Nemotron 3 Ultra obtiene 48 puntos, el puntaje más alto entre modelos open-weight de EE.UU. según memeburn, que recoge la evaluación independiente. Los siguientes son Gemma 4 31B (39), Nemotron 3 Super (36) y gpt-oss-120b (33). Un salto de 12 puntos sobre su predecesor, significativo en un panorama donde las mejoras suelen medirse en unidades.

En MMLU-Pro registra 66.6 (subiendo desde un baseline de 64.8). En PinchBench, una evaluación específica de productividad agentic, alcanza 91%. Para poner ese número en contexto, memeburn señala que modelos chinos como Kimi K2.6 de Moonshot AI llegan a 54 en el Intelligence Index, y DeepSeek V4 Pro se ubica en ~56 con 1,6 billones de parámetros totales. Ultra no gana en inteligencia bruta global, pero lidera con holgura entre los open-weight de EE.UU. y lo compensa con velocidad: 3 a 6 veces más rápido que sus rivales chinos, que típicamente corren entre 50 y 100 tokens por segundo.

El contexto geopolítico: la brecha EE.UU.-China en open-weight

La foto completa no es solo técnica. Memeburn documenta que entre el 7 y el 24 de abril de 2026, cuatro laboratorios chinos (GLM-5.1, Moonshot con M2.7, Kimi K2.6 y DeepSeek V4) publicaron modelos open-weight de coding en solo 17 días. DeepSeek V4 Pro es hoy el modelo open-weight más grande disponible con 1,6 billones de parámetros.

La lectura estructural es clara: los laboratorios estadounidenses compiten con productos cerrados por suscripción; los chinos invierten agresivamente en open-weight. Para un founder, eso significa dos cosas: (1) hay un piso de calidad open-weight en ascenso constante, y (2) el costo por inferencia sigue bajando más rápido de lo que suben los puntajes de benchmark.

Cómo empezar a usar Nemotron 3 Ultra hoy

La barrera de entrada es baja. El modelo está disponible en Hugging Face y en OpenRouter bajo el slug nvidia/nemotron-3-ultra-550b-a55b:free, con API compatible con OpenAI. Eso significa que si tu pipeline ya usa el cliente openai de Python, solo cambias base_url y el nombre del modelo. También hay serving hospedado en Baseten, DeepInfra, Fireworks, FriendliAI, Together AI y el propio NIM de NVIDIA.

Para self-hosting, los pesos soportan vLLM y NVIDIA NIM, ambos con soporte de primera clase para arquitecturas híbridas Mamba-atención MoE y cuantización NVFP4 sobre Blackwell. La opción de NIM es especialmente interesante si necesitas residencia de datos o fine-tuning sobre flujos propietarios.

Qué significa esto para tu startup

Tres implicaciones concretas si estás construyendo producto con IA en 2026:

  • Reevalúa el costo por agente, no solo el costo por token. Una traza agentic que hoy te cuesta X puede completarse con ~30% menos tokens totales en Ultra. Si tu modelo de negocio depende del margen por tarea completada (no por token servido), esa diferencia se acumula rápido.
  • Diseña un enrutador por tarea, no un solo modelo. Con Nano para triage y clasificación, Super como caballo de batalla, Ultra para razonamiento complejo y Lightning (cuando esté disponible en producción) para tareas always-on, puedes construir una jerarquía que se parece mucho al NeMo Switchyard que NVIDIA presentó en agosto de 2026. La pregunta deja de ser «qué modelo uso» y pasa a ser «qué modelo uso para este paso».
  • Aprovecha la apertura mientras dure. Pesos abiertos, datasets de post-training publicados y recetas de entrenamiento accesibles significan que puedes hacer fine-tuning con datos propios sin pagar licencias por consulta. Es una ventana competitiva real para equipos chicos que antes no podían costear un modelo frontier.

Para founders hispanohablantes, el mensaje operativo es directo: la próxima generación de aplicaciones agentic no se va a construir sobre una sola API propietaria, sino sobre una pila mixta donde los modelos open-weight como Nemotron 3 Ultra cubren la base y los modelos cerrados cubren los casos extremos. Saber cuándo enrutar a cada uno ya no es optimización: es producto.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...