NVIDIA Nemotron 3.5 Lightning: 30B modelo abierto para agentes de IA

NVIDIA lanza Nemotron 3.5 Lightning, un modelo abierto optimizado para agentes de IA

NVIDIA presentó su nuevo modelo Nemotron 3.5 Lightning, un desarrollo de 30.000 millones de parámetros con arquitectura Mixture-of-Experts (MoE) que activa solo 3.000 millones por token. Según la documentación oficial de NVIDIA, este diseño permite reducir los requerimientos computacionales y la latencia frente al uso permanente de modelos de razonamiento de mayor tamaño, optimizándolo específicamente para la ejecución de alta frecuencia en agentes de IA de larga duración.

El modelo alcanza un 86% de precisión en PinchBench, completando 10.000 tareas aproximadamente un 30% más rápido que Qwen3.6 35B con una precisión comparable. NVIDIA también señala velocidades de salida de hasta cuatro veces las de otros modelos abiertos de tamaño similar.

¿Cómo funciona la arquitectura Mixture-of-Experts?

La arquitectura Mixture-of-Experts (MoE) es clave para la eficiencia de Nemotron 3.5 Lightning. En lugar de activar todos los parámetros del modelo para cada token procesado, un sistema de enrutamiento inteligente envía cada token a solo unos pocos de sus muchos «expertos». Esto proporciona la capacidad de un modelo denso más grande al costo computacional de uno pequeño.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Según la documentación técnica de NVIDIA, el modelo utiliza 128 expertos pero activa solo 6 por token, manteniendo 3.000 millones de parámetros activos de los 30.000 millones totales. Esta eficiencia es fundamental para agentes que necesitan procesar miles de llamadas a herramientas, validaciones de resultados y delegaciones de tareas por segundo.

NeMo Switchyard: el sistema de enrutamiento inteligente

Junto al nuevo modelo, NVIDIA presentó NeMo Switchyard, una biblioteca de código abierto que permite dirigir automáticamente cada solicitud hacia el modelo más adecuado. Esta tecnología permite que las operaciones complejas se envíen a modelos frontier como Nemotron 3 Ultra, mientras que las tareas repetitivas de alto volumen son procesadas por modelos más eficientes como Lightning.

Según NVIDIA, este enfoque de «sistema de modelos» equilibra rendimiento, precisión y costos de inferencia, permitiendo que los agentes de IA funcionen de manera más inteligente, rápida y eficiente. Los desarrolladores pueden configurar perfiles de enrutamiento basados en señales de solicitud y políticas personalizables.

Especificaciones técnicas y optimizaciones

Nemotron 3.5 Lightning incorpora varias técnicas avanzadas de inferencia:

  • Decodificación especulativa: Incluye predicción de múltiples tokens durante el entrenamiento, con modelos draft DSpark (recomendado para DGX Spark) y DFlash para diferentes escenarios de concurrencia
  • Cuantización NVFP4: Checkpoints compatibles con GPUs Blackwell, Hopper y Ampere, usando los mismos kernels especializados que alimentan Nemotron 3 Ultra
  • Entrenamiento optimizado para harnesses: Preparado específicamente para entornos de agentes como OpenClaw y Hermes Agent, además de integrarse con NemoClaw, el stack abierto de NVIDIA para seguridad y administración de agentes

El modelo se distribuye de forma abierta con pesos, datos y recetas de entrenamiento bajo licencia OpenMDW-1.1, permitiendo realizar fine-tuning y adaptarlo a diferentes cargas de trabajo.

Compatibilidad con hardware local y ecosistema

Una de las características más destacadas es la capacidad de ejecución en sistemas locales. Nemotron 3.5 Lightning funciona en:

  • DGX Spark para desarrollo local
  • GeForce RTX 5090 para estaciones de trabajo
  • Jetson para edge computing
  • Herramientas populares como Ollama, LM Studio, llama.cpp y Unsloth

Según pruebas presentadas por NVIDIA, el modelo se sitúa en la frontera de Pareto para modelos pequeños abiertos en el tablero de líderes de EXO Labs local.ai, demostrando equilibrio óptimo entre inteligencia y velocidad en hardware local.

¿Qué significa esto para tu startup?

Para founders que están implementando agentes de IA en sus productos, Nemotron 3.5 Lightning representa una oportunidad concreta para reducir costos operativos y mejorar la latencia de sus sistemas. La eficiencia del modelo permite ejecutar más agentes simultáneamente sin aumentar la infraestructura, un factor crítico para startups que escalan.

Acciones concretas que puedes implementar:

  1. Evaluar el costo por token: Si tu startup utiliza agentes de IA para tareas repetitivas como llamadas a API, validaciones de datos o procesamiento de documentos, calcula cuánto podrías ahorrar migrando de modelos frontier a Nemotron 3.5 Lightning para las tareas de alto volumen. Según NVIDIA, el modelo completa 10.000 tareas un 30% más rápido que alternativas similares.

  2. Implementar enrutamiento inteligente: En lugar de usar un solo modelo para todo, diseña tu arquitectura de agentes con NeMo Switchyard para dirigir automáticamente cada tipo de tarea al modelo más adecuado. Las operaciones complejas van a modelos frontier, mientras que las ejecuciones masivas van a Lightning. Esto optimiza tanto el rendimiento como los costos.

  3. Explorar fine-tuning local: Dado que el modelo es completamente abierto y funciona en hardware local como DGX Spark o RTX 5090, considera entrenar versiones especializadas para tu dominio específico. El tamaño reducido (3B parámetros activos) hace que el fine-tuning sea más rápido y económico que con modelos más grandes.

Ecosistema de partners y disponibilidad

Nemotron 3.5 Lightning cuenta con un ecosistema creciente de partners que incluye:

  • Plataformas de inferencia: Baseten, CoreWeave, Crusoe, DeepInfra, Fireworks AI, Together AI
  • Herramientas locales: Ollama, LM Studio, Unsloth, llama.cpp
  • Frameworks de agentes: LangChain, OpenClaw, Hermes Agent, Cline
  • Proveedores cloud: Amazon SageMaker JumpStart, Google Cloud Gemini Enterprise Agent Platform

El modelo está disponible para probar gratis en OpenRouter y build.nvidia.com, y los pesos se pueden descargar desde Hugging Face y ModelScope. NVIDIA también proporciona cookbooks de implementación para vLLM, SGLang y TensorRT-LLM.

Conclusión

Nemotron 3.5 Lightning representa un avance significativo en la democratización de agentes de IA eficientes. Al ofrecer un modelo pequeño pero potente, completamente abierto y optimizado para ejecución de alto volumen, NVIDIA está abordando uno de los mayores desafíos para startups: escalar sistemas de IA sin que los costos se disparen.

Para founders hispanohablantes, esto significa acceso a tecnología de punta que antes estaba reservada a grandes empresas, con la posibilidad de implementarla tanto en la nube como localmente. La combinación de eficiencia, apertura y compatibilidad con hardware accesible hace de Nemotron 3.5 Lightning una herramienta valiosa para cualquier startup que esté construyendo el futuro de los agentes de IA.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...