IBM Granite 4.2: modelos de razonamiento abiertos en 3B, 8B y 30B

Granite 4.2: la nueva familia de modelos de razonamiento abiertos de IBM

IBM publicó Granite 4.2, su primera familia de LLMs densos, decoder-only, optimizados para razonamiento, en tres tamaños (3B, 8B y 30B), todos bajo licencia Apache 2.0. El anuncio, detallado en el blog oficial de Hugging Face, marca un giro en la estrategia de la línea Granite: si las versiones previas eran buenos asistentes de instrucción, Granite 4.2 añade razonamiento explícito y un modo nativo de uso de herramientas.

Según el post técnico del Granite Team de IBM, cada modelo fue pre-entrenado desde cero sobre aproximadamente 15 billones de tokens con una estrategia de cinco fases que extiende la ventana de contexto hasta 512K tokens, seguido de supervised fine-tuning (SFT) y un pipeline de reinforcement learning (RL) en múltiples etapas. Los modelos 8B y 30B, además, pasan por un bloque de RL agéntico donde aprenden a operar con herramientas en entornos reales.

Para founders hispanohablantes, lo más relevante no es la arquitectura interna sino las consecuencias prácticas: tienes razonamiento de calidad comparable a modelos cerrados, ejecutable en tu propia infraestructura y sin pagar licencia por usuario.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Qué pueden hacer los modelos y en qué se diferencian los tres tamaños

Granite 4.2 introduce tres capacidades clave que lo separan de la mayoría de LLMs abiertos:

  • Modo thinking / non-thinking conmutable. Cada modelo puede producir una cadena de razonamiento antes de su respuesta, o responder directamente. Un low-effort mode intermedio gasta poco presupuesto de razonamiento en preguntas fáciles, lo que reduce latencia y coste por token.
  • Tool calling nativo en formato OpenAI. Servido por un endpoint compatible con vLLM, los modelos emiten llamadas a herramientas en el formato de function-calling de OpenAI y se integran en harnesses agénticos sin pegamento adicional. También está soportado en SGLang mediante su cookbook.
  • Soporte multilingüe nativo en doce idiomas: inglés, alemán, español, francés, japonés, portugués, árabe, checo, italiano, coreano, neerlandés y chino. Relevante para founders en LATAM y España que necesitan servir usuarios en español sin afinar el modelo.

La división entre tamaños es la siguiente:

Tamaño Rol principal RL agéntico
3B Modelo fundacional con RL básico y alineación No
8B Añade RL agéntico (SWE, Terminal, Search)
30B Versión completa con tres rondas de RLVR y todo el bloque agéntico

Los benchmarks publicados por IBM muestran brechas claras: en SWE-Bench Verified, el 30B alcanza 57.00 frente a 47.67 del 8B (el 3B no aplica); en Terminal-Bench 2.1, el 30B llega a 29.24 contra 20.56 del 8B. En razonamiento matemático, el 30B obtiene 89.17 en AIME25 y en HMMT Feb25, mientras el 3B se queda en 78.33 y 66.67 respectivamente.

El pipeline de entrenamiento: cinco fases y RL agéntico real

Lo más interesante del anuncio no es solo el resultado, sino el proceso. Granite 4.2 no se entrena como un modelo de razonamiento tradicional; sigue un currículo por etapas que combina RL verificable con RL agéntico en entornos reales.

Fase 1 – Pre-training. Decoder-only denso con Grouped Query Attention (40 cabezas de atención, 8 KV heads), RoPE con θ = 10.000.000, MLP con SwiGLU y RMSNorm. Entrenamiento desde cero sobre ~15T tokens en cinco fases que van desde datos web generales hasta curación de alta calidad, terminando con entrenamiento de contexto largo a 512K tokens.

Fase 2 – Supervised Fine-Tuning (SFT). El corpus combina datos agénticos (31.6%) y no agénticos (68.4%), totalizando ~7.2 millones de muestras (~100B tokens), de los cuales ~65B son entrenables. El bloque agéntico cubre ingeniería de software (69%), tool calling (12.1%), uso de terminal (8.0%), matemáticas (3.5%), búsqueda (0.8%) y acción (0.2%). El corpus no agéntico incluye instrucción (18.8%), código (18.8%), matemáticas (14.6%), multilingüe (7.0%), ciencia (5.4%), razonamiento (3.0%) y seguridad (0.8%).

Como jueces de calidad se usan GPT-OSS-120B y Gemma 4, además de deduplicación SHA-256 sobre la combinación de campos tools y messages. Los harnesses utilizados para generar trayectorias agénticas incluyen OpenHands, OpenCode, Terminus-2, SWE-agent, OpenResearcher, MiniSWE, OpenSeeker, EnvScaler, Gemini CLI, Hermes, Codex y Goose.

Fase 3 – Pipeline de RL multi-etapa. En lugar de un solo pase de RL, Granite 4.2 corre una cadena de etapas enfocadas:

SFT → RLVR → Skill boosters → SWE agent → Terminal → Search → RLHF
       └─── foundational RL ───┘   └──── agentic RL (8B / 30B) ────┘

El algoritmo es GRPO asíncrono (Group Relative Policy Optimization) sin red de valor, con ventajas group-relative usando leave-one-out baseline. Esto significa que cada respuesta se juzga contra la media de recompensa de las otras muestras del mismo prompt, eliminando la necesidad de un modelo de valor separado.

Las etapas agénticas son las que justifican la mayor parte del hype:

  • SWE agent. Cada tarea es un repositorio real en su propio sandbox, ejecutado con el harness OpenHands. La recompensa es verificable: ¿pasan los tests ocultos?
  • Terminal agent. Tareas multi-paso en una shell real, ejecutadas mediante los harnesses Harbor / Terminus-2. Recompensa por tarea completada.
  • Search agent. Preguntas multi-hop resueltas con búsqueda web en vivo dentro de un loop de navegación. Recompensa por juez LLM sobre la respuesta final.

La infraestructura de entrenamiento corre sobre un cluster NVIDIA GB200 NVL72 de CoreWeave, con dominio NVLink de 72 GPUs y fabric InfiniBand NDR de 400 Gb/s. El stack de software se reparte entre NeMo-RL (entrenamiento, con Megatron-Core y vLLM) y NeMo-Gym (rollouts, entornos, sandboxes y recompensas como Resources intercambiables).

Qué significa esto para tu startup

Para un founder técnico hispanohablante, Granite 4.2 baja varias barreras que hasta ahora estaban en manos de OpenAI, Anthropic o Google:

  1. Coste de inferencia predecible. Al ser open weights bajo Apache 2.0, puedes desplegarlo en tu propio hardware o en un proveedor GPU. Los modelos cuantizados (FP8, NVFP4, MXFP4 vía LLM Compressor y GGUF vía llama.cpp en formatos Q2K a Q80) cubren desde GPUs de consumo hasta servidores de producción. Para una startup con márgenes ajustados, eliminar la factura por token de un modelo de razonamiento propietario cambia la ecuación.
  2. Soberanía de datos. Si tu producto maneja datos sensibles (salud, legal, finanzas, B2B europeo bajo GDPR), correr el modelo on-prem significa que ningún prompt sale de tu infraestructura. Esto era impensable con o1 o Claude con modo de razonamiento hasta hace poco.
  3. Agentes que llaman herramientas de verdad. El RL agéntico en OpenHands y Terminus-2 significa que el 8B y el 30B no solo «saben» llamar funciones: han sido entrenados con recompensas reales por completar tareas multi-turno en sandboxes. Si construyes un agente de coding, un copilot de terminal o un asistente de research, este punto importa más que el benchmark de MMLU.
  4. Acción concreta #1: Levanta un servidor vLLM con Granite 4.2 8B en una sola GPU de 24 GB y conecta OpenCode o Pi como harness de coding. Tienes en minutos un asistente agéntico comparable a un Copilot básico, sin enviar código a un tercero.
  5. Acción concreta #2: Usa el modo low-effort para clasificación, extracción y Q&A simple (latencia baja, coste bajo). Reserva el modo thinking completo para código complejo, planificación y razonamiento multi-paso. El switch está disponible por request, lo que te permite enrutar consultas según complejidad sin mantener dos modelos.

Cuándo tiene sentido elegir Granite 4.2 frente a alternativas como DeepSeek R1 Distill. El artículo de XDA Developers que probó DeepSeek R1 Distill Llama 8B localmente concluyó que «DeepSeek built its reputation on R1, a reasoning model trained mostly through reinforcement learning». La diferencia con Granite 4.2 es la profundidad del RL agéntico: DeepSeek R1 es un modelo de razonamiento puro, mientras Granite 4.2 8B/30B además aprende a operar herramientas en entornos reales con recompensas sparse. Si tu producto necesita agentes que editen código o naveguen la web, Granite 4.2 está entrenado específicamente para eso.

Conclusión

Granite 4.2 no es solo «otro modelo abierto»: es una apuesta de IBM por cubrir todo el espectro entre razonamiento, agente y cumplimiento empresarial en una sola familia. La licencia Apache 2.0, el multilingüismo nativo (incluido español), el contexto de 512K y el RL agéntico verificable lo convierten en una opción real para founders que necesitan desplegar LLMs serios sin ceder el control de los datos ni pagar royalties por inferencia.

El 3B cubre casos de inferencia barata en hardware modesto; el 8B es el sweet spot para la mayoría de productos SaaS con herramientas; el 30B entra cuando necesitas el máximo rendimiento en razonamiento y agéntico y tienes la GPU para soportarlo. Lo que cambias a cambio es la responsabilidad de operar la infraestructura, algo que ya es rutina en cualquier startup con producto AI serio.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...