IBM lanza Granite 4.2: razonamiento y agentes bajo Apache 2.0

IBM Granite 4.2: la apuesta abierta de IBM por razonamiento y agentes

IBM presentó Granite 4.2, su primera familia de modelos densos, solo decodificador, entrenados desde cero para razonar de forma explícita y operar como agentes en entornos reales. El anuncio, fechado el 25 de agosto según el reporte técnico del Granite Team que recogió Unite.ai, llega con tres tamaños (3B, 8B y 30B parámetros) bajo licencia Apache 2.0, lo que permite descargar los pesos, ajustarlos y desplegarlos en producción comercial sin pagar regalías al propietario del modelo.

La diferencia respecto a versiones anteriores no es solo de tamaño: cada modelo ahora expone un interruptor de pensamiento dentro de su plantilla de chat, con tres modos —pensar, no pensar y esfuerzo bajo— para gastar presupuesto de razonamiento según la complejidad de la pregunta. En conversaciones multi-turno, el pensamiento de turnos previos se descarta por defecto para no agotar la ventana de contexto.

Tres tamaños, un mismo interruptor de pensamiento

Los tres modelos comparten arquitectura de transformador denso, solo decodificador, con atención de consultas agrupadas, ocho cabezas de claves y valores, RoPE con theta de 10.000.000, bloques SwiGLU, RMSNorm y precisión bfloat16. La longitud de secuencia publicada es de 131.072 tokens (128K), aunque el preentrenamiento extendió el aprendizaje hasta 512K en una fase específica de contexto largo.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

IBM distribuye los modelos según el perfil de cómputo que requieren:

  • Granite 3B: pensado para desarrolladores individuales o empresas emergentes que ejecutan modelos locales en Ollama o LM Studio, con cuantizaciones GGUF que llegan hasta Q4KM. Soporta los tres modos de pensamiento y la llamada a herramientas nativa.
  • Granite 8B: apunta a equipos con una GPU moderna, ya recibe aprendizaje por refuerzo agéntico y maneja tool-calling en formato OpenAI function-calling compatible con vLLM y SGLang.
  • Granite 30B: modelo insignia, post-entrenado desde la base Granite 4.1 30B, dimensionado para un nodo multi-GPU; soporta FP8 y NVFP4, y produce el cierre de la familia en los benchmarks agénticos.

Los pesos están entrenados y evaluados en 12 idiomas, según el model card reportado por Unite.ai, lo que incluye inglés, alemán, japonés, árabe, coreano y chino, entre otros. Para sectores regulados —financiero, salud, sector público, telecomunicaciones— la apertura Apache 2.0 baja la barrera de adopción frente a modelos propietarios, aunque no elimina el coste de infraestructura, evaluación, seguridad y supervisión.

Aprendizaje por refuerzo agéntico: la diferencia entre 3B y 30B

Donde Granite 4.2 se separa de otros abiertos no es en el preentrenamiento, sino en el post-training. IBM describe un pipeline de refuerzo por etapas en el que cada fase es un entrenamiento independiente que arranca desde el checkpoint anterior:

  • Primero, RLVR (refuerzo con recompensas verificables) sobre matemáticas, código con tests ocultos y tareas de formato.
  • Después, boosters de habilidad y tres fases agénticas solo en 8B y 30B: ingeniería de software dentro del arnés OpenHands (se edita código en repos reales y se valida con el test suite oculto), uso de terminal con hasta 64 turnos de entorno por rollout, y búsqueda web multi-hop con juez LLM.
  • Cierre con RLHF para preferencia y seguridad, que añade una penalización por longitud de razonamiento para evitar las cadenas verbosas típicas de los modelos "pensantes".

Toda la fase corre con GRPO asíncrono (optimización relativa al grupo), que elimina la red de valores tradicional: en lugar de estimar cuánto vale una acción, cada respuesta se puntúa contra la media de las demás muestras para el mismo prompt. El bucle separa workers que generan trayectorias en un buffer compartido y un entrenador que actualiza pesos en streaming; una guardrail impide que los generadores se queden a más de un update de retraso, y un muestreo de importancia truncado clava la deriva fuera de política.

Los números publicados por IBM —que conviene leer como resultados reportados, no como garantía universal— muestran la separación entre tamaños:

  • SWE-Bench Verified: 47,67 (8B) y 57,00 (30B); 3B no se reporta en esta prueba.
  • Terminal-Bench 2.1: 20,56 (8B) y 29,24 (30B).
  • τ³-bench: 50,99 (3B), 66,34 (8B), 68,05 (30B).
  • AIME25: 78,33 (3B), 86,67 (8B), 89,17 (30B).
  • RULER 128K (contexto largo): 55,30, 71,41 y 81,38 respectivamente.

El salto entre 3B y 8B en las pruebas agénticas no es lineal: coincide con el corte del bloque de RL agéntico, que no se aplicó al modelo pequeño. El entrenamiento se ejecutó sobre un clúster NVIDIA GB200 NVL72 alojado por CoreWeave, con 72 GPUs en dominio NVLink y fabric InfiniBand de 400 Gb/s, según Granite Team citado por Unite.ai. IBM añadió además un billón de tokens de código sintético generado con CodeAlchemy.

Granite Speech 5.0 Turbo: transcripción a escala

El mismo día IBM liberó Granite Speech 5.0 Turbo CTC, dos modelos de voz de 470 millones de parámetros que renuncian a un LLM de respaldo y convierten audio en texto directamente con una cabeza CTC (clasificación temporal conexionista). IBM reporta un rendimiento cercano a 12.600 veces tiempo real en una sola GPU H200, frente a aproximadamente 6.000 veces tiempo real para los líderes actuales de la tabla Open ASR, según las cifras que recoge el artículo original. La compañía también publicó una demo basada en WebGPU para probar el modelo localmente sin servidor.

La decisión de no apoyarse en un modelo de lenguaje reduce latencia y coste por transcripción, lo que resulta atractivo para centros de contacto y operaciones de alto volumen. Como toda métrica publicada por el proveedor, exige validación propia con los idiomas, ruidos y acentos reales de cada operación antes de comprometer producción.

¿Qué significa esto para tu startup?

Granite 4.2 reduce una de las fricciones históricas del open source: la separación entre "modelo abierto instructivo" y "modelo que actúa". Para un founder, esto abre tres decisiones concretas:

  • Si tu producto necesita razonar sobre datos propios en local: Granite 3B con cuantización GGUF corre en hardware modesto y ya soporta pensar/no pensar. Es viable para prototipos y para añadir un copiloto privado a un SaaS sin enviar datos a un proveedor externo. Planifica una evaluación honesta con tus datos antes de prometer capacidades agénticas — el modelo pequeño no pasó por el bloque de RL agéntico y no debería asumirse equivalente a 8B o 30B en ese terreno.
  • Si quieres automatizar tareas internas con agentes: el bloque agéntico de 8B y 30B es la parte nueva. Úsalo para casos con recompensas verificables — tareas que un script pueda validar— y resérvalo para flujos con sandboxing y logging, porque un modelo con acceso a terminal y buscador puede causar errores fuera de la respuesta. Sandbox, permisos por herramienta y revisión humana del output dejan de ser opcionales y pasan a ser la diferencia entre piloto y accidente.
  • Si operas un contact center o transcripción masiva: Granite Speech 5.0 Turbo CTC es una vía concreta para reducir coste por minuto sin un LLM pesado detrás. Mide con tu propio audio —acentos, ruido, vocabulario de dominio— antes de firmar SLAs sobre cifras reportadas por IBM.

La apertura de los pesos simplifica la auditoría, pero la responsabilidad de validar seguridad, precisión y costes sigue siendo de quien los pone en producción. Y un recordatorio honesto: ningún benchmark publicado por el proveedor sustituye a tu evaluación con tus datos y tus flujos; úsalo para acotar candidatos, no como respuesta final.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...