Jalapeño de OpenAI rinde 1.9x más que Nvidia GB300

OpenAI publica los primeros benchmarks de Jalapeño frente a Nvidia

OpenAI presentó este martes los primeros benchmarks de Jalapeño, su chip propio de inferencia que desarrolla con Broadcom: entre 1.5 y 1.9 veces más trabajo de IA por vatio y una latencia de extremo a extremo entre 1.7 y 3.6 veces menor que la registrada con los superchips Nvidia GB200 y GB300, según el blog post de la compañía y una sesión informativa con Richard Ho, vicepresidente de hardware de OpenAI. Para una startup hispanohablante que ya construye productos sobre la API de OpenAI, este anuncio anticipa un escenario en el que la inferencia barata y rápida deje de ser el cuello de botella y los agentes en producción respondan en tiempos más cercanos al instante.

Qué midió OpenAI exactamente y frente a qué

Las pruebas se hicieron sobre InferenceX, una plataforma pública de benchmarks para inferencia. OpenAI comparó Jalapeño con los mejores registros disponibles en ese momento, conseguidos con los superchips Nvidia GB200 y GB300. Las cifras, reportadas por The Verge, son las siguientes:

  • Eficiencia energética: 1.5x a 1.9x más trabajo de IA por vatio que los sistemas comparados.
  • Latencia de extremo a extremo: 1.7x a 3.6x menor.

Los modelos usados en la batería de pruebas fueron GPT-OSS 120B, DeepSeek R1 y Kimi K2.5 1T, una mezcla que cubre desde pesos abiertos hasta modelos de frontera. Richard Ho lo resumió como el "mejor de ambos mundos": combinar alta capacidad de procesamiento (throughput) con baja latencia, un equilibrio que en inferencia suele ser de suma cero.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Qué es Jalapeño y por qué OpenAI apostó por un ASIC

Jalapeño es un ASIC (Application-Specific Integrated Circuit), un chip diseñado desde cero para una sola tarea: ejecutar modelos ya entrenados, no entrenarlos. Esa es la diferencia clave frente a las GPUs de Nvidia, que son procesadores de propósito general pensados sobre todo para entrenamiento.

El chip fue presentado originalmente en junio de 2026, cuando Broadcom confirmó que había completado el ciclo de diseño a tape-out en solo nueve meses, uno de los plazos más cortos jamás registrados en un semiconductor avanzado. La fase de tape-out es el momento en que el diseño se envía a fabricar, así que ese número habla del ritmo de iteración del equipo, no del calendario comercial.

La arquitectura física, según reportó Forbes, integra una sección grande de cómputo junto a seis stacks de memoria de alto ancho de banda (HBM), precisamente para atacar el cuello de botella que más frena a los grandes modelos de lenguaje: mover datos entre memoria y cómputo. Broadcom también aporta su silicio de red Tomahawk y Celestica se encarga del board, rack e integración de sistema.

Broadcom: el ganador silencioso de la era de los chips a medida

Aunque OpenAI firma el anuncio, Broadcom es quien captura el valor durable del programa. Su presidente y CEO, Hock Tan, dijo en junio que Jalapeño ejecuta inferencia a aproximadamente la mitad del costo de una GPU de IA típica, aunque Forbes advierte que ese número es de Broadcom, sobre workloads elegidos por OpenAI, y debe leerse como tendencia, no como cifra auditada.

Lo relevante para el ecosistema es que Broadcom está dentro de los chips a medida de Google, Meta y OpenAI a la vez, lo que convierte a la empresa en un peaje ineludible de la nueva capa de infraestructura. Forbes reporta que Broadcom declaró 8.400 millones de dólares en ingresos por chips de IA en el primer trimestre de su año fiscal 2026, un 106% más interanual, y que mantiene una cartera de pedidos comprometidos por 73.000 millones de dólares, casi la mitad de su backlog total, con una ruta pública hacia 100.000 millones de dólares anuales en ingresos por chips de IA para 2027.

El calendario real y la dependencia que OpenAI no rompe

OpenAI adelantó que desplegará Jalapeño en "volúmenes pequeños" antes de fin de 2026 y que el ramp-up llegará en 2027, aunque no reveló cuántos chips piensa desplegar el próximo año. Mientras tanto, la empresa desarrolla la segunda y la tercera generación del chip.

Dos puntos clave del propio anuncio:

  • Jalapeño no reemplaza a Nvidia. Richard Ho fue explícito: la estrategia de cómputo de OpenAI incluye "muy buenos socios", y Nvidia sigue dentro. Jalapeño cubre solo inferencia, no entrenamiento.
  • La fabricación depende de TSMC. Toda la cadena —incluido el packaging avanzado que une cómputo y memoria en una misma pieza— pasa por Taiwan Semiconductor, cuya capacidad de packaging avanzado está vendida por completo durante 2026, según Forbes.

TechRepublic añade que el volumen real no estará a pleno rendimiento hasta el primer semestre de 2028, y que OpenAI persigue un objetivo declarado de 10 gigavatios de cómputo para 2029, una escala que exige mucho más que un ASIC de primera generación.

Qué significa esto para tu startup

El dato operativo más concreto para un founder hispanohablante que ya corre modelos en producción es este: la inferencia es la factura recurrente, no el entrenamiento. Cada llamada a la API de OpenAI paga energía, GPUs y red, y cada mejora de 1.5x–1.9x en trabajo por vatio o de 1.7x–3.6x en latencia es margen que, en algún momento, OpenAI trasladará a precio o a capacidad.

Acciones que podés tomar desde hoy:

  • Recalculá tu unit economics de IA. Si tu producto depende de latencia conversacional (chatbots, agentes, voicebots), presuponé que la latencia caerá y que los modelos grandes como Kimi K2.5 1T o GPT-OSS 120B serán utilizables en flujos interactivos donde hoy no lo son. Reescribí tu pricing asumiendo que el costo por token puede bajar entre 30% y 50% en los próximos 18 meses.
  • Diseña para inferencia barata, no para entrenamiento caro. El entrenamiento seguirá dependiendo de Nvidia y de unos pocos hiperescaladores; tu ventaja competitiva no está ahí. Está en cómo orquestas cachés, prefetch y enrutamiento entre modelos según el tipo de tarea. Los benchmarks de InferenceX sugieren que el equilibrio entre velocidad y costo se mueve a favor de quien sabe distribuir carga entre varios modelos abiertos y de frontera.

Por último, no confundas "ASIC para inferencia" con "OpenAI se independiza de Nvidia". La realidad es más matizada: OpenAI construye una segunda capa sobre Nvidia, no en lugar de Nvidia. Tu estrategia de proveedores (OpenAI, Anthropic, modelos abiertos en tu propia infraestructura con GPUs) sigue siendo diversificada por una buena razón.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...