OpenAI Jalapeño: hasta 3,6x más rápido que Nvidia Blackwell

Jalapeño en cifras: lo que midió SemiAnalysis

OpenAI presentó el 25 de agosto de 2026, en la conferencia Hot Chips, los primeros resultados de Jalapeño, su primer chip ASIC de inferencia. La prueba se hizo sobre InferenceX, el benchmark público de SemiAnalysis, con tres modelos abiertos: GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T.

Los números que OpenAI publicó:

  • 1,5 a 1,9 veces más rendimiento por vatio frente a sistemas basados en Nvidia GB200 y GB300 (Blackwell) en throughput máximo.
  • 1,7 a 3,6 veces menos latencia de extremo a extremo.
  • 2,1 a 4,1 veces más rendimiento en cargas interactivas de baja latencia, el patrón real de productos como ChatGPT.
  • En Kimi K2.5 1T concretamente: 18.195 tokens mixtos por segundo por kilovatio frente a 11.862 del GB300, con 1,56 s vs 5,31 s de latencia end-to-end.

El consumo medido se quedó en 550 W sostenidos sobre un TDP declarado de 700 W. La comparación se normalizó con la potencia nominal publicada por cada chip, lo que según el análisis de 247WallSt probablemente subestima la eficiencia real de Jalapeño.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Richard Ho, VP de hardware de OpenAI, lo resumió en la rueda de prensa: «es un avance de rendimiento muy significativo sobre el estado del arte».

Por qué OpenAI apostó por un chip propio

Entrenar un modelo cuesta una fortuna, pero se hace una vez. Servirlo —la inferencia— cuesta dinero cada vez que alguien hace una llamada, y con agentes que ejecutan decenas de pasos por tarea, el coste por token se ha convertido en la línea que más rápido crece en la cuenta de resultados. Jalapeño no se venderá a terceros: OpenAI lo desplegará en su propia infraestructura para bajar el coste por token y diversificar su dependencia de Nvidia.

Tres decisiones técnicas que lo explican:

  • Diseño vertical completo. OpenAI diseñó chip, memoria, red y software de serving de forma conjunta. Eso permite colocar la KV cache cerca del cómputo y minimizar movimiento de datos, que es donde se va la mayor parte de la energía en inferencia.
  • Optimización para prefill + decode + comunicación. Las tres fases del pipeline de inferencia suelen estar optimizadas por separado en una GPU; Jalapeño las trata como un solo problema.
  • Co-diseño con sus propios modelos. Implementaciones de atención y mixture-of-experts generadas por los modelos de OpenAI corrieron 1,5 a 1,8 veces más rápido que las escritas por humanos, según la propia compañía.

El chip se fabricó con Broadcom (diseño de silicio) y Celestica (integración de placa y rack). El recorrido de diseño a tape-out fue de unos nueve meses.

Lo que Jalapeño no cambia (todavía)

Conviene leer el titular sin perder de vista lo que OpenAI escribió en su propio comunicado: «Seguiremos desplegando aceleradores de NVIDIA y otros socios tanto para entrenamiento como para inferencia». Un cliente que estuviera dejando a su proveedor no escribe esa frase.

Tres matices que el "supera a Nvidia" esconde:

  • No usa Multi-Token Prediction (MTP). Las configuraciones rivales comparadas sí la activaban. Cuando Jalapeño la incorpore, los analistas creen que el rendimiento subirá más.
  • La comparación justa es contra Vera Rubin, no contra Blackwell. SemiAnalysis sostiene que, en tokens por megavatio, Jalapeño aún le gana a Vera Rubin (la próxima generación de Nvidia, con HBM4 como Jalapeño), y en coste total por token quedan aproximadamente empatados.
  • Parte de la ventaja es estructura de margen. Como señala FinanceFeeds, parte del ahorro viene de «cambiar los márgenes altos de Nvidia por los márgenes altos (pero más bajos) de Broadcom», más que de una superioridad intrínseca del silicio.

Nvidia mantiene dos ventajas que ningún ASIC le discute: el entrenamiento de modelos frontera y el ecosistema CUDA, casi dos décadas de librerías y conocimiento acumulado.

El ecosistema de chips a medida en 2026

Jalapeño llega a un mercado que ya no es monólogo de Nvidia. El gasto en cómputo para centros de datos partió de unos 215.000 millones de USD en 2025 según el reporte 2026–2040 de ResearchAndMarkets, y la categoría de ASIC de IA es la de mayor crecimiento. Hoy los hyperscalers tienen su propio silicio:

  • Google TPU: siete generaciones, empezó a facturar por venta directa a clientes externos en el trimestre cerrado en junio de 2026.
  • AWS Trainium / Inferentia: el negocio de silicio a medida de Amazon (Trainium, Inferentia, Graviton, Nitro) superó los 20.000 millones de USD de run-rate anual a principios de 2026.
  • Microsoft Maia: la generación 200 ya corre GPT-5.2 y Copilot en centros de datos de Arizona e Iowa; Maia 300, con un pedido de más de 300.000 unidades a TSMC, se presentaría en septiembre de 2026.
  • Meta MTIA: en producción para cargas de recomendación e inferencia.

Hay un cuello de botella común: el CoWoS de TSMC, la tecnología de empaquetado 2.5D que toda GPU y ASIC moderna necesita para conectar lógica con HBM. A mediados de 2026 los plazos de entrega son de 52 a 78 semanas y Nvidia controla aproximadamente el 60 % de la capacidad asignada, según el análisis de TechTimes. Cualquier plan de silicio propio choca, en última instancia, con quién reserva obleas de CoWoS.

Broadcom, socio de OpenAI, ha guiado hacia 100.000 millones de USD en ingresos de IA en 2027. Jalapeño es el argumento más visible para esa tesis.

Qué significa esto para tu startup

El chip de OpenAI no cambia tu API de mañana, pero sí cambia las reglas del juego en las que vas a operar durante los próximos 18 meses.

1. Calcula tu coste real de inferencia, no el de la demo. Si tu producto depende de un LLM por agente o por flujo, el coste por token ya pesa más que el coste de entrenamiento. Modela tres escenarios: API de OpenAI estándar, infraestructura dedicada (cuando esté disponible para partners) y, si construyes tu propio modelo, un chip a medida como línea futura. Tu economía de margen depende de cuál elijas.

2. Diseña tu stack para que sea portable entre aceleradores. El mensaje explícito de OpenAI —seguiremos con Nvidia y otros— y la estrategia multi-vendor con Cerebras (ya en producción para el tier Ultrafast de OpenAI) confirman que ningún proveedor será monolítico. Evita acoplarte a primitivas específicas de CUDA. Prioriza frameworks y runtimes (vLLM, TensorRT-LLM, MLX, ONNX) que soporten múltiples backends de hardware.

3. Vigila la Hoja de Ruta de Broadcom y el roadmap de Maia 300. Si tu tesis de inversión o tu plan de capex dependen de cuándo se abarata la inferencia, los próximos hitos a marcar en el calendario son: despliegue inicial de Jalapeño a finales de 2026 en volúmenes pequeños, escala en 2027, anuncio de Maia 300 en septiembre y el ciclo de Vera Rubin de Nvidia. La convergencia entre esas fechas es donde aparecerá el próximo recorte estructural de coste por token.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...