Qué acaban de publicar los benchmarks de Jalapeño
OpenAI presentó el martes en la conferencia Hot Chips los primeros benchmarks públicos de Jalapeño, su chip de inferencia propietario co-diseñado con Broadcom y fabricado en el proceso TSMC N3P (3 nm). Sobre el suite público InferenceX de SemiAnalysis, el chip entregó entre 1,5 y 1,9 veces más trabajo de IA por vatio y entre 1,7 y 3,6 veces menos latencia que sistemas basados en los NVIDIA GB200 y GB300. Para cargas altamente interactivas, las que ejecutan los agentes de IA, la ventaja se amplía hasta 2,1 a 4,1 veces.
Los modelos testeados fueron GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T. En el workload de Kimi K2.5, Jalapeño reportó 18.195 tokens mixtos por segundo por kilovatio frente a los 11.862 del sistema GB300 de comparación, con 1,56 s contra 5,31 s de latencia end-to-end, según cifras recogidas por TechGenyz.
Sam Altman lo resumió en X: «we made a chip and it is fast», un día antes de que Nvidia presente sus resultados del segundo trimestre fiscal. Richard Ho, head of hardware de OpenAI, calificó las mediciones como «un avance muy significativo sobre el estado del arte», según reportó FinanceFeeds.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadPor qué Jalapeño le gana a Blackwell: tres decisiones de diseño clave
El resultado no es magia: sale de tres compromisos arquitectónicos que un GPU de propósito general no puede tomar.
Die único del tamaño máximo del retículo. Jalapeño es un ASIC con un único die que aprovecha toda el área útil del proceso litográfico, con 13,4 PFLOPs de cómputo MXFP4 y 6 stacks de memoria HBM4 (216 GiB totales) con 15,4 TB/s de ancho de banda. El GB300 de NVIDIA ofrece 288 GB de HBM3E a un TDP nominal de 1.400 W. Jalapeño está clasificado en 700 W y, en los workloads testados, se mantuvo en 550 W o menos. Por vatio de consumo nominal, Jalapeño empaqueta aproximadamente un 50% más de memoria que el GB300. Cuando mover datos domina el coste de un LLM, ese 50% extra cambia la economía.
Co-diseño de chip, memoria, red y software. OpenAI no diseñó el silicio aislado: optimizó el sistema entero para mantener el estado del modelo cerca del cómputo y reducir el movimiento de datos entre componentes, que es el cuello de botella real de la inferencia. Es el mismo principio que aplicó Nvidia con su rack Vera Rubin NVL72 (72 GPUs + 36 CPUs Vera por rack), pero llevado al extremo de un solo chip en lugar de un sistema multi-rack.
Lenguaje de kernels propio: Gluon. Jalapeño se programa con Gluon, un lenguaje de kernels desarrollado internamente por OpenAI. Eso rompe la dependencia de CUDA, el ecosistema de Nvidia que durante una década ha sido el principal factor de lock-in de los usuarios de IA con el hardware de Nvidia. Para una empresa que ya entrena sus propios modelos, escribir kernels optimizados a medida es viable; para el resto del mercado, CUDA sigue siendo el lenguaje común.
Lo que estos benchmarks NO dicen
Tres matices que cualquier founder debería tener presentes antes de interpretar las cifras.
Jalapeño no entrena modelos. Es un chip de inferencia. El entrenamiento sigue siendo territorio donde Nvidia no tiene competidor relevante, según el análisis del sector recogido por FinanceFeeds.
La comparación es contra GB200/GB300 en modo single-token. Los despliegues reales de Nvidia suelen usar speculative decoding (predicción multi-token), que cambia la métrica. Sobre la plataforma más reciente de Nvidia, Vera Rubin, que ya entró en producción en julio y de la que Microsoft recibió las primeras unidades el 21 de agosto, SemiAnalysis reconoce que Jalapeño todavía le saca ventaja en tokens de salida por megavatio, pero el coste total por token queda «aproximadamente igualado», reporta FinanceFeeds. Buena parte de la diferencia, además, viene de cambiar «los márgenes altos de Nvidia por los márgenes, más bajos aunque también altos, de Broadcom», apunta SemiAnalysis en el mismo análisis.
Es la primera generación y aún está en muestras. Nvidia pasó a producción completa de Vera Rubin en julio según GCN, con envíos a OpenAI, CoreWeave, Google Cloud, Microsoft Azure, Meta y Dell. Jalapeño llegará en pequeños volúmenes a la infraestructura de OpenAI a finales de 2026, con escalado «significativo» en 2027, y OpenAI ha sido explícita en que seguirá comprando GPUs de Nvidia. Jalapeño no reemplaza a Blackwell: complementa la flota en el workload donde más le duele el coste, la inferencia de LLMs interactivos.
El ecosistema de silicio propio: dónde encaja Jalapeño
OpenAI se suma a un club pequeño: Google con sus TPU (siete generaciones, hasta Ironwood en 2026), Amazon con Trainium e Inferentia, Meta con MTIA, y Anthropic en desarrollo. Broadcom, según IBTimes, está dentro de los programas de Google, Meta y OpenAI, y ha confirmado a Apple también como cliente en su Q1 FY2026. La custom ASICs de Broadcom prometen, según la propia compañía, un 30-50% menor TCO que los GPUs de propósito general para workloads específicos a escala hyperscaler, con una cuota estimada superior al 70% del mercado de diseño de aceleradores custom.
Nvidia no se queda quieta. El mismo día de Hot Chips anunció que su nuevo Groq 3 LPX, un acelerador dedicado a inferencia construido sobre tecnología que Nvidia compró a Groq por 20.000 millones de dólares en diciembre, entra en producción completa. En una prueba con el modelo Gemma 4 31B y ventana de contexto de 100.000 tokens, el LPX alcanzó 3.400 tokens/s, según SiliconAngle. Nebius es el primer cliente confirmado.
El mercado está convergiendo hacia ASICs especializados para inferencia como alternativa eficiente a los GPUs de propósito general, tanto en Estados Unidos (Jalapeño, TPU, Trainium, MTIA) como en China, donde documentamos en junio la apuesta por silicio propio como respuesta a las restricciones de exportación.
Qué significa esto para tu startup
Si estás construyendo sobre modelos de OpenAI, no cambia nada mañana: Jalapeño corre dentro de la infraestructura de OpenAI, no se vende. Pero sí cambia el coste que OpenAI paga por atenderte, y eso eventually se traslada a tu factura.
Tres acciones concretas.
- Abstrae tu proveedor de inferencia desde el día uno. Diseña tu capa de inferencia para poder cambiar entre OpenAI, Anthropic, Google Gemini o un modelo open source servido en tu propio hardware sin reescribir tu producto. Jalapeño, Vera Rubin, TPU v7 y Groq 3 LPX demuestran que la capa de silicio se va a fragmentar en los próximos 18 meses.
- Mide coste por token bajo carga real, no en benchmarks. Tanto SemiAnalysis como el análisis de Forbes sobre la cifra de Broadcom («roughly half the cost of a typical AI GPU») coinciden en que los benchmarks de vendor hay que tratarlos con cuidado. Ejecuta tus workloads típicos y mide coste mensual antes de comprometerte con un proveedor.
- Si construyes agentes, la latencia importa más que el throughput. Cada llamada extra de un agente encadena un coste de latencia. La ventaja de Jalapeño en cargas interactivas (hasta 4,1× menos latencia) confirma que el diseño de hardware para 2027 se va a orientar a agentes, no a chatbots. Tu arquitectura de producto debería asumir que las llamadas a modelo serán más rápidas y baratas cada trimestre.
Fuentes
- OpenAI publica los primeros benchmarks de Jalapeño - WWWhatsnew (fuente original)
- OpenAI Jalapeño Chip Challenges NVIDIA With Faster AI Inference and Lower Power Use - TechGenyz
- OpenAI's First Chip Beat Blackwell on Broadcom's Silicon, on the Day Nvidia Reports - FinanceFeeds
- Meet Jalapeño: OpenAI's First Custom AI Chip, Built With Broadcom - Forbes
- NVIDIA Vera Rubin chips begin shipping to cloud providers - GCN
- Nvidia's dedicated inference accelerator Groq 3 LPX enters full production - SiliconANGLE
- What Is Broadcom? The Unknown Company Building the AI Chips Powering Google, Anthropic, OpenAI and Meta - IBTimes
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














