El benchmark que pone a OpenAI en la carrera del hardware propio
En la conferencia Hot Chips, OpenAI presentó los primeros resultados del Jalapeño, su chip de inferencia desarrollado junto a Broadcom: hasta 1,9 veces más trabajo de IA por watt y hasta 3,6 veces menos latencia que los superchips Nvidia GB300, según datos publicados por la propia compañía y recogidos por The Verge y Bloomberg.
La cifra importa porque Jalapeño no se midió contra un competidor menor: el rival en la prueba InferenceX de Semianalysis era el GB300 de Nvidia, el chip más potente disponible en el momento del test. Y aun así, según OpenAI, perdió en ambos indicadores clave: eficiencia energética y latencia.
Qué es Jalapeño y por qué es un ASIC de inferencia
Jalapeño es un Application-Specific Integrated Circuit (ASIC), un chip diseñado desde cero para una sola tarea, pensado exclusivamente para la fase de inferencia: el momento en que un modelo ya entrenado responde a prompts, ejecuta agentes o genera tokens para un usuario final. No está pensado para entrenar modelos; esa parte sigue siendo terreno de Nvidia.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadSegún Richard Ho, jefe de hardware de OpenAI, el chip resuelve un dilema clásico de la inferencia: tradicionalmente hay que elegir entre alto throughput (servir a muchos clientes a la vez) o baja latencia (responder muy rápido a un solo usuario). Jalapeño busca ambos a la vez.
Los números concretos del benchmark InferenceX
Las pruebas se ejecutaron sobre la plataforma InferenceX de Semianalysis, que mide cuántos tokens entrega un sistema y con qué rapidez frente a los mejores registros públicos disponibles en cada momento. Los resultados compararon Jalapeño contra sistemas con GB200 y GB300 de Nvidia, según The Verge.
- Eficiencia energética: 1,5 a 1,9 veces más trabajo de IA por watt en los modelos GPT-OSS 120B, DeepSeek R1 y Kimi K2.5 1T.
- Latencia extremo a extremo: 1,7 a 3,6 veces menor en los mismos tres modelos.
- Consumo operativo: alrededor de 700 watts por chip, según declaró Ho a Bloomberg, una cifra baja para servidores de inferencia.
La propia compañía lo resume así: "Jalapeño ofrece el mejor de ambos mundos: baja latencia y alto throughput." Ho añadió que el chip puede "servir a más clientes de forma más barata" y entregar "tiempos de respuesta muy rápidos" a quienes prioricen esa métrica, según recoge Yahoo Finance/Bloomberg.
La alianza con Broadcom y el enfoque full-stack
El proyecto nació en colaboración con Broadcom, fabricante de chips custom para clientes como Google y Meta. La alianza se anunció a fines de 2025 y el chip se presentó con más detalle en junio de 2026, según la cronología que reconstruye The Verge. OpenAI diseñó parte del silicio con ayuda de sus propios modelos de IA, un guiño a la estrategia de automatizar el diseño de chips que ya exploran otros grandes del sector.
El punto clave no es solo el silicio: OpenAI quiere una plataforma multigeneracional, donde chips, modelos, productos y memoria se desarrollen coordinadamente. Esto permite atacar cuellos de botella específicos de la inferencia que suelen aparecer en las fases de prefill (preparación del contexto del prompt) y comunicación entre chips, según explicó la propia empresa en su blog técnico.
Ho dejó claro que Jalapeño no reemplaza a Nvidia: la estrategia de cómputo de OpenAI incluye "muy buenos partners", entre ellos Nvidia, y Jalapeño se suma como una capa adicional optimizada para ciertos workloads.
Calendario: qué viene de aquí a 2027
OpenAI estima desplegar Jalapeño a fines de 2026 en volúmenes muy pequeños, con un ramp-up más significativo durante 2027. La compañía no reveló cuántas unidades piensa desplegar el próximo año, según The Verge.
Hay además una segunda y una tercera generación del chip en desarrollo. OpenAI ya trabaja en ellas, lo que confirma que esto no es un experimento puntual sino una línea de producto a varios años, según Bloomberg.
Una salvedad importante: Jalapeño no fue probado contra Vera Rubin, la nueva generación de Nvidia que acaba de comenzar a enviarse, según Bloomberg. El liderazgo en el benchmark es real, pero la comparación completa con la próxima generación de Nvidia aún está pendiente.
Qué significa esto para tu startup
Si sos founder y dependés de inferencia de modelos grandes, esta noticia tiene lectura directa en dos planos: costos y latencia.
- Audita qué workloads son sensibles a latencia y cuáles a costo por token. La promesa de Jalapeño es entregar ambos a la vez, pero los proveedores cloud tarde o temprano van a trasladar esa eficiencia a sus precios. Hoy podés negociar contratos multi-año con hyperscalers (Azure, AWS, GCP) sabiendo que la curva de costo por token de inferencia va a seguir bajando durante 2027.
- Diversificá de Nvidia en tu stack de inferencia. OpenAI no es el único: Google tiene sus TPU, Amazon sus Trainium e Inferentia, y Microsoft trabaja con Maia. Si tu producto corre modelos open-source (DeepSeek R1, Kimi K2.5, Llama), empezar a probar instancias en estos aceleradores alternativos puede bajarte la factura de inferencia de forma significativa respecto a GPUs Nvidia equivalentes, según benchmarks públicos de cada proveedor.
- Diseñá tus agentes con latencia en mente, no solo con costo. Cuando el costo por token cae, el cuello de botella se mueve al tiempo de respuesta. Si tu producto depende de agentes interactivos, priorizá proveedores con bajas latencias p99, no solo precios bajos por token. Esa métrica va a ser cada vez más visible para usuarios finales.
Fuentes
- TechCrunch: OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show (fuente original)
- The Verge: OpenAI says its Jalapeño chip can power faster AI responses than the competition
- Yahoo Finance / Bloomberg: OpenAI Claims Its New Chips Can Outperform Nvidia Processors in Tests
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














