OpenAI usó sus LLM para diseñar el chip Jalapeño

¿Qué pasó en 20 meses dentro de OpenAI?

OpenAI diseñó su primer chip de inferencia, Jalapeño, en menos de 20 meses con un equipo que promedió menos de 100 personas y asistido por sus propios modelos de lenguaje. El ASIC (chip de aplicación específica, optimizado para una tarea concreta: correr modelos ya entrenados) fue develado por completo el 25 de agosto y entrega hasta 13,4 petaflops de cómputo en 4 bits, con 232 GB de la memoria más avanzada del mercado y un ancho de banda de 15,4 TB/s. En los benchmarks publicados por la compañía, reduce la latencia de extremo a extremo hasta 3,6 veces frente a sistemas Nvidia GB300, con menor consumo. Para un founder, la pregunta relevante no es solo cuánto corre el chip, sino cómo un equipo tan pequeño lo diseñó tan rápido: la respuesta está en cómo la propia OpenAI integró sus LLM en cada fase del flujo de diseño.

¿Qué hizo exactamente la IA en cada fase del diseño?

El "frente" del diseño —la parte que va del concepto inicial al código RTL (la descripción lógica del comportamiento del chip) y la verificación— es donde OpenAI concentró el uso de IA. El equipo construyó su flujo alrededor de XLS (Accelerated Hardware Synthesis), una cadena de herramientas de síntesis de alto nivel open source originalmente desarrollada en Google. XLS permite escribir lógica de chip en lenguajes parecidos a software —DSLX (inspirado en Rust) y C++— y la convierte automáticamente a Verilog, el lenguaje de descripción de hardware estándar.

"Los modelos eran mucho mejores en cosas que parecían software, y XLS de cierta forma parece software, así que se benefició de eso", resumió Chris Leary, miembro del equipo técnico de OpenAI, en declaraciones recogidas por IEEE Spectrum. El resultado fue un ciclo de iteración mucho más corto: lo que antes requería reescribir manualmente capas de RTL, ahora podía explorarse con prompts y código de alto nivel que la IA traducía y optimizaba.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Cuando los primeros chips volvieron de la foundry en mayo, el equipo apuntó sus modelos internos a escribir el software que ejecutaba los benchmarks. En el kernel de Multi-Head Latent Attention de DeepSeek, el rendimiento saltó del 0,31 % al 88,94 % del techo teórico —marcado por el cómputo y el ancho de banda de memoria del chip— en unas 40 horas, según los datos presentados en Hot Chips 2026.

El proyecto comenzó con asistencia de modelos como o3, liberado al público en abril de 2025, y para cuando terminó el equipo ya tenía acceso a versiones precursoras de GPT-6 Astra, presentado al público el 3 de septiembre de 2026. Richard Ho, VP de hardware de OpenAI, confirmó además que se usaron LLM internos ajustados específicamente para diseño de chips, no disponibles públicamente.

¿Cuál fue el rol de Broadcom y dónde terminó la IA?

La división del trabajo con Broadcom fue nítida: OpenAI diseñó de extremo a extremo el sistema —el acelerador de inferencia, la jerarquía de memoria y la red—, mientras que Broadcom se encargó del "backend": ruteo de interconexiones, especificación de reloj y potencia, y envío del diseño a la foundry. Andrew Kahng, profesor distinguido de UC San Diego, calificó el cronograma como "probablemente el mejor de su clase hoy" según IEEE Spectrum. Verkor, startup de diseño agentic de chips, reconoció que el resultado es "relativamente impresionante", aunque apuntó que Broadcom fue esencial para sostener esa velocidad.

En backend la IA también aportó: en Hot Chips 2026, Ho y Leary reportaron una reducción del 10 % en área de las unidades de multiplicación de matrices frente a una línea base humana optimizada. No es automatización total: Ho fue explícito en que "cualquiera no puede venir y simplemente construir chips aceleradores de IA de frontera usando solo Codex".

¿Qué dicen los benchmarks de Jalapeño frente a Nvidia?

En InferenceX de SemiAnalysis, OpenAI reportó —según The Verge y TechRepublic—:

  • 1,5 a 1,9 veces más trabajo de IA por watt que los sistemas GB200 y GB300 de Nvidia, sobre los modelos GPT-OSS 120B, DeepSeek R1 y Kimi K2.5 1T.
  • 1,7 a 3,6 veces menos latencia de extremo a extremo en los mismos modelos.
  • En latencia ultra-baja, 2,1 a 4,1 veces más rápido, según DataCenterDynamics.

El chip se desplegará en racks de 128 unidades (1,7 exaflops de cómputo 4-bit y 27,5 TB de HBM4, la memoria de alto ancho de banda de cuarta generación) y en pods completos de 2.048 ASICs. El TDP (consumo térmico de diseño) nominal es 700 W, con potencia sostenida en o por debajo de 550 W en las cargas probadas. SemiAnalysis aclaró que la comparación con GB300 es "algo incompleta e injusta" porque Jalapeño usa HBM4 más reciente; el rival comparable sería la plataforma Vera Rubin de Nvidia, que también usa HBM4 y está empezando a enviarse a clientes. Ho estimó despliegue en "volúmenes muy pequeños" a fin de 2026 y un ramp-up más fuerte en 2027.

¿Cómo encaja Jalapeño en el ecosistema de silicio propio?

Jalapeño no llega solo. La estrategia de chips custom es ya una tendencia estructural entre hyperscalers, según CNBC:

  • Meta acordó desplegar 1 GW de chips custom sobre tecnología Broadcom, parte de un acuerdo multi-GW anunciado en abril.
  • Anthropic se comprometió a gastar más de US$100.000 millones en tecnología de AWS a lo largo de 10 años, incluyendo generaciones actuales y futuras del chip Trainium.
  • Google, AWS y Meta mantienen programas propios de TPUs y Trainium.

El analista Adrien Sanchez, de Yole Group, dijo a CNBC que Jalapeño demuestra que "un chip diseñado por un hyperscaler ahora puede igualar o superar a las GPUs clase Blackwell de Nvidia en eficiencia de inferencia". Omdia espera que los ASIC custom superen a las GPUs en volumen hacia 2028, aunque en ingresos las GPUs seguirán dominando por ser mucho más caras. TrendForce, vía Fion Chiu, recordó que para entrenamiento de frontera Nvidia seguirá siendo clave por su programabilidad y ecosistema CUDA.

Y la disruption no se limita a los hyperscalers. Moonshot AI presentó en julio a Kimi K3, un modelo que diseñó un chip funcional de 4 mm² a 100 MHz en 48 horas usando solo herramientas open source —sin Cadence ni Synopsys— lo que provocó una caída de ~9 % en las acciones de ambos gigantes de EDA (Electronic Design Automation, el software industrial que se usa para diseñar chips), según Investing.com / Yahoo Finance. Synopsys, por su parte, está retirando su suite de software para fabs (Equipment Engineering System y Fault Detection and Classification) para redirigir ingenieros al diseño de chips con IA, en una reorganización que sigue a su adquisición de Ansys por US$35.000 millones en 2025, reportó The Next Web.

Startups como Cerebras, SambaNova, D-Matrix, Etched y Fractile también están construyendo chips especializados para IA, lo que confirma que el nicho dejó de ser exclusivo de Nvidia.

¿Qué significa esto para tu startup?

1. La inferencia va a bajar de precio y tu coste por token, también. Si Jalapeño ofrece 1,5 a 1,9 veces más trabajo por watt y Meta, Anthropic y AWS persiguen la misma curva con sus propios ASIC, los proveedores de inferencia tienen presión real para reducir precios por token. Acción concreta: vuelve a cotizar tus contratos de API de inferencia trimestralmente y modela un escenario donde tu coste por token cae entre 30 % y 50 % en 12 meses; el viento de fondo lo justifica aunque no sea garantía.

2. El diseño de hardware se está convirtiendo en un juego de "equipos pequeños + IA". OpenAI promedió menos de 100 personas y pasó de concepto a silicio en 20 meses; Kimi K3 diseñó un chip en 48 horas sin herramientas propietarias. Si tu startup depende de hardware especializado (edge AI, dispositivos médicos, robótica), explora flujos basados en open source como XLS, OpenLane o IHP-Open. Acción concreta: arma un prototipo con un equipo de 2-3 ingenieros y herramientas agentic de síntesis de alto nivel antes de comprometerte con un ASIC completo; el costo de iteración se está desplomando.

3. La amenaza para Nvidia es real pero desigual. En entrenamiento de frontera, Nvidia sigue siendo rey por ecosistema CUDA. En inferencia, los ASIC hyperscaler ya son competitivos. Si tu producto depende casi exclusivamente de inferencia a gran escala, diseña tu arquitectura para que sea portable entre Nvidia, Broadcom-based ASIC y Trainium; no blindes tu stack a un solo proveedor. Acción concreta: audita las dependencias de CUDA en tu codebase y aísla las capas críticas detrás de abstracciones (por ejemplo, kernels intercambiables), aunque te cueste 1-2 sprints hoy.

4. La IA se usa para diseñar la IA. OpenAI usó sus propios LLM para diseñar el chip que correrá sus propios modelos. Ese ciclo cerrado —modelos que se usan a sí mismos para mejorar su infraestructura— es una señal de dónde va la próxima década: optimización automática de stacks completos. Acción concreta: integra tus propios datos de producción en pipelines de optimización automatizada (fine-tuning, RLHF, prompt evolution) en lugar de tratarlos como mero telemetry pasivo.

Conclusión

Jalapeño es la prueba más visible hasta ahora de que los LLM no son solo una capa de aplicación: también son una herramienta de ingeniería que está acortando los ciclos de diseño de chips. Para los founders, la implicación práctica no es construir tu propio ASIC —es prepararte para una caída de costes de inferencia, una mayor portabilidad entre proveedores y un mercado de hardware mucho más fragmentado en los próximos 24 meses.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...