openTPU: una IA diseña su chip de inferencia open source

¿Puede una IA diseñar el chip que corre su propia inferencia?

openTPU es un acelerador de inferencia de IA cuyo hardware fue diseñado por agentes de IA: el RTL en SystemVerilog, la ISA, un simulador bit-exact, el lenguaje de kernels y su compilador, y el software que controla la tarjeta PCIe. El proyecto vive en el repositorio público FeSens/openTPU, bajo Apache 2.0, y se plantea dos preguntas explícitas: cuánto puede llegar una IA en el diseño de hardware, y si esa IA puede construir el chip que corre su propia inferencia. Los benchmarks del propio autor muestran que ya está pasando.

¿Qué modelos corre openTPU y a qué velocidad?

La tarjeta objetivo es la Inspur YPCB-00338, basada en la FPGA Xilinx Kintex-7 xc7k480t, con dos canales de DDR3. El sistema corre diez modelos modernos con sus pesos reales y produce los mismos tokens que el simulador, bit a bit.

Modelo Weights tok/s device tok/s wall DRAM (% del pico)
LFM2.5-230M 4-bit, head int8 85.8 82.1 14.1 GB/s (82%)
Qwen3-0.6B 4-bit, head int8 31.3 30.7 13.9 GB/s (82%)
Qwen3.5-0.8B 4-bit, head int8 24.5 23.3 14.1 GB/s (83%)
Gemma 4 E2B 4-bit, head int8 12.14 12.09 15.5 GB/s (91%)
LFM2-2.6B 4-bit, head int8 10.96 10.93 15.8 GB/s (93%)
SmolLM3-3B 4-bit, head int8 8.74 8.72 15.7 GB/s (92%)
Phi-4-mini (3.8B) 4-bit, head int8 6.56 6.55 15.8 GB/s (92%)
Qwen3.5-2B 4-bit, head int8 12.09 12.03 15.8 GB/s (92%)
Qwen3.5-4B 4-bit, head int8 5.88 5.87 15.7 GB/s (92%)

(Fuente: README de openTPU, builds e698dcd7 y B/79c5707a, medidos entre el 2026-09-29 y el 2026-10-01.)

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Para un founder hay dos cifras que importan más que las demás. La primera: la cuantización 4-bit recorta aproximadamente un tercio de bytes por token y sube el decode entre un 40% (Qwen3.5) y un 45% (Qwen3, LFM2), a costa de un delta de perplejidad que el repo reporta por modelo en docs/quant.md. La segunda: el host desaparece del camino crítico. La tarjeta corre un único programa de decode compilado una vez y devuelve los logits mientras sigue corriendo, así que el host añade 0,17 a 0,30 ms por token sobre la plataforma omarchy (entre 0,45 y 1,3 ms sobre opentpu, un Intel Core i7-4790).

¿Cómo es la arquitectura de openTPU?

El diseño es deliberadamente austero. Un secuenciador lanza una instrucción por ciclo a unas pocas unidades: una DMA que mueve datos, una matriz sistólica de cuatro columnas que multiplica pesos int8 streamed desde DRAM, una unidad vectorial que hace matemáticas en fp32 y un cuantizador que devuelve el resultado a int8. No hay caché ni scheduling oculto: cada movimiento de datos es una instrucción, así que un trace muestra dónde se gastan los ciclos. El profiler del proyecto (otpu-lens) registra una ejecución y la visualiza en el navegador con un roofline, una timeline y tablas por instrucción.

El reloj cierra a 133,33 MHz con un margen de timing de WNS +0,032 ns — justo, según admite el autor. Decode está limitado por DRAM: la LiteDRAM interna lee entre el 82% y el 94% del pico DDR3-1066 (17,1 GB/s). El último punto porcentual de eficiencia es lo que está en desarrollo; prefill sigue limitado por la tasa de multiplicación de la matriz sistólica.

¿Cómo ejecuta openTPU modelos más grandes que la FPGA?

La imagen int8 de Qwen3.5-4B ocupa más de 4 GiB y la tarjeta tiene 4 GiB. La solución que implementa openTPU es la que cualquier sistema con memoria limitada termina usando: los expertos de los modelos MoE más grandes que la capacidad local se streamean desde almacenamiento del host, y la tarjeta mantiene slots por capa en su DRAM. El host copia los expertos faltantes desde un pool file a la velocidad del link PCIe; la tarjeta enruta cada token y computa cada experto.

Los números medidos con build B (2026-10-01):

  • LFM2.5-8B-A1B (8,5B parámetros, 1,7B activos): 10,6 tok/s sostenidos sobre 160 tokens. El 98,5% de los accesos a expertos aciertan en los slots locales y se streamean 5,2 MB por token.
  • Qwen3.5-35B-A3B (34,7B parámetros, 3,0B activos): 3,95 tok/s sobre 16 greedy tokens de Hugging Face. El 62% de los accesos aciertan y se streamean 153 MB por token a 1,41 GB/s por PCIe.

Ambos coinciden bit a bit con el simulador.

¿Es openTPU el único caso de silicio diseñado por IA?

No. Architect Labs presentó redwood, descrito en un comunicado distribuido por Webwire como el primer chip de IA diseñado end-to-end por un sistema de IA — RTL, verificación UVM, verificación formal, firmware, drivers y kernels personalizados — con dos arquitectos humanos escribiendo la especificación de alto nivel, en menos de dos semanas. Según ese mismo comunicado, sobre Samsung 8 nm (el mismo nodo que el Jetson Orin Nano de NVIDIA), redwood entregaría 1,75x el throughput a 1,9x menos potencia, una mejora de 3,4x en rendimiento por vatio contra una Jetson Orin Nano medida con el mismo modelo. La demo en vivo se hizo en el Design Automation Conference (DAC) de 2026, sobre una FPGA AMD Versal a 250 MHz, ejecutando inferencia single-batch sobre modelos open-weight como Qwen.

Lo que estos dos proyectos dibujan es una tesis que en 2024 sonaba a hype: el ciclo entre modelo y silicio se está cerrando. Un sistema de IA puede proponer la arquitectura, verificar el diseño y correr un modelo real en hardware que él mismo ayudó a especificar.

¿Qué significa esto para tu startup?

Para una startup hispanohablante que trabaja con IA en el edge, openTPU abre tres puertas concretas:

  • Aprender el stack completo. El repo es un masterclass empaquetado: leerlo de extremo a extremo te lleva desde un matmul en Python hasta los wires de la FPGA. No necesitas comprar hardware para empezar: el simulador ISA es la spec y corre en una laptop. pip install -e ., python3 -m pytest -q y otpu-chat --backend isa son todo lo que necesitas para ver el modelo funcionando.
  • Prototipar inferencia barata. Una tarjeta FPGA de bajo costo (la Kintex-7 usada es hardware accesible) corriendo 4-bit puede ejecutar modelos de hasta 4B parámetros a ~6 tok/s, y modelos MoE grandes vía PCIe. Para edge con latencia y watts delimitados, esta clase de arquitectura es relevante.
  • Entender la tesis de negocio. Si vendes a clientes que quieren correr IA on-device sin depender de GPUs, esta categoría de proyectos te dice qué se viene: silicio específico para cada producto, ciclos de diseño en semanas, y modelos cada vez más capaces de diseñar su propio sustrato.

Para founders de LATAM y España, la lectura menos obvia pero más útil es esta: la frontera entre "empresa de software" y "empresa de silicio" se está moviendo. El cuello de botella ya no es el equipo de diseño: es saber qué workload quieres acelerar.

Fuentes

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...