d-Matrix Raptor: chip 3D-DRAM para inferencia de IA

El cuello de botella que d-Matrix intenta romper

En la conferencia Hot Chips 2026, la startup estadounidense d-Matrix presentó Raptor, un chip para inferencia de IA generativa que apuesta por una idea poco explorada: apilar capas de DRAM directamente sobre un die lógico mediante unión face-to-face de 36 micras. Según datos reportados en la presentación, el resultado es aproximadamente 100 TB/s de ancho de banda de memoria con 32 GB de capacidad por tarjeta, y una mejora de alrededor de 20 veces en densidad de ancho de banda por mm² frente a los paquetes con HBM4 que usan NVIDIA Vera Rubin y AMD Instinct MI455, con 2,96 mW por GB/s frente a 40 mW en los diseños actuales con HBM (cifras citadas por d-Matrix en su charla y recogidas por ServeTheHome y HotHardware).

El problema que la compañía intenta resolver es conocido por cualquier equipo que sirve LLMs en producción: el ancho de banda de memoria se convierte en el factor limitante cuando un modelo genera tokens en fase de decode, donde se entrega un token a la vez y cada paso depende de leer pesos y caché KV. La propia d-Matrix subraya que la mayor parte del tiempo de inferencia se consume en decode, no en el prefill donde el cómputo sí está mejor paralelizado.

Por qué HBM ya no alcanza (según d-Matrix)

El acelerador de hoy se apoya en HBM (memoria de alto ancho de banda apilada en 2.5D sobre un interposer). Funciona, pero tiene tres límites que la presentación de d-Matrix hace explícitos y que están citados en el material de Hot Chips:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Capacidad de I/O acotada por el beachfront del paquete: solo caben entre 8 y 16 stacks por paquete, lo que pone un techo práctico de ancho de banda de alrededor de 20 TB/s en HBM4.
  • Consumo del enlace: mover 100 TB/s a 2,4 pJ/bit implica unos 1,92 kW dedicados solo a tráfico HBM, antes de sumar el cómputo.
  • Coste del PHY: el controlador físico que comunica lógica y memoria se lleva cientos de vatios adicionales.

SRAM, la otra alternativa, sí entrega ancho de banda SRAM-class (unos 300 TB/s en el ejemplo de la tarjeta Corsair mencionada en la charla) pero con apenas 4 GB por par de tarjetas y un consumo por fuga prohibitivo a esa escala. d-Matrix lo presenta como una tecnología útil solo para draft models en speculative decoding.

Qué hace diferente a Raptor

La arquitectura de Raptor es lo que la propia empresa describe como un "two-story package": una capa lógica fabricada en TSMC N4 soldada cara a cara con una capa de DRAM 3D apilada debajo. Al eliminar el interposer y el PHY, el dato viaja unos pocos micrómetros en vertical, con un coste energético citado en la presentación de aproximadamente 0,3 a 0,4 pJ/bit, cerca de 10 veces menos que HBM.

Los números de la presentación que más llaman la atención:

  • ~32,6 GB/s por mm² frente a ~1,5 GB/s en HBM4 (≈20x más densidad).
  • ~2,96 mW por GB/s frente a ~40 mW en HBM4 (≈13,5x más eficiencia).
  • ~1.000 tokens/s por usuario sirviendo un modelo de clase 3 billones de parámetros con contexto de 1 millón de tokens.
  • En los benchmarks mostrados, alrededor de 2.121 tokens/s por usuario con 32 usuarios concurrentes en GLM 5.2 y 785 tokens/s por usuario con 32 usuarios en Kimi K3, según recoge HotHardware.

Para encajar modelos frontera con 1M de contexto, d-Matrix plantea un scale-up de 72 tarjetas en un único rack; disaggregation y multi-rack extienden el sistema más allá de ese límite.

Los retos técnicos que la propia compañía reconoce

Lejos de ser una promesa de marketing, la charla de Hot Chips se detiene en tres problemas entrelazados que cualquier diseño así enfrenta, según el resumen de ServeTheHome:

  • Mapeo de bancos: cada tensor engine necesita un flit de 128 B por acceso, pero la organización física entrega 96 B por canal con 3 bancos. Sin reordenamientos, se desperdicia alrededor de un tercio del ancho de banda. d-Matrix lo resuelve con stream blocking, que reparte un acceso parcial entre tres flits y reduce el overfetch a cero.
  • Consumo de I/O: mover 100 TB/s a 0,37 pJ/bit son 296 W solo para entrada/salida. La técnica stream flipping corta conmutaciones comparando flits consecutivos, ahorrando alrededor del 20% de energía sin añadir pines.
  • Fiabilidad térmica: a 105 °C de unión, la retención de DRAM cae de 32 ms a 4 ms (8 veces más refrescos). La respuesta es intercalar ECC y DBI en las últimas columnas de cada subarray, con coste de ancho de banda cercano al 1,4%.

Qué hay detrás de d-Matrix

d-Matrix (Santa Clara, California) no es una startup pre-revenue. Su producto anterior, Corsair, ya está en producción y se basa en cómputo digital en memoria sobre SRAM. Según CryptoBriefing, la compañía ha levantado entre US$450M y US$500M en financiación acumulada, incluida una Serie C de US$275M que la valoró en aproximadamente US$2.000M. Sus socios de ecosistema incluyen Alchip, Andes y Astera Labs.

El 10 de septiembre de 2026, d-Matrix anunció una colaboración plurianual con NVIDIA para integrar Raptor dentro del rack MGX mediante NVLink Fusion, con disponibilidad inicial prevista para el cuarto trimestre de 2027. El cofundador y CTO Sudeep Bhoja fue quien presentó la tecnología 3D DRAM en Hot Chips 2026. Hasta 144 Raptor XPUs podrían operar en un único dominio NVLink según el anuncio recogido por Unite.AI.

Competidores y contexto de mercado

Raptor no entra en un mercado vacío. NVIDIA, AMD, Groq, Cerebras, SambaNova y el ecosistema NVLink Fusion (con partners como AWS, Intel, Marvell y Lightmatter) están redefiniendo la inferencia de IA de baja latencia. El acuerdo con NVIDIA es relevante porque permite a d-Matrix evitar construir un rack-scale propio y enchufar sus XPUs en la cadena de suministro madura de MGX, una estrategia similar a la que aplican otros semi-custom partners del programa.

La pregunta que plantea ServeTheHome en su análisis es directa: "si apilar DRAM sobre lógica es una idea tan buena, ¿por qué no lo está haciendo todo el mundo?". Hasta ahora, las limitaciones térmicas y de entrega de potencia en la pila explicaban el escepticismo; la presentación de d-Matrix es justamente su respuesta a esa duda.

Qué significa esto para tu startup

  • Si construyes producto sobre LLMs propios, la promesa de Raptor apunta a latencias más bajas por token en inferencia, especialmente para asistentes conversacionales, coding assistants y agentes de voz donde la respuesta inmediata es el diferenciador. Si la arquitectura cumple sus cifras en producción, el coste por token sensible a latencia podría caer de forma significativa.
  • Si vendes infraestructura o servicios cloud, la entrada de un third-party XPU dentro de NVLink Fusion abre un nuevo carril de proveedores. Hoy tu opción dominante es GPU; hacia 2027 podrías elegir entre GPU y XPU especializado en decode, con la posibilidad de disaggregated inference donde prefill corre en GPU y decode en Raptor.
  • El vector a vigilar: el tape-out de Raptor está previsto antes de fin de 2026 y la disponibilidad en rack MGX apunta a Q4 2027. Entre medias, hay que mirar (1) si hay demo en vivo con cargas reales, (2) si los benchmarks independientes confirman el ~4,7x en throughput que la compañía afirma frente a HBM, y (3) cómo responden los hyperscalers (AWS, Azure, Google Cloud) que ya evalúan el chip.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...