Samsung mete cómputo en RAM: 81 tok/s con Llama 3.1 local

Por qué Samsung mete cómputo dentro de la RAM

El problema clásico de mover modelos a un teléfono o laptop no es la matemática: es el viaje. Cada inferencia gasta la mayor parte de la energía en sacar pesos y activaciones de la DRAM, llevarlos a la CPU/GPU/NPU, hacer unas multiplicaciones y devolver el resultado. Samsung mostró en Hot Chips 2026 que se puede terminar con ese trayecto integrando bloques de cómputo (PIM, Processing-in-Memory) directamente en los bancos de cada chip de LPDDR5X.

Los números que Samsung presentó son medidas propias, no proyecciones: corre Meta Llama 3.1 8B sobre un acelerador de IA edge y pasa de 27 tokens/segundo con LPDDR5X estándar a 81,3 tokens/segundo con LPDDR5X-PIM, un salto de 3x. El tiempo de tarea cae de 12,3 a 5,4 segundos, según Gear Live. Para un asistente on-device que hoy responde a paso de tortuga, significa empezar a sentirse usable sin enviar datos a un servidor.

Qué cambia a nivel de chip

La propuesta técnica concreta de LPDDR5X-PIM analizada por Chips and Cheese:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Cada chip lleva 16 bloques PIM, uno por banco interno de DRAM, con su propio árbol MAC, registros de instrucción y registros de escala.
  • La agregación de los 16 bancos entrega 614 GB/s de ancho de banda interno, frente a los 76,8 GB/s que puede sacar el bus externo a través del controlador de memoria estándar.
  • Cada bloque ejecuta cuatro operaciones MAC INT8 o FP8 por ciclo de datos (ocho sin contar el doble data rate). Con pesos de 4 bits el throughput se duplica hasta 2,4 TOPS por chip.
  • Ocho chips en paralelo suben el total a 9,6 INT8 TOPS, comparable al NPU de Intel Meteor Lake, pero a costa de 128 GB de memoria del sistema.

Lo más llamativo: el chip no necesita un controlador de memoria nuevo. Mantiene el encapsulado JEDEC 561 bolas estándar, así que un fabricante de móviles, laptops o servidores puede montarlo en el mismo slot donde hoy pone LPDDR5X normal. Las filas especiales que activan el modo PIM se reservan dentro del espacio de direcciones del DDR estándar.

Por qué es complemento de HBM, no sustituto

Samsung fue explícito: PIM no compite con HBM en entrenamiento ni en inferencia cloud a gran escala. HBM4 ofrece hasta 2 TB/s por stack, más del triple que el modo PIM. HBM sigue siendo el estándar para entrenamiento y serving masivo.

Pero el costo pesa. La memoria se ha convertido en el componente dominante de los chips de IA: la cuota de HBM en el costo de componentes de chips de IA pasó del 52% a principios de 2024 al 63% a finales de 2025, según recoge Gear Live. El efecto se nota en productos de consumo: Apple acaba de subir el precio de entrada del Mac mini a $899 citando costos de componentes, y los fabricantes de teléfonos atraviesan la misma presión.

Ahí entra LPDDR5X-PIM: no reemplaza HBM en el data center, pero abre inferencia local en memoria barata y de bajo consumo donde antes no era viable. JEDEC anticipó funciones PIM en el próximo estándar LPDDR6 en abril, así que el roadmap apunta a que esto se normalice.

Qué significa esto para tu startup

Si construyes productos con IA y dependes (o vas a depender) de inferencia en el dispositivo, esta categoría de hardware cambia tres cuentas importantes:

  • Costo de inferencia on-device: con un chip que entra en el mismo slot, puedes plantearte mover modelos medianos (3B–8B) a móvil o laptop sin renunciar a UX fluida. Eso habilita asistentes, edición de imagen, agentes y copilots que hoy tienen que ir a la nube por latencia o costo.
  • Opciones de privacidad por diseño: si la inferencia corre local en una memoria con cómputo, puedes vender «tus datos no salen del dispositivo» sin tener que justificar arquitecturas exóticas. Para productos en salud, educación, finanzas personales y legal, el argumento se vuelve ejecutable, no solo retórico.
  • Plataformas nuevas: si vendes hardware (routers, kioskos, dispositivos industriales), un slot LPDDR5X-PIM te da una opción barata para meter IA sin diseñar tu propio ASIC ni pagar BOM de un Snapdragon de gama alta.

Acciones concretas que podés tomar — espera, mejor dicho, que puedes tomar — este trimestre:

  • Audita si tu modelo es ligero y cuantizable a 4–8 bits. LPDDR5X-PIM soporta formatos de baja precisión; si tu pipeline requiere FP16 denso, no aprovecharás el hardware. Revisa qué capas se pueden cuantizar sin pérdida perceptible.
  • Diseña benchmarks propios de tokens/segundo en el rango de 8B parámetros sobre laptops y teléfonos actuales. Los 81 tokens/segundo de Samsung sobre Llama 3.1 8B son la métrica contra la que tendrás que comparar tu producto cuando estos chips lleguen al mercado masivo.
  • Si estás en fase de diseñar producto de hardware, reserva memoria suficiente para validar LPDDR5X-PIM como drop-in. Si JEDEC mete PIM en LPDDR6 como parece, este será el slot estándar en 18–24 meses y los OEMs que ya tengan firmware probado tendrán ventaja.

El talón de Aquiles: software

El análisis técnico de Chips and Cheese señala que el hardware está resuelto pero el stack de software no:

  • El modo PIM cambia el significado de los comandos DDR, así que no se puede mezclar accesos PIM con accesos DRAM normales en el mismo canal. Hilos no PIM podrían leer datos válidos como si fueran resultados de cómputo, o escribir activaciones en direcciones equivocadas.
  • La solución de Samsung aísla regiones PIM por canal, lo que sacrifica ancho de banda utilizable por procesos no PIM.
  • La región PIM se mapea como no cacheable, lo que deshace las optimizaciones de caché, prefetch y ejecución fuera de orden del CPU. Ejecutar código PIM es correr con el subsistema de memoria atado.
  • Un sistema operativo multi-tarea tiene que deshabilitar interrupciones y bloquear otros hilos durante una sección PIM, o serializar vía locks. Preemptar un hilo PIM implica sacar el canal de modo PIM, guardar el estado de todos los bancos y luego restaurarlo. En la práctica, el SO necesita hooks específicos para PIM, y los kernels de Linux, Android y Windows aún no los traen.

Para un founder, esto se traduce en: los ganadores no serán quienes integren el chip, sino quienes empaqueten el runtime PIM (memoria virtual, scheduler, allocator, profilador) que hoy no existe. Si trabajas en infra de ML, compiladores o kernels, esa es la grieta abierta.

Reconocimiento y contexto macro

PIM ya no es solo un prototipo: en FMS 2026 (Future of Memory and Storage) Samsung ganó Best of Show en la categoría Next-Gen Memory junto con su V10 BV-NAND, que según TweakTown tiene más de 400 capas. Es la primera vez que un chip de memoria con cómputo integrado recibe esta clase de reconocimiento en un evento de la industria.

El contexto macro pinta hacia allá: el mercado global de chips de inferencia de IA pasó de US$17,73B en 2025 a US$20,51B en 2026 (CAGR 15,6%) y se proyecta a US$36,97B para 2030, según ResearchAndMarkets. Y el gasto total en cómputo para data centers ya ronda US$215B en 2025, también según ResearchAndMarkets.

Competidores que empujan arquitecturas alternativas de inferencia distribuida — Nvidia con la adquisición por US$20B de los activos y talento de Groq a fines de 2025, Cerebras aliándose con AMD y AWS Trainium, SambaNova con Intel, según Forbes — muestran que toda la cadena (no solo Samsung) cree que la inferencia necesita arquitecturas especializadas, no un solo chip monolítico.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...