Weka NeuralMesh 6: caching de tokens reduce GPUs en IA

Weka lanza NeuralMesh 6 con caching de tokens que reduce carga GPU en despliegues de IA

Weka acaba de anunciar NeuralMesh 6 y Wekapod 3, una plataforma de almacenamiento diseñada para cachear el 100% de los tokens pre-calculados de modelos de IA, reduciendo drásticamente la necesidad de agregar más GPUs. La tecnología Augmented Memory Grid utiliza almacenamiento flash para mantener los tokens cerca de las GPUs, disminuyendo la carga de cómputo y los costos operativos para empresas que escalan sus despliegues de inteligencia artificial.

Para founders que están quemando capital en infraestructura de IA, esto representa una alternativa concreta: en lugar de comprar más hardware costoso, optimizar el almacenamiento existente puede lograr el mismo rendimiento con menos GPUs.

¿Qué es Weka y por qué su tecnología importa para el ecosistema de IA?

Weka IO (ahora WEKA) es una empresa de plataforma de datos definida por software especializada en almacenamiento de alto rendimiento para cargas de trabajo de IA, machine learning y HPC. Fundada en 2013 con sede en Campbell, California, la empresa ha levantado $415 millones en financiamiento total, incluyendo una Serie E de $140M en mayo de 2024 que la valuó en $1.600 millones (unicornio).

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Entre sus inversores destacan NVIDIA, Qualcomm Ventures, Hitachi Ventures, Generation Investment Management y Valor Equity Partners. Esta base de inversores no es casual: NVIDIA es el líder indiscutible en GPUs para IA, y su respaldo a Weka señala que el almacenamiento GPU-nativo es crítico para el futuro de la infraestructura de inteligencia artificial.

La empresa reporta un ARR superior a $100M en 2025, duplicando año tras año, y cuenta con más de 300 clientes, incluyendo nombres de peso en IA generativa como Stability AI, Midjourney y ElevenLabs, además de 12 empresas del Fortune 50.

¿Cómo funciona NeuralMesh 6 y la tecnología Augmented Memory Grid?

NeuralMesh es el sistema de almacenamiento propietario de Weka, diseñado específicamente para ser nativo de GPU. A diferencia de los sistemas de archivos tradicionales que mueven datos a través de la red hacia las GPUs (creando cuellos de botella), NeuralMesh almacena y procesa datos directamente en la memoria de las GPUs.

La nueva versión NeuralMesh 6 introduce Augmented Memory Grid, una arquitectura que utiliza almacenamiento flash de alto rendimiento para cachear tokens pre-calculados. En términos prácticos:

  • Los tokens pre-calculados (resultados intermedios de inferencia o entrenamiento) se almacenan en flash de baja latencia
  • Cuando el modelo necesita esos tokens nuevamente, los recupera del caché en lugar de recalcularlos desde cero
  • Esto reduce la carga de cómputo en las GPUs y libera memoria GPU para otras operaciones
  • El resultado: menos GPUs necesarias para el mismo throughput de inferencia o entrenamiento

Wekapod 3 es la solución hardware "todo-en-uno" que integra NeuralMesh 6 en un appliance físico, permitiendo despliegues rápidos de infraestructura de IA sin la complejidad de integrar software y hardware por separado.

¿Por qué el caching de tokens cambia la ecuación de costos en IA?

El costo de operar modelos de IA a escala no es solo el precio de las GPUs. Incluye:

  • Costo de capital: GPUs H100/A100 cuestan decenas de miles de dólares cada una
  • Energía: Clusters de GPUs consumen megawatts de electricidad
  • Enfriamiento: La infraestructura de data center para disipar calor es costosa
  • Licencias de software: Frameworks de orquestación y monitoreo

Cuando un modelo de IA procesa una consulta, gran parte del cómputo se dedica a reprocesar tokens que ya fueron calculados en interacciones anteriores (especialmente en chatbots, asistentes y aplicaciones con contexto persistente). Sin caching, cada consulta requiere recalcular todo desde cero.

Con Augmented Memory Grid cachear el 100% de tokens pre-calculados significa que las consultas recurrentes se resuelven leyendo del almacenamiento flash (microsegundos de latencia) en lugar de ejecutar cómputo en GPU (milisegundos). Para empresas con patrones de uso repetitivos, esto puede reducir la necesidad de GPUs en 30-50% según patrones de la industria.

¿Quiénes son los competidores de Weka en almacenamiento para IA?

El mercado de almacenamiento optimizado para IA está calentándose. Los principales competidores incluyen:

  • VAST Data: Enfocado en arquitectura de almacenamiento "disaggregated" con alta escalabilidad para LLMs
  • Pure Storage: Líder en almacenamiento flash tradicional (FlashArray) con soluciones de IA
  • NetApp: Fuerte en almacenamiento híbrido empresarial con ofertas de IA (NetApp AI)
  • NVIDIA DGX Base: Infraestructura de almacenamiento integrada de NVIDIA (aunque NVIDIA es inversor de Weka, sugiriendo colaboración más que competencia)

La diferenciación de Weka es su enfoque GPU-nativo puro: no es almacenamiento tradicional adaptado para IA, sino una plataforma diseñada desde cero para alimentar clusters de GPUs masivos sin crear cuellos de botella.

¿Qué significa esto para tu startup de IA?

Si estás construyendo o escalando una startup que depende de inferencia o entrenamiento de modelos de IA, esta tecnología tiene implicaciones directas para tu estrategia de infraestructura:

1. Reevalúa tu arquitectura de costos antes de comprar más GPUs

Antes de levantar capital para comprar más hardware, analiza tus patrones de inferencia. Si tienes consultas repetitivas o contexto persistente (chatbots, asistentes, aplicaciones con memoria), implementar caching de tokens puede reducir tu necesidad de GPUs significativamente. Pide demos a proveedores como Weka, VAST Data o Pure Storage para comparar el TCO (costo total de propiedad) de optimizar almacenamiento vs. escalar GPUs.

2. Considera appliances todo-en-uno para despliegues rápidos

Si tu equipo es pequeño y no tiene expertise en integrar software de almacenamiento con hardware de GPUs, soluciones como Wekapod 3 pueden acelerar tu time-to-market. El trade-off es menor flexibilidad vs. velocidad de implementación. Para startups en etapa temprana, la velocidad suele ganar.

3. Negocia con proveedores desde una posición informada

Conocer las alternativas del mercado te da poder de negociación. Si estás comprometido con NVIDIA (DGX, H100), menciona que estás evaluando Weka (respaldado por NVIDIA) o VAST Data. Los proveedores de infraestructura suelen ofrecer descuentos o términos favorables cuando detectan que estás comparando opciones seriamente.

4. Prioriza métricas de eficiencia, no solo throughput

En lugar de medir solo "consultas por segundo", incorpora métricas como costo por consulta, tokens por dólar y utilización de GPU. Una arquitectura con caching puede tener menor throughput máximo pero mejor economía unitaria, lo que importa más para la sostenibilidad del negocio.

Contexto del mercado de infraestructura de IA en 2026

El mercado de almacenamiento para IA es un segmento de crecimiento acelerado. El hecho de que Weka haya pasado de $62.9M de revenue en 2023 a más de $100M en 2025 (duplicando año tras año) indica una demanda explosiva por infraestructura optimizada para IA.

Las tendencias clave que impulsan este mercado:

  • Fábricas de IA: Empresas construyendo infraestructura dedicada para entrenamiento e inferencia a escala
  • Eliminación de silos de datos: Necesidad de unificar datos dispersos para entrenar modelos masivos
  • Inversión corporativa estratégica: Inversores como NVIDIA, Qualcomm y Samsung confirman que la infraestructura de IA es crítica para la industria tecnológica

Para founders hispanohablantes, esto representa una oportunidad: la infraestructura de IA es un habilitador transversal. No necesitas construir el próximo modelo fundacional para capturar valor; puedes construir herramientas, servicios o consultoría que ayuden a otras empresas a optimizar su infraestructura de IA.

Conclusión

El lanzamiento de NeuralMesh 6 y Wekapod 3 por parte de Weka refleja una maduración del mercado de infraestructura de IA: ya no se trata solo de agregar más GPUs, sino de optimizar cada componente del stack para maximizar eficiencia y minimizar costos. Para founders que están escalando despliegues de IA, la lección es clara: antes de levantar capital para hardware, explora optimizaciones de almacenamiento y caching que pueden lograr el mismo resultado con menos inversión.

La tecnología de caching de tokens pre-calculados no es una solución mágica para todos los casos de uso, pero para aplicaciones con patrones de consulta repetitivos (la mayoría de chatbots, asistentes y aplicaciones empresariales), puede reducir la necesidad de GPUs en márgenes significativos. En un entorno donde el capital es caro y la eficiencia operativa determina quién sobrevive, estas optimizaciones marcan la diferencia entre una startup sostenible y una que se queda sin runway.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...