Gimlet Labs levanta US$300M para nube multi-silicio de IA

La Serie B de Gimlet Labs y los números detrás de la operación

Gimlet Labs anunció el 4 de septiembre de 2026 una Serie B de US$300 millones liderada por Andreessen Horowitz, con lo que la compañía queda valorada en US$3.000 millones y eleva el capital total recaudado a US$392 millones, según el comunicado oficial de la startup y la cobertura de SiliconANGLE.

A la ronda se incorporan como nuevos inversores Sapphire Ventures, M12 (el fondo de Microsoft) y Arm, mientras que vuelven participantes previos como Menlo Ventures y Factory. La lista completa publicada por la compañía incluye además a 645 Ventures, Eclipse, Emergence, Hudson River Trading, OnePrime Capital, Prosperity7, QuantumLight, Samsung Ventures, Tiger Global Management, Triatomic, Wing Ventures y XTX Markets.

Los dos clientes ancla ya eran un secreto a voces desde marzo de 2026: la propia Gimlet reconoció entonces que entre sus clientes figura uno de los tres hyperscalers más grandes del mundo y uno de los tres laboratorios de frontera que entrenan los modelos más avanzados del sector. Hoy la empresa asegura que desde marzo ha añadido "miles de millones en revenue contratado" y que está escalando hacia cientos de megavatios de capacidad gestionada en infraestructura heterogénea.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Para encuadrar la velocidad del salto: la Serie B llega apenas cinco meses después de la Serie A, según el anuncio oficial.

Por qué una nube multi-silicio: el problema de la inferencia agéntica

Gimlet Labs se define como el primer cloud multi-silicio construido desde cero para inferencia. La diferencia importa: el grueso de la infraestructura de IA actual se pensó para entrenamiento y luego se reconvirtió, mal que bien, para servir modelos. Pero la inferencia no es entrenamiento, y dentro de la inferencia hay fases con requisitos muy distintos.

El prefill (cuando el modelo "lee" el prompt) es una fase muy atada al cómputo bruto. El decode (cuando genera cada token de la respuesta) es una fase muy atada al ancho de banda de memoria. Según SiliconANGLE, la plataforma de Gimlet parte el modelo en módulos y envía cada pieza al chip que mejor encaja con sus requisitos: GPUs, aceleradores near-memory, arquitecturas dataflow o CPUs.

La startup soporta explícitamente hardware de NVIDIA, AMD, Intel, Arm, Cerebras y d-Matrix, una paleta inusualmente amplia. Y la métrica que ponen sobre la mesa es agresiva: en workloads de frontera, la disaggregación heterogénea entrega 3-10X más rendimiento que la infraestructura homogénea tradicional, o el mismo rendimiento con 5-10X menos potencia para un mismo workload. Es la palanca clave en un momento donde la energía — no el silicio — es el cuello de botella.

La energía, no el silicio, es el cuello de botella real

El anuncio oficial de Gimlet pone cifras muy concretas sobre la mesa que vale la pena repetir porque cambian cómo un founder debe pensar su roadmap:

  • Generación mensual de tokens: creció 6X en los últimos 12 meses y algunas proyecciones apuntan a otro 20X de aquí a 2030.
  • CapEx industrial en IA: cerca de US$1 billón al año, con una proyección acumulada de US$7 billones hasta 2030.
  • Consumo eléctrico de data centers para IA: aproximadamente 18 GW en 2025, con expectativa de triplicarse antes de 2030.
  • Contexto de ventanas de contexto: pasamos de ~100K tokens en 2023 a 1 millón o más hoy, lo que multiplica el cómputo por inferencia.
  • Tamaño de modelos: de unos pocos cientos de miles de millones de parámetros hace apenas unos años a 3-10 billones de parámetros en la actualidad.

A esto se suma un dato externo: el reporte "Tracking Trillions" de Goldman Sachs publicado el 1 de mayo de 2026 estima US$765.000 millones de CapEx en IA solo en este año, con un acumulado de US$7,6 billones entre 2026 y 2031 — citado en el comunicado de prensa de Gimlet. La lectura es incómoda: la industria está desplegando capital a una velocidad sin precedentes, pero la física (red eléctrica, generación, interconexiones, energía behind-the-meter) puede frenarla.

Para Gimlet, la respuesta es hacer más con cada vatio: maximizar el throughput por kW y, sobre todo, romper el tradeoff clásico entre throughput alto y latencia baja, que es lo que las cargas de trabajo agénticas — donde cada agente encadena decenas de llamadas secuenciales — necesitan desesperadamente.

Quién está jugando en esta liga: el campo de batalla de la inferencia

Gimlet no está sola. En julio de 2026, Infinity — startup fundada por Jeremy Nixon, ex Google Brain — levantó US$15 millones a una valoración de US$100 millones en una ronda respaldada por Touring Capital, Principal VC e investigadores de OpenAI y Anthropic, según reportó TechCrunch. Infinity ataca el mismo problema desde otro ángulo: construir una alternativa al stack CUDA de Nvidia que funcione con cualquier chip (SRAM, GPUs, chips de móvil, systolic arrays), con un agente de IA que escribe y optimiza kernels automáticamente. Ya tiene como cliente a d-Matrix, competidor de Nvidia, lo que confirma que el interés de los challengers de Nvidia por romper la dependencia de CUDA es real y tiene dinero detrás.

La diferencia entre ambos no es de tamaño sino de enfoque: Gimlet construye un cloud completo multi-silicio con una valoración de unicornio; Infinity apuesta por una capa de software portable y un modelo de pricing basado en performance (cobra un porcentaje de las mejoras en tokens por segundo). Para un founder que está construyendo sobre un LLM ajeno, el efecto combinado de ambos — más competencia en la capa de inferencia — debería traducirse, con el tiempo, en latencias más bajas y costes por token menores.

¿Qué significa esto para tu startup?

La Serie B de Gimlet Labs es, ante todo, una señal de hacia dónde se está moviendo el dinero en infraestructura de IA: de entrenamiento a inferencia, y de monolítico a heterogéneo. Para un founder hispanohablante, eso tiene implicaciones prácticas muy concretas:

  1. Diseña tu producto pensando en latencia y coste por token, no en parámetros del modelo. Las cargas agénticas multiplican llamadas; cada 100 ms de latencia y cada fracción de céntimo por token cuentan. Pregúntate si tu proveedor actual te da visibilidad de ambos KPIs y, si no, ponlo en el contrato.
  2. No asumas que tu proveedor de inferencia será el mismo dentro de 18 meses. El espacio se está consolidando (Nvidia + hyperscalers) y simultáneamente fragmentando (Gimlet, Infinity, otros) en torno a la disaggregación. Mantén una capa de abstracción ligera sobre el proveedor para poder cambiar sin reescribir tu stack.
  3. Si construyes verticalmente sobre IA, evalúa el coste de cómputo como una línea de tu unit economics. El CapEx industrial proyectado por Goldman Sachs para 2026-2031 es enorme, pero ese coste lo terminas pagando tú. Negociar compromisos de capacidad a largo plazo con proveedores heterogéneos puede ser más barato que el spot del GPU en 2027.

Para founders que operan desde LATAM o España, la pregunta adicional es relevante: la energía es el cuello de botella global, y aquí el viento puede soplar a favor — regiones con renovables abundantes y marcos regulatorios claros (península ibérica, sur de Chile, nordeste de Brasil) tienen una ventana abierta para alojar capacidad gestionada de inferencia.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...