Una Serie E que casi triplica la valoración previa
Snorkel AI, la startup de Redwood City que ayuda a laboratorios y empresas a construir datasets y entornos simulados para entrenar modelos de inteligencia artificial, cerró este 22 de septiembre una Serie E de US$350 millones con una valoración de US$3.500 millones, según reportó TechCrunch. La cifra casi triplica los US$1.300 millones que la compañía alcanzó en su Serie D, cerrada 17 meses atrás con US$100 millones.
La ronda fue liderada por Insight Partners y S32. En ella participaron inversores previos como Addition, Lightspeed, Greylock, GV y Wells Fargo, junto con nuevos como Third Point, March, Blumberg, Allegis, Standard VC y Frontline, según el anuncio oficial de la compañía recogido por Unite.AI.
El salto llega acompañado de un crecimiento de ingresos inusual incluso para los estándares del sector. La propia Snorkel sitúa su tasa de ingresos anualizados (ARR) en US$375 millones, lo que supone un aumento de 18 veces en los últimos 12 meses. Fundada en 2019 tras cuatro años de investigación en el laboratorio de IA de Stanford, la empresa asegura que ya trabaja con «laboratorios frontera, hyperscalers, neolabs, líderes verticales de IA, grandes empresas y agencias del gobierno estadounidense», en palabras de su cofundador y CEO Alex Ratner.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl giro estratégico: de software de etiquetado a datasets completos
Snorkel nació como una herramienta para automatizar el etiquetado de datos (data labeling): humanos marcan imágenes, textos o conversaciones para que un modelo aprenda. El año pasado dio un giro radical y ahora entrega datasets completos y entornos de reinforcement learning listos para usar, un modelo que la compañía bautizó como data-as-a-service (datos como servicio).
En lugar de operar como un marketplace de expertos, Snorkel adopta un enfoque híbrido: combina su software y modelos —capaces de generar datos sintéticos— con expertos de dominio (ingenieros senior, doctores, abogados) que validan y refinan el resultado. La diferencia contable es importante: la compañía vende datasets, no fuerza laboral, así que los pagos a expertos se contabilizan como costo de bienes vendidos, no como ingreso bruto.
En el comunicado de la ronda, Ratner enmarcó este viraje en lo que llama «Data 2.0»: la frontera de la IA ya no se mueve con grandes volúmenes de datos simples, sino con datos de alta complejidad, costosos de producir y casi imposibles de escalar solo con humanos. Puso como ejemplo los datasets de coding para reinforcement learning: tareas que un ingeniero senior tardaría días o semanas en resolver, con señales de recompensa matizadas sobre outputs a escala de producto, y cientos de controles de calidad para evitar que los modelos «hagan trampa» en el entrenamiento.
La Agentic Data Platform: cómo produce Snorkel sus datos «Data 2.0»
Para fabricar ese tipo de datos, Snorkel describe en su blog una plataforma interna bautizada Agentic Data Platform: expertos humanos apoyados por modelos y agentes de IA especializados —a veces cientos por tipo de tarea— que expanden bocetos en entornos completos, dirigen el trabajo humano hacia «modos de error» específicos del modelo, hacen control de calidad en tiempo real y enrutan subcomponentes a los expertos correctos. Ratner lo describe como un motor de «recursive self-improvement» (mejora recursiva) para datos.
La compañía asegura que, en su trabajo de datos de código, esos agentes aceleran la eficiencia del control de calidad en más del 50% y mejoran la precisión de la revisión en más de 15 puntos porcentuales frente a una línea base de revisores humanos con LLMs genéricos. Además, el feedback humano aplicado como weak supervision rinde, según Snorkel, una mejora de más del 2x en accuracy frente a un modelo frontera no especializado. Son cifras de la propia empresa, no auditadas de forma independiente.
Como parte del anuncio, Snorkel también ampliará su Open Benchmarks Grants Program, que cuenta con un compromiso de US$3 millones para financiar benchmarks abiertos e independientes. Entre los proyectos ya financiados figuran Terminal-Bench, OSWorld 2.0 (junto al XLANG Lab de la Universidad de Hong Kong), Agent’s Last Exam (con RDI de UC Berkeley) y Senior SWE-bench (con las universidades de Wisconsin y Princeton).
El boom sectorial: Mercor, Handshake y Micro1 van al mismo ritmo
Snorkel no está sola. Una camada de startups que se posicionan como «AI data labs» está creciendo a tasas similares, lo que sugiere que la demanda de datos especializados se está convirtiendo en uno de los cuellos de botella más caros de toda la cadena de valor de la IA:
- Mercor declaró un ARR bruto anualizado de US$2.000 millones este verano, según TechCrunch.
- Handshake alcanzó los US$1.000 millones de ARR a comienzos de 2026, también según el mismo medio.
- Micro1, una startup de cuatro años, pasó de US$100 millones a US$500 millones de run rate bruto en ocho meses, según reportó TechCrunch en agosto de 2026.
Pero hay una matización importante que comparten los tres: pagan entre el 60% y el 70% de sus ingresos directamente a los especialistas que hacen el trabajo, lo que deja su ARR neto en una franja mucho menor (en el caso de Micro1, entre US$150M y US$200M según una fuente familiarizada con sus finanzas). El de Snorkel es distinto porque vende datasets completos y entornos de RL, no horas de mano de obra, así que su estructura de costos se parece más a la de un proveedor de software que a la de una agencia de staffing.
Investigadores citados por TechCrunch han llegado a hipotetizar que, en los próximos ciclos, el gasto en datos de IA podría rivalizar con el gasto en cómputo. Si esa proyección se cumple, el sector entero del data-as-a-service tiene margen para seguir multiplicando ARR incluso cuando los laboratorios frontera empiecen a optimizar el lado del compute.
¿Qué significa esto para tu startup?
Que un proveedor de datos haya triplicado su valoración en 17 meses no es un dato aislado: es una señal de hacia dónde se está moviendo el dinero dentro del ecosistema IA. Para founders hispanohablantes, hay tres lecturas accionables:
- Si tu producto toca IA, los datos son el cuello de botella — no los modelos. Los próximos diferenciadores están del lado de datasets propietarios, entornos sintéticos y reinforcement learning de alta calidad, no de «otro wrapper sobre GPT». Los founders que tengan acceso a datos únicos (industrias reguladas, mercados desatendidos, datos en español de calidad) están en posición de crear activos defendibles.
- Piensa en datos como producto, no como insumo. El pitch de Snorkel es vender datasets completos, no horas de etiquetado. Si tu startup tiene expertos de dominio en su equipo, el data-as-a-service es un modelo de negocio en sí mismo: vende el dataset como producto recurrente (lo que el sector llama off-the-shelf data, con márgenes brutos del 80-90% según fuentes del sector).
- Estructura tu economía unitaria antes de levantar. Los comparables (Mercor, Handshake, Micro1) demuestran que crecer ARR bruto es relativamente fácil cuando hay demanda; lo difícil es defender el neto. Los founders que sepan separar el ARR bruto del margen neto —y que entiendan su take rate real— van a leer mejor las próximas rondas del sector y a presentar mejor la suya.
Fuentes
- Snorkel AI triples valuation to $3.5B as demand for AI training data booms (fuente original)
- Snorkel AI Raises $350M Series E at $3.5B Valuation to Build the Frontier Lab for AI Data
- AI data startup Micro1 reaches $500M gross run rate amid AI training boom
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













