Vals AI recauda US$40M para convertirse en el estándar de evaluación de IA

Vals AI cierra una Serie A de US$40M liderada por Andreessen Horowitz

Vals AI, la startup fundada en 2024 por Rayan Krishnan (25 años, ex-Palantir y Microsoft), recaudó US$40M en una Serie A para construir lo que su cofundador describe como un árbitro independiente de modelos de inteligencia artificial. La ronda fue liderada por Andreessen Horowitz (a16z), según reportó TechCrunch, y se suma a una ronda semilla previa liderada por 8VC y Bloomberg Beta. La compañía, basada en San Francisco, ya había multiplicado sus ingresos por ocho respecto al año anterior y pasó de 8 a 25 empleados en lo que va de 2026, según datos publicados por UA.News.

Por qué los benchmarks tradicionales ya no alcanzan

Krishnan plantea una crítica directa al estado actual de la evaluación de IA: «Observamos que muchos modelos nuevos y altamente capaces ingresan al mercado, pero los benchmarks académicos no se adaptan a estos avances». El problema no es menor. El Stanford AI Index 2026 muestra que los cuatro modelos líderes en el Arena leaderboard (Anthropic, xAI, Google y OpenAI) están separados por menos de 25 puntos Elo en marzo, y que la diferencia entre el mejor modelo estadounidense y el mejor chino es de apenas 2,7%. En ese contexto, las pruebas de opción múltiple tradicionales pierden capacidad discriminatoria casi en el mismo ciclo en que se publican, según el análisis de KoreaTechDesk sobre el reporte de Stanford.

Vals AI propone un modelo distinto: tests cerrados, no públicos, diseñados con expertos de cada industria (ley, finanzas, programación), que miden si un modelo puede redactar un contrato real sin hallucinar, no si reconoce una definición jurídica. Krishnan lo compara con el College Board y el SAT: los estudiantes pagan por ser evaluados, y las empresas de IA pagan a Vals para identificar puntos ciegos en sus sistemas.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Qué hace diferente a Vals AI de LMArena o Scale AI

El sector de evaluación de IA ya tiene jugadores establecidos como LMArena, los SEAL Leaderboards de Scale AI y una camada de startups nuevas. Vals AI intenta diferenciarse en tres ejes:

  • Neutralidad declarada: no construye modelos ni vende servicios de implementación, según el análisis de AndroGuider.
  • Tests cerrados por dominio: en lugar de publicar un ranking general, trabaja con empresas y expertos para diseñar suites a medida en derecho, finanzas, programación y áreas sensibles como salud mental, ciberseguridad, bioseguridad y derecho internacional humanitario (Convenciones de Ginebra).
  • Foco en consecuencias negativas: además de medir capacidades, la startup indaga qué pasaría si el modelo operara sin restricciones.

El contexto regulatorio que empuja la demanda

El timing de la ronda no es casual. El 18 de septiembre de 2026, el gobernador de California, Gavin Newsom, firmó una orden ejecutiva para fortalecer la supervisión independiente de IA avanzada, acelerando el desarrollo de verificadores terceros bajo la ley SB 813 y el registro de auditores de AB 1405, con reglas operativas previstas para mayo de 2027. En paralelo, el Tribunal de Apelaciones del 10º Circuito de EE.UU. propuso una regla que exige verificación humana de documentos generados con IA antes de presentarlos en litigios (período de comentarios hasta el 18 de octubre, entrada en vigor el 1 de enero de 2027). Y Anthropic anunció el 18 de septiembre una alianza con Accenture para integrar evaluadores externos en sus procesos de desarrollo, con una inversión comprometida de al menos US$1.000M por parte durante cinco años, según el resumen publicado por note.com.

Estos movimientos dibujan un escenario en el que la pregunta dejó de ser «qué tan bueno es tu modelo» para convertirse en «quién, en qué momento y con qué estándar lo verifica». Vals AI quiere ser ese tercero de confianza.

Qué significa esto para tu startup

El negocio de evaluar modelos pasó de ser un tema interno de los laboratorios a convertirse en un servicio que las grandes empresas están dispuestas a pagar. Tres señales concretas que podés aprovechar desde ya:

  • Si vendés software con IA embebida, considerá pagar una evaluación independiente antes de salir al mercado. En el ecosistema actual, un reporte de tercero vale más que un caso de estudio propio: clientes corporativos están exigiendo validación externa antes de firmar contratos de varios millones, según el análisis de AndroGuider.
  • Si estás en el lado de la inversión o M&A, los criterios de due diligence sobre activos de IA están cambiando. Un modelo que lidera un benchmark genérico por 3 puntos tiene menos valor defensivo que uno con un historial verificado en tareas específicas de un sector. La duración de la ventaja competitiva de un benchmark es cada vez más corta, según el AI Index 2026.
  • Si construís productos en sectores regulados (legal, salud, financiero), sumá evidencia auditable a tu propuesta. La presión regulatoria en California y EE.UU. apunta a que, en menos de un año, las empresas que usen IA para generar documentos deberán demostrar un proceso de verificación humana documentado. Tener ese flujo listo es ventaja competitiva medible.

¿Qué viene ahora para Vals AI?

Krishnan anunció que la empresa planea expandirse de 8 a entre 10 y 15 personas adicionales (cifra de la nota original, ya superada según los datos de TechCrunch que indican que hoy son 25), mudarse a una oficina más grande y lanzar un programa de evaluación para agencias federales. A más largo plazo, Krishnan conecta el momento con una tesis simple: «Las empresas de IA están comenzando a salir a bolsa. SpaceX ya lo hizo, y Anthropic planea hacerlo pronto. A medida que los modelos de IA se integren en la economía, los tipos de evaluaciones que realizamos serán fundamentales para su uso y para cómo estas empresas presenten sus informes públicos». El Weekly Notable Startup Funding Report de AlleyWatch ubica a Vals AI en una semana en la que startups de EE.UU. levantaron en conjunto US$10.200M, un contexto donde la apuesta por infraestructura de confianza compite directamente con rondas de US$2.000M para entrenamiento de modelos.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...