Vals, startup de benchmarks de IA, levanta US$40M con a16z

Qué hace Vals y por qué importa ahora

Vals es una startup fundada en 2024 por Rayan Krishnan, un exinterno de Palantir y exalumno de Stanford de 25 años, que construyó un sistema de benchmarks privados para evaluar modelos de IA en tareas profesionales reales. En agosto de 2026 cerró una Serie A de US$40M liderada por Andreessen Horowitz (a16z), según reportó TechCrunch.

La tesis que vende Vals es directa: los benchmarks académicos clásicos (MMLU, HumanEval, GSM8K y compañía) llevan años expuestos en internet, así que los modelos frontera ya los tienen dentro de sus datos de entrenamiento. Cuando un laboratorio publica un "92% en X benchmark", cada vez más observadores asumen que parte de ese número es contaminación, no capacidad genuina.

Para evitarlo, Vals no publica las preguntas de sus tests y, en lugar de medir conocimiento general, evalúa si los modelos pueden completar tareas complejas propias de oficios concretos: redacción de contratos legales, modelado financiero, generación de código desde un repositorio real y, según Krishnan, hasta la aplicación correcta de la Convención de Ginebra a escenarios de conflicto armado.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Cómo funciona el modelo de negocio

La mecánica es contraintuitiva: las propias empresas pagan a Vals para que evalúe sus modelos, una analogía que el fundador compara con el College Board que cobra a los estudiantes por hacer el SAT. Un resultado adverso no destruye al modelo: le da al laboratorio un mapa accionable para mejorar la próxima iteración.

Según Pulse2, los resultados de Vals ya aparecen citados en las model cards de OpenAI, Anthropic, Google, Meta y xAI. Esa adopción es señal de que los desarrolladores de frontera empiezan a tratar la evaluación independiente como un requisito reputacional, no como un complemento opcional.

Junto a la Serie A, Vals anunció tres piezas:

  • Vals Smith, ya disponible, permite crear benchmarks de código personalizados a partir de repositorios de GitHub, con 120 créditos gratuitos para nuevos usuarios según Pulse2.
  • Vals 2.0, una versión renovada del sitio y un nuevo Vals Index para dar cobertura más amplia al rendimiento económico de los modelos.
  • Frontier Risk Benchmarks, que suma un índice RSI (Recursive Self-Improvement) desarrollado con CoreWeave, un benchmark de ciberseguridad con investigadores académicos y trabajo inicial en salud mental.

El contexto: por qué los benchmarks están en crisis

Que Vals cierre US$40M no es solo una buena ronda: es síntoma de un problema sistémico que el sector ya no puede esconder. Un análisis de 2026 reportado por TechTimes encontró que aproximadamente la mitad de los benchmarks públicos muestran signos de saturación por contaminación, una proporción que crece conforme los modelos se entrenan sobre franjas cada vez más grandes de internet.

El 27 de agosto de 2026, Google DeepMind dio un paso técnico relevante: realizó la primera evaluación "doble ciego" de un modelo frontera usando un enclave criptográfico (NVIDIA H100 con Intel TDX) junto con el AI Safety Institute de Singapur, OpenMined, MLCommons y la firma evaluadora AVERI, según reportó TechTimes. En ese esquema, ni el proveedor del modelo ve las preguntas ni el evaluador ve los pesos del modelo, con un overhead de rendimiento menor al 5%.

Lo que Vals aporta en ese debate es un enfoque comercial y recurrente: una capa de medición independiente, privada, que se paga cada vez que un laboratorio quiere saber qué tan bueno es realmente su próximo lanzamiento.

Financiamiento y métricas

Los números de la compañía, según TechCrunch y Pulse2:

  • Ronda semilla en 2025, liderada por 8VC y Bloomberg Beta.
  • Serie A de US$40M en agosto de 2026, liderada por a16z, con 8VC, Bloomberg Beta, HRT Ventures y Next Ladder Ventures.
  • Valoración de US$400M post-money, según Pulse2.
  • Ingresos 8 veces lo facturado en todo 2025.
  • Equipo pasó de 8 personas a 25 entre enero y septiembre de 2026, con planes de sumar entre 10 y 15 más.
  • Base de clientes duplicada en los últimos seis meses, según Pulse2.

Vals también lanzó un programa de evaluaciones para agencias federales y, según Pulse2, ya trabajó con el Departamento de Comercio de EE. UU. y con miembros del Congreso que están definiendo políticas de IA. Krishnan apunta más lejos: cuando SpaceX, Anthropic (prevista para este año) y eventualmente OpenAI salgan a bolsa, los benchmarks independientes serán parte central de cómo estas empresas rindan cuentas a inversores y reguladores.

Competidores y movimientos en el sector

Vals no está sola en la categoría de "evaluación independiente". Uno de los rivales más visibles es Artificial Analysis, que en agosto de 2026 fue nombrado socio evaluador oficial del proyecto soberano Dokpamo de Corea del Sur, según reportó CryptoBriefing. Su Intelligence Index representa el 25% del puntaje total del proyecto, donde compiten SK Telecom, Upstage, LG AI Research y Motif Technologies.

En el frente técnico-criptográfico, la tendencia apunta a infraestructura que elimina la necesidad de confiar en la palabra de los laboratorios. OpenMined ya había piloteado algo similar con el AI Security Institute del Reino Unido y Anthropic en diciembre de 2024, según TechTimes. El enclave de DeepMind de agosto es la versión más reciente y la más ambiciosa.

Lo que une a todos estos movimientos es la misma pregunta que Vals intenta capitalizar: ¿cómo sabes que el modelo que vas a comprar (o regular) realmente sabe lo que dice saber?

Qué significa esto para tu startup

Si estás construyendo o comprando IA para tu empresa, el movimiento de Vals tiene tres implicaciones prácticas inmediatas.

1. Empieza a exigir evaluaciones por dominio, no benchmarks genéricos. Un 95% en MMLU no te dice si el modelo va a redactar bien tus contratos o modelar correctamente tu flujo de caja. Antes de cualquier despliegue serio, construye un benchmark con 50-100 ejemplos reales de tu propio trabajo y compara los modelos candidatos en esa batería. La nueva versión de Vals Smith está pensada exactamente para esto en código.

2. Trata la evaluación como un costo recurrente, no como un evento único. El modelo "pago-por-evaluarme" suena raro, pero es la única forma de evitar que tu sistema envejezca en silencio. Cada vez que cambies de modelo o lo actualices, vuelve a correr la batería. Es el equivalente funcional de las pruebas de regresión en software clásico.

3. Si vendes a gobierno o a enterprise regulado, documenta desde ya cómo se mide tu IA. Vals ya trabaja con el Departamento de Comercio de EE. UU. y Artificial Analysis evalúa proyectos soberanos en Corea. La "evaluación independiente" va camino de convertirse en requisito de procurement en sectores como salud, finanzas y defensa. Si tu producto toca uno de esos verticales, tener un dossier de evaluación propio puede ser una ventaja de venta concreta en 12-18 meses.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...