Expedia: evals reemplazan PRDs en desarrollo IA 2026

¿Por qué los evals están reemplazando a los PRDs tradicionales?

Xavi Amatriain, jefe de IA en Expedia, declaró en VB Transform 2026 que las evaluaciones automatizadas (evals) están sustituyendo a los documentos de requisitos de producto (PRD) tradicionales en el desarrollo de productos con inteligencia artificial. Este cambio representa un giro fundamental: pasar de especificaciones descriptivas basadas en intuición a pruebas ejecutables con métricas concretas que validan el comportamiento real del sistema.

Para founders de startups que desarrollan productos con IA, esto significa que la calidad ya no se define en documentos estáticos, sino en criterios medibles y reproducibles que se ejecutan continuamente. La diferencia es crítica: un PRD dice "mejorar la atención al cliente", mientras que un eval define exactamente qué respuestas son aceptables, con qué precisión y sobre qué casos de prueba.

¿Qué son exactamente los evals en desarrollo de productos con IA?

Un eval (evaluación de IA) es una prueba sistemática, reproducible y automatizada que mide si un sistema de IA cumple criterios de calidad definidos sobre un conjunto de casos representativos. En términos simples: es una hipótesis de calidad puesta a prueba con datos.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

A diferencia del testing tradicional, los evals no solo verifican si el modelo "acierta", sino si está resolviendo el problema correcto. Incluyen métricas específicas, umbrales de calidad, datasets de referencia ("golden dataset") y reglas de evaluación claras. Lo más importante: se ejecutan repetidamente ante cada cambio en prompts, modelos o datos, integrándose directamente en el flujo de LLMOps.

La ventaja para startups es evidente: puedes productivizar con evidencia en lugar de con suposiciones. Comienzas con 10–20 casos que salieron mal en producción, defines el comportamiento esperado y ejecutas evaluaciones automáticas. Si la calidad cumple los criterios establecidos, escalas progresivamente a más usuarios mediante tests A/B controlados.

¿En qué se diferencia este enfoque del desarrollo tradicional?

La comparación entre PRDs tradicionales y evals revela diferencias estructurales que impactan directamente la velocidad y calidad del desarrollo:

PRD Tradicional:

  • Documento descriptivo con objetivos generales
  • Basado en intuición y requisitos cualitativos
  • Validación manual y subjetiva ("parece que funciona")
  • Una vez definido, no se actualiza sistemáticamente
  • No valida si el modelo resuelve el problema correcto

Evals (nuevo enfoque):

  • Pruebas ejecutables con objetivos concretos y medibles
  • Basado en datos y métricas numéricas verificables
  • Validación automatizada y reproducible sobre dataset estable
  • Se itera continuamente con cada cambio en el sistema
  • Valida explícitamente la solución del problema correcto

Para un founder, esto significa que puedes tomar decisiones de lanzamiento basadas en evidencia cuantitativa en lugar de intuición del equipo. Si tus evals muestran 92% de precisión sobre casos críticos, tienes datos para decidir si lanzas o no.

¿Qué implica el diseño sistémico basado en agentes especializados?

Amatriain propone un enfoque de diseño sistémico que va más allá de simplemente reemplazar documentos por pruebas. Este marco se basa en tres pilares fundamentales que cualquier startup debería considerar:

Agentes especializados: En lugar de un modelo monolítico que intenta hacer todo, el sistema se divide en agentes con responsabilidades específicas. Cada agente tiene sus propios evals calibrados para su función particular. Esto permite detectar exactamente dónde falla el sistema y mejorar de forma dirigida.

Gobernanza calibrada por riesgo: No todos los casos de uso requieren el mismo nivel de rigor. Una recomendación de hoteles tiene menos riesgo que una transacción financiera. Los evals permiten establecer umbrales diferenciados según el impacto potencial del error.

Automatización del ciclo de feedback: Los evals se ejecutan continuamente, no solo antes del lanzamiento. Cada cambio en el sistema dispara la batería de pruebas, detectando regresiones antes de que afecten a usuarios reales.

¿Por qué la seguridad debe integrarse desde el diseño inicial?

La seguridad en productos de IA no puede ser un parche posterior. Amatriain enfatiza que debe integrarse desde la fase de diseño, y los evals son la herramienta clave para lograrlo.

Los evals permiten medir no solo precisión, sino también seguridad, coste y comportamiento en casos límite. Puedes definir evals específicos que verifiquen: ¿el sistema revela información sensible? ¿Responde adecuadamente a prompts maliciosos? ¿Mantiene el coste dentro de los límites establecidos?

Para startups, esto es crítico porque un incidente de seguridad puede destruir la confianza del usuario de forma irreversible. Integrar evals de seguridad desde el día uno te permite escalar con confianza, sabiendo que cada cambio pasa por filtros de seguridad automatizados.

¿Qué significa esto para tu startup?

Si estás desarrollando productos con IA en 2026, este cambio de paradigma tiene implicaciones prácticas inmediatas para tu operación:

Acción 1: Comienza con evals simples esta semana No necesitas infraestructura compleja para empezar. Identifica 10–20 casos reales donde tu sistema falló o tuvo comportamiento subóptimo. Define claramente qué respuesta sería aceptable para cada caso. Implementa una evaluación básica (puede ser tan simple como reglas de matching o un script que compare outputs) y ejecútala antes de cada deploy. Esto te dará una línea base de calidad medible.

Acción 2: Establece umbrales de calidad por caso de uso No todos los features requieren el mismo nivel de precisión. Define umbrales diferenciados: 95% para transacciones financieras, 85% para recomendaciones de contenido, 99% para respuestas que involucran datos sensibles. Documenta estos umbrales y hazlos visibles para todo el equipo. Esto alinea expectativas y permite decisiones de lanzamiento basadas en datos.

Acción 3: Integra evals en tu pipeline de CI/CD Automatiza la ejecución de evals como parte de tu proceso de integración continua. Cada pull request debería ejecutar la batería de evals relevantes. Si los resultados caen por debajo del umbral establecido, el deploy se bloquea automáticamente. Esto previene regresiones antes de que lleguen a producción.

Acción 4: Crea un golden dataset representativo Construye y mantén un conjunto de casos de prueba que represente tu distribución real de uso. Incluye casos comunes, casos límite y edge cases que han causado problemas antes. Actualiza este dataset continuamente con nuevos casos que surjan en producción. Este dataset es tu activo más valioso para medir calidad de forma consistente.

El ecosistema de startups hispanohablantes tiene una ventaja: la agilidad para adoptar nuevas prácticas sin la burocracia de grandes corporaciones. Aprovecha esta flexibilidad para implementar evals antes que tu competencia.

Conclusión

El mensaje de Xavi Amatriain en VB Transform 2026 es claro: el futuro del desarrollo de productos con IA pertenece a quienes pueden medir calidad de forma sistemática y automatizada. Los evals no son solo una herramienta técnica, son un cambio cultural que pone la evidencia por encima de la intuición.

Para founders de startups, esto representa tanto un desafío como una oportunidad. El desafío: requiere disciplina para definir criterios claros y mantener datasets de prueba actualizados. La oportunidad: puedes escalar con confianza, sabiendo que cada cambio está validado contra estándares objetivos de calidad y seguridad.

Las empresas que adopten este enfoque en 2026 tendrán una ventaja competitiva significativa: podrán iterar más rápido con menos riesgo, tomar decisiones de producto basadas en datos concretos y construir confianza con usuarios mediante sistemas más predecibles y seguros. La pregunta no es si adoptar evals, sino cuán rápido puedes implementarlos en tu organización.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, cada día hábil.

Share to...