Sigma lanza Sigma Eval para auditar agentes de IA empresariales

El 50% que descubrió demasiado tarde que su agente fallaba

El 22 de septiembre de 2026, la española Sigma AI Group presentó Sigma Eval, un servicio independiente de auditoría y verificación continua para agentes conversacionales de IA en empresas. La propuesta llega en un momento incómodo para el sector: según un estudio sectorial citado en el comunicado de Sigma, el 50% de las organizaciones desplegó agentes de IA o funcionalidades basadas en LLM que habían superado las evaluaciones internas pero fallaron después con clientes reales (VentureBeat). Otro estudio, de LangChain, eleva al 57% la cifra de organizaciones con agentes en producción, mientras apenas el 52% asegura realizar evaluaciones offline.

La lectura del CEO de la compañía es directa: «Las empresas no deberían tener que adivinar si su agente de IA es bueno. Deberían poder saberlo. La verificación independiente es lo que convierte una suposición interna en algo en lo que un consejo de administración, un regulador o un cliente pueden confiar», afirma el Dr. Daniel Tapias, CEO de Sigma.

Qué hace Sigma Eval — y, sobre todo, qué no hace

Sigma Eval no es otra herramienta de IA ni un competidor de los frameworks de evaluación que ya usas. La compañía es muy explícita al definir el rol: no construye el agente, no ajusta el modelo y no proporciona los prompts. Mide el comportamiento resultante. Esa separación es deliberada —es la diferencia entre un auditor financiero y el departamento que firma las cuentas— y es la base sobre la que el informe puede funcionar como garantía externa.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

La metodología evalúa al agente en 12 dimensiones agrupadas en tres categorías:

  • Seguridad (6 dimensiones): sesgo, toxicidad, alucinaciones, opacidad, exposición de PII (datos personales identificables) y vulnerabilidad a técnicas de manipulación como los jailbreaks.
  • Experiencia de usuario (3 dimensiones): desalineación del contexto, inconsistencia conversacional y desinterés del usuario.
  • Rendimiento (3 dimensiones): rendimiento de trayectoria, esfuerzo del cliente y coste de resolución.

El detalle clave es que el informe reporta cada dimensión por separado, no una única puntuación agregada. Eso impide que un buen resultado comercial oculte una debilidad de seguridad, o al revés.

Cómo se opera: cero integración con tu stack

Uno de los apartados más relevantes para un founder técnico: el servicio no requiere acceso al código fuente ni a APIs internas. La organización envía el enlace público del agente conversacional, junto con datos de contacto básicos y contexto relevante (propósito, idiomas, KPIs y casos límite conocidos). La evaluación se ejecuta con usuarios y conversaciones sintéticas a escala y en cualquier idioma, y el informe resultante es estrictamente confidencial: nunca se usa como benchmarking público ni como material promocional.

Sigma abre el servicio con un primer informe de evaluación gratuito para cualquier organización que opere un agente en producción, más un número limitado de evaluaciones repetidas para medir el efecto de los trabajos de corrección. Se apoya, además, en Sigma Cypher, su tecnología de anonimización de PII previa al análisis.

Por qué importa ahora: el vacío regulatorio que dejó el EU AI Act

El lanzamiento no es casual. En 2026 el marco europeo alrededor de los sistemas agénticos ha dado dos movimientos simultáneos que empujan a las empresas a buscar verificación de terceros.

Primero, la guía de la AEPD (Agencia Española de Protección de Datos) publicada el 18 de febrero de 2026 es la primera directriz formal de una autoridad supervisora europea que trata la arquitectura agéntica como objeto principal de análisis bajo el GDPR. Introduce la «Rule of 2»: en cualquier configuración, como máximo dos de estos tres factores pueden coexistir sin salvaguardas reforzadas — entrada no controlada, acceso a datos sensibles y acciones autónomas. El documento asume además que los prompts se editan, los modelos se actualizan y las bases de conocimiento cambian, dejando explícito que la verificación periódica es lo único que hace visible la deriva del agente (Yahoo News).

Segundo, el Digital Omnibus de la UE entró en vigor el 27 de julio de 2026, pocos días antes del plazo del 2 de agosto que muchos daban por hecho. El resultado fue el retraso de las obligaciones de alto riesgo del AI Act hasta diciembre de 2027, pero la transparencia del Artículo 50 se mantiene en pie desde agosto de 2026, junto con los poderes de enforcement sobre modelos de uso general (GPAI) (TechTarget).

Traducción práctica para una pyme que opera o vende a la UE: aunque las obligaciones más duras se pospusieron, los compradores corporativos ya están pidiendo evidencia independiente de que los agentes funcionan. Sigilo, sesgo, fuga de datos, deriva: cada uno de esos puntos coincide con alguna dimensión de las 12 que mide Sigma Eval.

El contexto competitivo: medir agentes es todavía una tarea pendiente

Sigma Eval no llega sola. La semana anterior al anuncio, Brackett presentó el Agent Effectiveness Index (AEI), el primer benchmark open-source (licencia MIT) que puntúa a los agentes en su capacidad de ejecutar tareas reales y aprender de la experiencia. Su primera medición comparó a Brackett, OpenAI Codex y Anthropic Claude en tres dimensiones: comprensión del negocio, ejecución operativa y persistencia de aprendizaje (Yahoo Finance).

La diferencia es relevante: Brackett mide capacidades desde fuera (qué tan bien resuelve una tarea), mientras que Sigma mide riesgos desde fuera (qué tan seguro se comporta en producción). Son ángulos complementarios, no sustitutos —y la existencia misma de benchmarks recién nacidos confirma el diagnóstico: evaluar agentes sigue siendo una disciplina inmadura.

La encuesta de McKinsey «The state of AI in 2026», citada por TechTarget, sitúa a dos de cada diez organizaciones escalando agentes de IA activamente. Para los que ya están en producción, Gartner advierte que los agentes muestran comportamiento probabilístico y que «el resultado final solo ofrece una indicación parcial de si el agente se comportó correctamente» — otro argumento a favor de la verificación externa continua.

¿Qué significa esto para tu startup?

Si estás construyendo o desplegando un agente conversacional en producción, el movimiento de Sigma confirma que la auditoría externa está pasando de «nice to have» a requisito de procurement. Tres acciones concretas:

  • Pide o ejecuta una evaluación con 12 dimensiones aunque tu agente «funcione». El 50% que reportó fallos en cliente había pasado sus tests internos. Lo que tu test set no detecta (sesgo, jailbreak, fuga de PII, deriva tras un cambio de prompt) sí lo detecta una evaluación externa.
  • Monta tu propio trust ladder. Gallagher, de Egen, lo describe así: el agente trabaja primero con una persona, después recomienda acciones y, solo cuando demuestra fiabilidad, gana autonomía. Una auditoría Sigma Eval antes del lanzamiento y reevaluaciones periódicas después encajan exactamente en esa lógica (TechTarget).
  • Documenta lo que el regulador va a pedir aunque todavía no lo pida. AEPD marca la pauta sobre agentic AI; el AI Office de la UE ya tiene poder de enforcement sobre GPAI desde agosto de 2026. Mantener un inventario de agentes, una baseline de negocio previa al despliegue y un registro de reevaluaciones semestrales te deja preparado para auditorías internas y externas.

Aprovecha además que la primera evaluación es gratuita: el coste de un informe externo ya no es la barrera, y el retorno de detectar una alucinación legal, un sesgo reputacional o una fuga de PII antes de que un cliente la sufra lo paga en un solo incidente evitado.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...