ServiceNow genera datos sintéticos para entrenar agentes IA

¿Qué es AutoSynthData y por qué importa?

ServiceNow CoreAI presentó AutoSynthData, un sistema diseñado para generar automáticamente datos de entrenamiento sintéticos para agentes de inteligencia artificial empresarial. El problema central que resuelve es uno que cualquier empresa que implemente agentes IA conoce: un modelo puede ser ampliamente capaz pero fallar sistemáticamente en el entorno específico donde debe operar.

La dificultad está en convertir esas debilidades en datos de entrenamiento útiles. Un fallo individual dice algo, pero entrenar un modelo requiere muchas tareas nuevas que ejerciten la misma capacidad en diferentes situaciones. Esas tareas deben ser posibles de completar en el entorno, parecerse al trabajo que realmente se solicitaría, y tener una forma confiable de verificar si el agente tuvo éxito.

AutoSynthData aborda este desafío usando los fallos del modelo objetivo y los éxitos de un modelo maestro más fuerte para decidir qué debe aprender el modelo siguiente, luego genera y valida nuevas tareas que ejerciten esas capacidades. A medida que el modelo mejora, el currículo se desplaza hacia lo que aún le resulta difícil.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Cómo funciona el pipeline

El sistema opera mediante un ciclo de retroalimentación continua:

  1. Evaluación diagnóstica: Se ejecuta tanto el modelo objetivo como un maestro más fuerte sobre tareas de evaluación en el entorno objetivo. Se examinan los resultados para identificar patrones de fallo.

  2. Tarjetas de especificación de capacidades: Los hallazgos se condensan en tarjetas sanitizadas que describen qué capacidad se está probando, qué herramientas y flujos de trabajo están involucrados, dónde falla el modelo objetivo y cómo tiene éxito el maestro, y qué propiedades debe satisfacer un estado final correcto.

  3. Generación de tareas: El generador recibe estas tarjetas y crea nuevas tareas con diferentes prompts, estados iniciales y caminos de solución, variando entidades, configuración del entorno, combinaciones de herramientas y nivel de dificultad.

  4. Validación en dos fases: Primero se crean muestras núcleo (target phase) y luego se expanden en variantes novedosas (multiply phase). Cada candidato pasa por verificación positiva (¿la solución intencional resuelve la tarea?), verificación negativa (¿resultados incorrectos relevantes fallan?) y un proceso de reparación dirigido por un crítico.

  5. Revisión por lotes: Además de la validación individual, se revisa la cobertura general del lote para evitar sobrerrepresentación de familias de tareas fáciles o lagunas de capacidades.

Resultados en EnterpriseOps Gym

ServiceNow probó el pipeline en el benchmark EnterpriseOps Gym (Malay et al., 2026), utilizando dos dominios:

  • Dominio Hybrid: Con Gemma-4-26B-A4B-it como modelo objetivo y Qwen3.8-27B como maestro, AutoSynthData generó 2.000 muestras sintéticas de entrenamiento en aproximadamente 18 horas. El mejor checkpoint (epoch 5) mostró una mejora de 7,2 puntos porcentuales en Pass@1, equivalente a un mejoramiento relativo del 35%, cerrando el 59% de la brecha original entre Gemma y el modelo de referencia.

  • Dominio ITSM: Usando el mismo modelo objetivo pero con DeepSeek-V4.1-Flash como maestro, se generaron 1.994 muestras en 66 horas (el tiempo mayor se atribuyó al uso de un modelo maestro más grande y a optimizaciones posteriores del pipeline). Aquí, el entrenamiento sintético elevó el Pass@1 de 18,77% a 27,18%.

Lo crucial es que las tareas de entrenamiento fueron generadas desde especificaciones de capacidades, no se recibieron las tareas de evaluación originales. Esto evita el riesgo de memorización directa.

El contexto del mercado: por qué esto es urgente

La necesidad de datos de entrenamiento de calidad para agentes empresariales no es teórica. Según un análisis fuente-verificada de bdautomated publicado en septiembre de 2026, aunque el 79% de ejecutivos estadounidenses encuestados por PwC en abril de 2025 afirmaron que ya se estaban adoptando agentes IA en sus empresas, la adopción real en funciones específicas es mucho menor: ningún departamento alcanza más del 10% de implementación.

Las cifras son contundentes. MIT Project NANDA encontró que el 95% de las organizaciones obtienen retorno cero dentro de aproximadamente seis meses de un piloto, midiendo impacto en profit-and-loss. Gartner predijo en junio de 2025 que más del 40% de los proyectos de agentes IA serán cancelados para finales de 2027.

Por otro lado, KPMG reportó en su Global Tech Report 2026 que solo el 24% de las empresas ven ROI en múltiples casos de uso, a pesar del 74% que dice que sus casos de IA están creando valor económico. Esta brecha entre expectativa y realidad operativa es exactamente lo que AutoSynthData intenta cerrar: mejorar la capacidad real de los agentes en entornos específicos sin depender de datos humanos costosos y lentos de recopilar.

El mercado de IA global alcanzará los USD 434,42 mil millones en 2026 según Mordor Intelligence, creciendo desde USD 306,04 mil millones en 2025, con una proyección de USD 2.503,13 mil millones para 2031. Pero el crecimiento del mercado no resuelve el cuello de botella de entrenamiento.

¿Qué significa esto para tu startup?

Si tu equipo está desarrollando o implementando agentes IA para procesos empresariales, AutoSynthData ilustra un patrón que se volverá cada vez más relevante: el entrenamiento personalizado supera al entrenamiento genérico.

Los agentes construidos con modelos base amplios pueden funcionar bien en demos, pero fracasan cuando enfrentan los workflows reales, las políticas específicas y el estado particular de datos de tu empresa. La solución no es comprar un modelo más grande, sino generar datos de entrenamiento que cubran específicamente las brechas de capacidad de tu entorno.

Este enfoque tiene implicaciones concretas para founders que trabajan con IA:

Acción 1: Implementa ciclos de diagnóstico continuo

No asumas que tu modelo está listo después del primer entrenamiento. Establece evaluaciones periódicas que identifiquen patrones sistemáticos de fallo en tu entorno específico. Documenta qué capacidades falla tu modelo, qué herramientas usa incorrectamente, y qué restricciones ignora. Eso te da la materia prima para generar datos de entrenamiento dirigidos.

Acción 2: Usa un modelo maestro para guiar la generación

Si tienes acceso a un modelo más capaz (incluso vía API comercial), úsalo como referencia. El patrón de AutoSynthData — comparar dónde falla tu modelo objetivo contra dónde tiene éxito un maestro — es una fórmula probada para identificar las brechas que realmente importan para el entrenamiento. No necesitas construir el pipeline completo; puedes empezar comparando manualmente los resultados de ambos modelos y generando tareas basadas en esas diferencias.

Acción 3: Valida rigurosamente antes de entrenar

Un verificador laxo premia comportamientos incorrectos; uno demasiado restrictivo penaliza soluciones válidas. Antes de incluir cualquier dato sintético en tu conjunto de entrenamiento, verifica que la solución intencional funciona en el entorno real y que los resultados incorrectos relevantes sí fallan la verificación. Este paso de control de calidad es lo que separa datos útiles de ruido que degrada el modelo.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...