El modelo mental que vuelve fiables a los agentes de IA

Por qué la mayoría de los agentes de IA fallan al pasar a producción

Una observación simple, publicada por el ingeniero Pandit Dhamdhere y recogida por KuCoin News, está detrás de algunos de los sistemas agentic más usados en producción: el modelo de IA no debe controlar todo el flujo de trabajo. La fórmula que propone resume el error más caro del momento:

  • LLM = razonamiento
  • Aplicación = control
  • Herramientas = ejecución

Dicho de otra forma: cuanto más crítica sea una operación, menos deberías dejar que el modelo haga cumplir las reglas por sí solo. ServiceNow lo está explicando con la misma lógica a sus clientes enterprise: «el LLM razona, pero es la plataforma la que ejecuta», según declaró Paul Fipps, presidente de Customer Operations de la compañía, en una entrevista con Diginomica.

La diferencia no es semántica: define si tu agente funciona como demo o como producto.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El patrón que se repite en producción: workflow determinista con IA embebida

David Loker, VP de IA de CodeRabbit —uno de los sistemas de code review agentic más desplegados—, lo describe igual: su sistema no arranca con un LLM y espera que improvise. Arranca con un pipeline determinista que trae el diff, construye el grafo de código, corre análisis estático e identifica los archivos modificados. Solo entonces, en los puntos donde hace falta juicio, inserta un loop agentic. La frase exacta que recoge InfoWorld: «ocurre en un workflow, con dos loops agentic embebidos en puntos específicos donde el razonamiento es realmente necesario».

El respaldo académico aparece en el estudio Towards Outcome-Oriented, Task-Agnostic Evaluation of AI Agents, citado por InfoWorld: las arquitecturas híbridas que combinan workflow estructurado con loops agentic alcanzan un 88,8 % de Goal Completion Rate promedio sobre cinco dominios, superando al ReAct puro, al chain-of-thought y a los agentes solo con herramientas.

La regla práctica, según Loker: «Hay cosas que sabemos que son muy importantes y las corremos igual». El contexto base se ensambla de forma determinista antes de invocar cualquier modelo de razonamiento.

Qué partes del flujo deben ser deterministas (y cuáles no)

Zapier, en un artículo distribuido por AOL, lo lleva al terreno de la implementación con una tabla útil para founders:

Función ¿Quién la hace?
Decidir qué solicitud de cliente se atiende El modelo
Definir reglas de autenticación Tu aplicación
Sugerir una acción El modelo
Validar si esa acción está permitida Tu código
Elegir el siguiente paso El modelo
Imponer orden, reintentos, timeouts y transiciones de estado Tu motor de workflow

El artículo original de KuCoin lo dice de forma aún más cruda: «Cuanto más importante sea la operación, menos deberías confiar en el modelo para hacer cumplir las reglas». La razón es de ingeniería, no de moda: los LLM son probabilísticos por naturaleza, y la misma entrada puede producir salidas distintas en cada ejecución. Útil para interpretar texto ambiguo; peligroso para mover dinero, conceder permisos o cerrar un ticket crítico.

Por qué este cambio de mentalidad importa ahora

Microsoft oficializó en el Build 2026 (2 de junio de 2026) la convergencia de AutoGen y Semantic Kernel en el Microsoft Agent Framework, un SDK único con soporte comercial para sistemas multi-agente. La pieza clave para founders no es el framework en sí, sino las dos capas que lo acompañan:

  • Azure Agent Mesh: capa de orquestación para que agentes de distintos proveedores se coordinen entre sí.
  • AgentGuard: capa de gobernanza con permisos por rol, prevención de fuga de datos y registro de auditoría — por ejemplo, «un agente nunca puede enviar datos financieros a una API externa sin aprobación humana explícita».

Este movimiento confirma que el sector se está alineando con el principio de Dhamdhere: el razonamiento vive en el LLM, pero el control vive en la plataforma.

Qué significa esto para tu startup

Si estás montando un producto con agentes de IA en 2026, la pregunta ya no es «qué tan listo es mi modelo» sino «dónde termina el modelo y dónde empieza tu código». ServiceNow, según Diginomica, reporta que su L1 Service Desk AI Specialist resuelve casos asignados un 99 % más rápido que agentes humanos, precisamente porque la ejecución sigue siendo determinista. CodeRabbit opera con más de 10 variantes de modelo distintas según la etapa del workflow, eligiendo por coste, latencia y nivel de razonamiento necesario — no un solo modelo haciendo de todo.

Tres decisiones de diseño que podés tomar hoy:

  • Mapea tu workflow antes de elegir modelo. Identifica qué pasos son mecánicos (autenticación, enrutamiento, validaciones, reintentos) y cuáles requieren juicio (interpretar intención, clasificar, resumir). Construye el esqueleto determinista y embebe los loops agentic solo donde aporten.
  • Separa generación de verificación. ServiceNow y CodeRabbit usan modelos distintos para producir y para revisar. Si tu agente propone una acción, otro paso —preferentemente otro modelo o regla dura— debe validarla antes de ejecutarla.
  • Diseña el contexto como un playbook vivo, no como un prompt. El estudio ACE (Agentic Context Engineering), citado por InfoWorld, demostró que tratar el contexto como un documento estructurado que evoluciona logra +10,6 % en benchmarks de agentes, frente a prompts monolíticos que pierden precisión.

Una métrica que vale la pena recordar del benchmark SkillsBench: skills procedurales curados por humanos elevan la tasa de acierto en +16,2 puntos porcentuales en promedio; pero los skills autogenerados por el modelo no aportan nada (-1,3 pp). La conclusión es incómoda: todavía no podés dejar que el agente escriba su propio manual de operaciones.

El error más caro: darle al modelo el máximo control

La tentación cuando aparece un LLM nuevo es darle más autonomía: «que decida él». El modelo mental que están adoptando ServiceNow, CodeRabbit y el propio Microsoft Agent Framework apunta en la dirección contraria: darle exactamente el control suficiente para ser útil, ni más ni menos. El resto — autenticación, orden, reintentos, transiciones de estado, permisos — vive en tu aplicación, en reglas que podés testear, versionar y auditar.

Para un founder hispanohablante construyendo con IA, la diferencia práctica es clara: un agente probabilístico que controla todo el flujo te entrega una demo brillante y un sistema que falla en producción; un agente probabilístico insertado en un workflow determinista te entrega un producto que escala, se depura y se factura.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...