Un agente puede ejecutar cada acción correctamente y aun así violar todas las reglas
Gabe Monroy, CTO de Workday, describe en VentureBeat un fallo que los equipos de tecnología suelen descubrir cuando el agente ya está en producción: el sistema ejecuta cada llamada a herramienta sin errores y, aun así, rompe las reglas de la empresa. La causa no es un bug. Es la arquitectura.
Un modelo de lenguaje es probabilístico: genera tokens según verosimilitud matemática, no según reglas codificadas. El tool-calling resuelve una parte —hace determinista la acción individual, de modo que la herramienta ejecuta siempre la misma instrucción de la misma forma— pero deja intacta la capa de decisión. El agente sigue eligiendo qué herramienta llamar, cuándo y con qué argumentos. El problema no desaparece: se traslada a la frontera de la herramienta, que queda expuesta y sin gobierno.
Por qué el caso del contratista internacional importa más de lo que parece
Monroy usa un ejemplo deliberadamente cotidiano. Un manager le pide a un agente de fábrica que incorpore a un contratista internacional. En teoría, la tarea es una secuencia de pasos administrativos. En la práctica, cada llamada individual puede funcionar mientras el agente se salta leyes laborales regionales, retenciones de impuestos y verificaciones de clasificación de trabajadores.
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 díasNo lo hace por malicia: lo hace porque nada en su arquitectura sabe que esas reglas existen. El agente optimiza para completar la tarea, y completa la tarea por el camino que menos resistencia le ofrece. En la superficie parece una victoria de agilidad. Por debajo, es una bomba regulatoria con mecha larga.
Qué dicen los datos: despliegue masivo, gobierno casi inexistente
Según una encuesta de OutSystems de 2026 a 1.900 líderes de TI difundida por Tech Times, el 96% de las empresas ya opera agentes de IA en producción, pero solo el 12% afirma poder gobernarlos de verdad. El mismo medio recoge que Forrester proyecta que el 25% del gasto empresarial en IA planeado para 2026 se postergará a 2027, con los CFO pidiendo evidencia de retorno y los equipos de seguridad señalando huecos de gobierno sin resolver.
El informe 2026 de Optro sobre la empresa agéntica, basado en una encuesta a 417 líderes de gobierno, riesgo y cumplimiento, pone números al daño concreto:
- El 34% de las organizaciones actuó sobre una decisión o un resultado incorrecto generado por un agente.
- El 30% vio a un agente tomar una acción no prevista.
- El 25% sufrió un fallo de control que involucraba a un agente, y el 24% reportó impacto directo en clientes.
- El 20% tuvo dos agentes en conflicto entre sí.
- El 46% dice que su plantilla pasa más tiempo revisando, validando o corrigiendo salidas de IA, no menos.
El dato más incómodo es de autoridad: el 38% ya autoriza a sus agentes a aprobar o rechazar transacciones, el 34% a modificar controles o políticas y el 27% a cambiar permisos de usuario. Y solo el 9% rediseñó sus flujos de trabajo para acomodar a esos agentes de forma segura.
El ecosistema de herramientas también empieza a moverse. AvePoint reportó el 21 de julio de 2026 nuevas capacidades para respaldar y recuperar agentes construidos en Microsoft Copilot Studio y para observar los agentes de Salesforce Agentforce, y citó su propio State of AI Report según el cual el 88,4% de las organizaciones vivió al menos un incidente de seguridad relacionado con agentes en el último año.
El "shadow ERP": el parche que se convierte en deuda técnica
Cuando el área de TI detecta este comportamiento, el reflejo es parchear desde afuera: construir gateways de LLM externos, apilar middleware de políticas o meter manuales corporativos enteros en una ventana de contexto ya saturada.
Monroy es tajante con esa estrategia: un prompt es una petición, no una garantía. El escenario que describe es incómodamente específico. Dieciocho meses después, los equipos de ingeniería han gastado millones reconstruyendo a mano estructuras organizativas, lógica de ruteo y permisos de seguridad dentro de un stack de IA aislado y hecho a medida. Ese es el shadow ERP: una copia frágil y con errores de la misma lógica de negocio que ya vivía en el sistema de registro, ahora con costos de mantenimiento infinitos y gobierno fragmentado.
¿Dónde deberían vivir los guardrails?
La propuesta del CTO de Workday es que la seguridad empresarial deje de ser una aplicación encima del modelo y pase a ser infraestructura central, conectada directamente al motor de inferencia y al entorno de ejecución. Tres piezas sostienen el diseño:
- Un motor de contexto que ensambla exactamente lo que la identidad del agente tiene derecho a ver: registros activos, políticas vigentes y contexto organizacional. La ventana de contexto llega pre-gobernada.
- Un motor de políticas que valida cada acción contra la misma lógica de negocio que gobierna a un empleado humano. Si una transacción financiera exige cuatro niveles de aprobación, la plataforma rechaza cualquier atajo.
- Una capa de ejecución donde cada llamada a una API externa lleva la autoridad y el alcance del humano específico al que sirve el agente, en lugar de una credencial permanente en modo dios. El agente no puede excederse porque la capacidad nunca se emitió.
De ahí sale el concepto que Monroy llama el principio de proximidad: la inferencia debe correr sobre la plataforma que ya gobierna los datos, porque tanto los guardrails como la velocidad se degradan con cada salto intermedio. Fuera del perímetro nativo, el contexto se convierte en una foto desactualizada y la seguridad depende de claves estáticas. Los bucles agénticos son conversadores por naturaleza —docenas de llamadas para completar una sola tarea— y cada cruce de frontera de confianza obliga a re-probar quién pregunta.
Cómo lo están resolviendo Google, Microsoft, AWS y Anthropic
La discusión dejó de ser teórica. Según Tech Times, Google lanzó el 22 de abril de 2026 su Gemini Enterprise Agent Platform con tres primitivas de gobierno por debajo de la capa de aplicación: Agent Identity (identificador criptográfico por agente, con cada acción firmada y trazable), Agent Gateway (punto único de aplicación de políticas) y Agent Registry (catálogo central para evitar que los agentes se multipliquen sin visibilidad de TI).
Microsoft juega con otra carta: Azure AI Foundry, junto a Agent 365 lanzado en noviembre de 2025, hereda la identidad y las políticas de Entra ID para las empresas que ya viven en Microsoft 365, con un precio reportado de aproximadamente US$30 por asiento más US$15 por Agent 365. AWS apuesta por amplitud de modelos en Bedrock AgentCore, con gobierno repartido entre controles de IAM por servicio y sin un plano de control unificado. Anthropic llevó Claude Cowork a disponibilidad general el 9 de abril de 2026 y lo expandió de escritorio a web y móvil el 7 de julio, con un tier empresarial de US$100 por usuario por mes. Y OpenAI pasó sus Workspace Agents a facturación por créditos el 6 de julio.
El patrón es claro: el gobierno de agentes se está convirtiendo en una decisión de infraestructura, no en una pantalla de configuración.
Qué significa esto para tu startup
No necesitas el presupuesto de un banco para aplicar la lógica. Necesitas decidir temprano dónde vive el control.
- Haz un inventario real de agentes con dueño, alcance y permisos. Un dato recogido por HRD Canada de un estudio de Strata Identity de 2026 indica que el 15% de los empleados ya corre "agentes sombra" no autorizados. Si no sabes qué agentes existen, no puedes gobernarlos. Registra cada uno con un responsable nombrado y acceso limitado a su tarea.
- Define por escrito qué salidas exigen verificación humana y quién es el dueño del resultado. El mismo informe cita que solo el 22% de los encuestados dice que su empleador tiene una política escrita que obliga a verificar la salida de IA antes de usarla. Una regla escrita no es burocracia: es lo que evita que tu equipo cargue con la culpa de un error del modelo.
- Da tiempo y contexto al revisor humano, no solo el botón de freno. El informe de Optro señala que el 98% de los encuestados dice que sus revisores pueden detener o anular una acción del agente, pero solo el 64% de las organizaciones que se mueven rápido considera que esos revisores tienen tiempo suficiente para evaluarla. Aprobar clics cansa, y un control fatigado deja de ser un control.
- Mide resultado de negocio, no velocidad. Gartner proyecta que más del 40% de los proyectos de IA agéntica serán cancelados para fines de 2027 por costos crecientes, valor poco claro o controles de riesgo insuficientes, según recoge HRD Canada. Si tu agente no puede demostrar un resultado medible, apágalo antes de que lo haga el comité de riesgos.
Conclusión
La parte difícil de la IA empresarial no es el razonamiento: es el cumplimiento. La tesis de Monroy es que un agente es legal por diseño solo si corre donde ya viven las reglas, con identidad acotada, políticas validadas contra la lógica de negocio y contexto pre-filtrado. Todo lo demás es un prompt pidiendo permiso.
Para un founder, la pregunta ya no es si sus agentes son inteligentes, sino dónde se ejecutan sus límites. Si la respuesta es "en una capa externa que mi equipo tiene que construir y mantener", estás financiando un ERP sombra. Si la respuesta es "en el sistema que ya conoce mis reglas", tienes velocidad sin apostar la compañía.
Fuentes
- VentureBeat: Your AI agents can execute every tool call correctly and still break every enterprise rule
- Tech Times: Gemini Enterprise Agent Platform Leads Enterprise AI Governance
- Optro: One in Three Organizations Say They Have Acted on Wrong Decisions Made by AI Agents
- HRD Canada: AI agent errors cause control failures, customer impact
- TechTarget: AI data fabric emerges as a governance layer for agents
- Yahoo Finance: AvePoint Deepens the Trust Layer for Agentic AI
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días














