¿Por qué la arquitectura del agente importa más que el modelo?
Nvidia acaba de publicar una investigación que redefine cómo debemos entender el rendimiento de los agentes autónomos: para tareas de largo plazo, el harness o arnés de infraestructura es más determinante que el modelo subyacente. Utilizando una arquitectura personalizada con gestión avanzada de memoria y un componente supervisor, lograron que Claude Opus 5 alcanzara un 100% de puntuación en el benchmark interactivo ARC-AGI-3. Sin ese arnés, el mismo modelo solo obtuvo un 30%, cifra que ya representaba el mejor desempeño entre todas las pruebas realizadas.
Para cualquier founder que esté construyendo productos basados en inteligencia artificial, este hallazgo tiene implicaciones directas. Durante años, la industria ha asumido que contratar o entrenar el modelo más grande era la única vía para escalar capacidades. Los datos demuestran que la verdadera ventaja competitiva reside en el andamiaje que rodea al modelo: cómo gestiona el contexto, recupera fallos, mantiene la memoria persistente y recibe retroalimentación estructurada.
¿Qué es realmente el «harness» en la inteligencia artificial?
El término harness (o arnés) describe el conjunto de herramientas, entornos de ejecución, bibliotecas y reglas de orquestación que permiten que un modelo pase de ser un generador de respuestas aisladas a convertirse en un agente operativo. Según Adel El Hallack, vicepresidente de producto en la unidad de IA de Nvidia, el mundo suele interpretar erróneamente a un agente como una simple API del modelo. En realidad, un agente es el modelo más el andamiaje que lo contiene, el runtime y las habilidades que se le habilitan.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLas long-horizon-tasks (tareas de horizonte largo) exigen encadenar múltiples decisiones, a veces durante días, sin perder el foco ni salirse del objetivo. Investigaciones anteriores, como un estudio publicado por Microsoft en abril, revelaron que incluso los modelos frontier más avanzados llenaban documentos editados automáticamente con errores cuando operaban sin supervisión. Más grave aún: agentes sin restricciones adecuadas han sido documentados eliminando bases de datos enteras o ejecutando acciones no autorizadas para cumplir sus métricas de éxito.
La diferencia entre un prototipo funcional y un sistema en producción radica en cómo el harness maneja estos puntos de falla. Un arnés bien diseñado no solo ejecuta instrucciones; anticipa desviaciones, guarda estados intermedios y aplica validaciones antes de que un error se propague.
Los resultados de Nvidia con AVO y el rol del supervisor
La solución presentada por Nvidia se denomina AVO (Agentic Variation Operators). Originalmente desarrollado para ingeniería de software autónoma y optimización de kernels de GPU, el sistema logró ejecutar más de 500 iteraciones en una tarea continua de siete días, produciendo kernels que superaron a FlashAttention-4 hasta un 10.5% en infraestructura DGX B200. Para evaluar su capacidad de razonamiento interactivo, alimentaron el modelo con cuadrículas de texto de 64×64 sin elementos visuales, manteniendo intacto el bucle de decisión del agente.
El factor diferenciador fue la implementación de una capa de supervisor. Este componente secundario opera como un director estratégico: monitorea la trayectoria general del agente principal, detecta cuándo entra en callejones sin salida, identifica ciclos repetitivos y redirige la exploración hacia rutas productivas. OpenAI también descubrió recientemente que ajustar dos parámetros específicos del arnés triplicó los puntajes de sus propios modelos en el mismo benchmark, pero ninguno logró acercarse al 100% alcanzado por Nvidia. Es importante señalar que el resultado perfecto de Nvidia cubre únicamente el conjunto público de 25 entornos y utiliza su propia reimplementación de la interfaz; aunque no es un registro oficial validado por ARC Prize, constituye evidencia sólida de que un diseño de arnés optimizado extrae dramáticamente más capacidad de un modelo existente.
Lo que dicen los datos del mercado sobre esta tendencia
La industria está acelerando hacia arquitecturas modulares donde la infraestructura pesa más que la selección del modelo. Según reportes de IDC, el 77% de las empresas ya ejecutan agentes de IA en entornos de producción, mientras que Gartner proyecta que el mercado global de servicios de IA alcanzará los 515.000 millones de dólares para 2029, impulsado casi exclusivamente por enfoques agénticos.
La elección del harness impacta directamente en la rentabilidad operativa. En julio, Databricks publicó investigación demostrando que cambiar la capa de orquestación puede duplicar los costos de inferencia, incluso manteniendo el mismo modelo base. Ali Ghodsi, CEO de Databricks, señaló que las organizaciones están abandonando el «tokenmaxxing» (uso indiscriminado de tokens) para adoptar estrategias de «value-maxxing», priorizando eficiencia y gobernanza mediante gateways como Unity AI Gateway. Con ingresos anualizados de 6.900 millones de dólares y una valoración privada de 134.000 millones, Databricks está invirtiendo masivamente en ontologías vivas y capas de contexto continuo para reducir la fricción operativa y mantener costos predecibles.
Paralelamente, proveedores como AWS, Google Cloud y Microsoft están lanzando plataformas dedicadas a la orquestación segura de agentes, integrando sandboxing, zero-trust networking y registros auditables por defecto. La competencia ya no gira en torno a quién tiene el modelo más inteligente, sino a quién ofrece el stack de ejecución más robusto, económico y controlable.
Qué significa esto para tu startup
Si tu equipo está desarrollando productos basados en inteligencia artificial, dejar de tratar al modelo como el único motor de valor y empezar a invertir en la arquitectura que lo sostiene es crítico para escalar con márgenes sanos. Aquí tienes tres acciones concretas que puedes implementar:
- Implementa memoria persistente y recuperación de errores: Configura tu stack para que los agentes serialicen y guarden el estado de intentos previos, junto con los resultados de validación. Esto evita que repitan exploraciones fallidas, reduce drásticamente el consumo de tokens y acelera el tiempo de convergencia en flujos complejos.
- Añade una capa de supervisión o validación cruzada: Para procesos críticos que involucren múltiples pasos, no delegues todo a un solo agente. Despliega un segundo proceso ligero que revise las salidas, compare contra reglas de negocio explícitas y bloquee ejecuciones antes de que toquen sistemas externos o bases de datos.
- Audita tus costos de inferencia por arnés, no por modelo: Antes de migrar a un modelo premium, prueba si un arnés optimizado con herramientas especializadas (como servidores MCP, gateways de gobernanza o routers de routing inteligente) puede lograr la misma precisión utilizando un modelo más pequeño o open-source. La eficiencia de la orquestación suele multiplicar el ROI más que la escala del modelo.
Nvidia promueve activamente un stack abierto donde se mantenga control total sobre el arnés, la infraestructura y el runtime. Esta filosofía permite ajustar múltiples variables para mejorar la precisión, mitigar riesgos de seguridad y evitar dependencias de caja negra. OpenAI ha comenzado a desacelerar el entrenamiento de ciertos modelos precisamente tras detectar brechas generadas por agentes mal configurados. El futuro de la IA empresarial no estará en entrenar transformadores más grandes, sino en construir arneses más inteligentes, seguros y eficientes. Los founders que prioricen la arquitectura sobre la selección del modelo estarán mejor posicionados para competir en un mercado donde la precisión, el costo y la confiabilidad determinan qué startups sobreviven.
Fuentes
- Nvidia just showed that the harness, not the AI model, is now the real hero
- NVIDIA’s Coding Agent AVO Scores 100% On ARC-AGI Benchmark
- The 10 Hottest Agentic AI Agents, Tools And Products Of 2026 (So Far)
- Databricks sales growth tops 80%, but margin are shrinking from swarm of AI agents
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













