Agent harness: por qué los agentes de IA finalmente funcionan

Qué cambió a finales de 2025 con los agentes de IA

Por Navidad de 2025, ingenieros que llevan meses empujando agentes en producción notaron algo que llevaba tiempo cocinándose: los agentes empezaron a funcionar en serio. Dan McAteer, en un ensayo publicado en Latent Space, sostiene que ese salto no se explica solo por un mejor modelo: vino de la coevolución entre el modelo y todo lo que lo rodea, lo que él llama agent harness.

La tesis interesa a cualquier founder hispanohablante que esté montando RAG, MCP o agentes de código: si la mitad del resultado depende del envoltorio y no de los pesos, hay una palanca de optimización barata que casi nadie está tocando bien.

Qué es exactamente un agent harness

Un harness es todo lo que rodea al modelo: el entorno, las herramientas, el contexto, la memoria y las guardrails. Sin esa capa, el modelo es un cerebro en un frasco: capaz de decidir, pero incapaz de actuar en el espacio digital.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

La analogía del ensayo es directa: el harness le da un cuerpo a la mente del modelo. Cuatro funciones mínimas que cualquier equipo técnico ya está escribiendo a mano:

  • Percibir: alimentar contexto (estado, documentos, instrucciones)
  • Actuar: exponer herramientas (bash, lectura/escritura de archivos, APIs, navegadores)
  • Persistir: gestionar memoria y compactación para no chocar con la ventana de contexto
  • Limitar: reglas de permisos y guardrails para que el agente no haga lo que no debe

McAteer organiza la evolución en dos curvas que corren en paralelo: lo que el harness pide al modelo y lo que el modelo entrega. La distancia entre ambas es la efectividad real del agente. Cerrar esa distancia —no solo agrandar el modelo— es lo que explica el salto de finales de 2025.

La línea de tiempo: tres eras que todo founder debe entender

Era 1: el improviso (2022–2024)

  • ReAct (octubre de 2022): el loop agéntico en papel —razonar, actuar, observar, repetir— existía solo como técnica de prompting. Nadie lo llamaba harness. Curiosamente, salió un mes antes que ChatGPT.
  • Toolformer (Meta, febrero de 2023): la idea de entrenar el uso de herramientas en el modelo en vez de promptarlo desde fuera. Una semilla que tardó años en germinar.
  • AutoGPT y BabyAGI (2023): el harness se disparó por delante del modelo. Le dieron autonomía total a modelos que todavía eran "previsores de próximo token frágiles". La cuenta es brutal: 95% de fiabilidad por paso en una tarea de 20 pasos da alrededor de 36% de éxito. El loop amplifica los errores tanto como las aciertos.
  • Cursor y Copilot (2023–2024): el recuo inteligente. En vez de darle el loop al modelo, se lo devolvieron al humano y dejaron al modelo acelerar a quien estaba al mando. La primera versión de Devin intentó devolver la autonomía al modelo demasiado pronto y un test de Answer.AI marcó cerca de 15% de éxito. El "human in the loop" no era cobardía, era la jugada correcta para ese momento.

La lección para el dev de cualquier país: la misma arquitectura que fracasó en 2023 se convirtió en negocio billonario en 2025, porque el modelo por debajo finalmente aguantaba la autonomía. Es un problema de timing, no de tecnología.

Era 2: el coentrenamiento (2025–2026)

La parte más concreta del ensayo trae números. El harness importa y se puede medir: el Harness-Bench corrió el mismo modelo en las mismas 106 tareas con harnesses distintos y las notas variaron de 52,4 a 76,2 — un intervalo de 23,8 puntos sin tocar el modelo. Mitad del agente es el harness.

El caso más citado es el de OpenAI con GPT-5.6 Sol en ARC-AGI-3: solo añadiendo dos ajustes al harness —retención de razonamiento y compactación en lugar de truncado— el puntaje pasó de 13,3% a 38,3%, casi triplicándose, y el consumo de tokens de salida bajó a una sexta parte, según publicó OpenAI.

Bajo el capó, lo que cambió es que el reinforcement learning entró dentro del harness. Como dice el anuncio del codex-1 de OpenAI de mayo de 2025, el modelo fue "entrenado usando RL en tareas reales de código en una variedad de entornos". La semilla del Toolformer por fin brotó: el tool calling pasó a entrenarse desde dentro del entorno del modelo, no a promptarse desde fuera.

El efecto colateral es elegante. Al entrenar al modelo dentro del harness, el modelo empieza a absorber las capacidades del harness en sus propios pesos: aprende a auto-compactarse con conciencia de su propia ventana de contexto, por ejemplo. McAteer cita a Thariq Shihipar, de Anthropic, contando que el equipo borró el 80% del system prompt de Claude Code sin perder capacidad. La métrica de progreso se vuelve contraintuitiva: cuanto más del harness consigues borrar manteniendo la misma capacidad, más ha evolucionado el sistema. El loop es entrena → absorbe → descarta → repite.

Era 3: cuando el cuello de botella pasa a ser la atención humana

Si toda capacidad del harness acaba absorbida por el modelo, ¿qué queda? La parte más especulativa del ensayo, pero la más provocadora. Lo que queda son las capacidades centradas en el humano: permisos, identidad, confianza y legibilidad. Un modelo que absorbe los permisos en sí mismo disuelve los permisos. La absorción no acaba con el harness, lo invierte.

El harness nació como interfaz del humano hacia el modelo (chatbox, después IDE, después terminal). Cuando el modelo se traga las capacidades orientadas a la máquina, el harness sube una capa y pasa a ser la interfaz del modelo hacia la atención humana. Como resume Ryan Lopopolo en otro episodio de Latent Space citado por McAteer: "lo único fundamentalmente escaso es la atención síncrona de mi equipo". Los tokens se volvieron abundantes y confiables; el cuello de botella migró a la atención humana.

La apuesta concreta de McAteer: en menos de un año, toda empresa que construya IA agéntica va a enviar una "superficie de política de atención humana", igual que hoy todas envían un AGENTS.md. Si el AGENTS.md le dice al agente cómo trabajar con tu código, esa nueva capa le diría cómo trabajar contigo: cuándo puede interrumpir, cuándo debe seguir solo, qué decisiones toma sin pedir y cuáles requieren aprobación. Y, como todo en el sistema agéntico, sería un componente aprendible: cada corrección se convierte en dato.

La confirmación externa: Nvidia y el 100% en ARC-AGI-3

El argumento del ensayo deja de ser hipótesis cuando Nvidia publica, el 21 de agosto de 2026, una investigación recogida por TechCrunch que llega a la misma conclusión por otra puerta. Usando un harness propio —llamado Agentic Variation Operators (AVO)— con un componente supervisor que empuja al agente cuando se atasca, los investigadores llevaron a Claude Opus 5 a un 100% en ARC-AGI-3, partiendo del 30% que ese mismo modelo lograba sin el envoltorio afinado.

Adel El Hallak, VP de producto en la unidad de IA de Nvidia, lo resumió así a TechCrunch: "el mundo interpreta un agente casi como un API del modelo, pero un agente es más que eso: es el modelo, el scaffolding alrededor del modelo, el runtime y las skills y librerías a las que le damos acceso".

El propio CEO de Databricks, Ali Ghodsi, había aportado una pieza clave en julio: "puedes elegir el mismo modelo con harnesses distintos y obtener el doble de coste si usas el harness equivocado". El coste del agente depende más de la arquitectura del envoltorio que del precio por token del modelo.

Qué significa esto para tu startup

El ensayo de McAteer no es teoría: es un cambio de cuenta de resultados para cualquier equipo que construya con IA agéntica. Si inviertes en harness bien hecho, el retorno es comparable al de cambiar de modelo y cuesta una fracción.

Tres acciones concretas que puedes aplicar esta semana:

  • Audita tu harness antes de cambiar de modelo. Mide el rendimiento del mismo modelo en tus tareas críticas con dos configuraciones distintas de contexto, permisos y compactación. Si la diferencia supera los 20 puntos, tienes una optimización barata sin tocar el proveedor de IA.
  • Diseña una política de atención humana. Define por escrito qué puede decidir tu agente sin preguntar (lectura de archivos, consultas a bases de datos, llamadas a APIs de solo lectura), qué necesita confirmación (escritura, borrado, acciones monetarias) y cómo prioriza interrupciones. Ese documento es el equivalente agéntico de tu AGENTS.md y sobrevivirá a las próximas tres generaciones de modelos.
  • No sobreingenieries el andamio. Como parte de la capacidad del harness será absorbida por el próximo modelo, construye hoy la capa mínima viable de contexto y guardrails que te lleve a producción, y deja margen para reducirla. El progreso se mide en lo que puedes borrar, no en lo que añades.

La lectura para founders hispanohablantes: la próxima frontera competitiva de los agentes no está en quién entrena el mejor modelo, sino en quién escribe el mejor harness. Es una capa accesible para equipos chicos, con herramientas abiertas y sin necesidad de clústeres de GPU. Ahí hay una ventana.

Lo que queda abierto

El ensayo es fuerte en el diagnóstico histórico y generoso con los números del presente, pero la parte 3.0 es predicción, no observación. Vale leerla con el mismo escepticismo que el propio texto recomienda: las curvas descritas son un modelo mental útil, no una medición.

Lo que sí está verificado: el Harness-Bench, el caso de OpenAI en ARC-AGI-3, el experimento de Nvidia con Claude Opus 5 y el comentario de Databricks sobre costes apuntan todos en la misma dirección. La mitad de tu agente vive fuera del modelo. Y esa mitad es donde están las optimizaciones más baratas y más estables que un founder puede hacer este trimestre.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...