La "gran mejora" de los agentes en Navidad de 2025 tiene nombre: el harness
En algún momento alrededor de diciembre de 2025, los ingenieros de IA notaron algo: los agentes empezaron a funcionar de verdad. La pregunta que muchos se hacían era si el salto venía de los modelos. Lukasz Kaiser, uno de los inventores del Transformer, lo explicó en el podcast Unsupervised Learning en junio: el cambio se debió a la conjunción de un harness que mejoró, un poco de post-entrenamiento y nuevos modelos pre-entrenados, una combinación difícil de atribuir a una sola causa.
El análisis de Latent Space, firmado por su autor y titulado The Evolution of the Agent Harness, sostiene que el salto de Navidad fue el punto en que dos curvas se cruzaron: la capacidad del modelo y la capacidad del harness. Y lo que viene después es que ambas curvas se trenzan, se absorben mutuamente y dejan al descubierto una nueva capa: el harness se convierte en la interfaz hacia la atención humana, no hacia el modelo.
Para un founder, el mensaje es incómodo: la mitad de tu agente es el harness, no el modelo. Y esa mitad es, además, la que define tu producto.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadQué es el harness y por qué ocupa 98% del código
Un agent harness es todo lo que rodea al modelo para que el agente funcione: el entorno, las herramientas, el contexto, los permisos y las barandas de seguridad. Sin harness, el modelo es un cerebro en una cubeta que solo predice el siguiente token.
Un estudio de MBZUAI analizado por InfoQ en abril de 2026, titulado Dive into Claude Code, hizo algo revelador: clasificó las aproximadamente 512.000 líneas de código de Claude Code v2.1.88, cuya fuente completa en TypeScript quedó brevemente expuesta el 31 de marzo tras un bundle de sourcemap en un release de npm. El resultado: alrededor del 98,4% del código es infraestructura de harness — permisos, gestión de contexto, sandboxing, enrutamiento de herramientas y recuperación — y solo 1,6% es lógica de decisión de IA. Es una clasificación derivada de un bundle con código minificado, pero la dirección la confirman al menos tres agentes independientes (Codex CLI, Aider y otros) que convergen en la misma forma de harness: es una restricción del problema, no una decisión de diseño.
Para un founder técnico esto cambia la pregunta de producto: qué decisiones tomas en el 98% del código se nota más que qué modelo usas en el 1,6% restante.
Las tres eras del harness: cómo se cerró la brecha
El análisis de Latent Space describe tres eras, y entenderlas te ayuda a leer el roadmap de cualquier vendor de IA.
1. La era Bolt-On (2022-2024): cuando el harness corría más rápido que el modelo.
- ReAct (octubre 2022): un mes antes de ChatGPT, introduce el bucle agente "razonar → actuar → observar → repetir" como técnica de prompting. Nadie lo llamaba harness todavía.
- AutoGPT y BabyAGI (primavera de 2023): el harness corre muy adelante del modelo y le entrega autonomía total. El resultado: con 95% de fiabilidad por paso en una tarea de 20 pasos, la tasa de éxito cae a ~36%. Un bucle amplifica la capacidad, no la crea — y por debajo de cierto umbral amplifica errores.
- Cursor y Copilot (2023-2024): reacción inteligente. En lugar de seguir pidiendo autonomía total, los IDE con IA devuelven el bucle al humano y dejan que la persona orqueste mientras el modelo acelera su trabajo. Una prueba del equipo de Answer.AI sobre la primera versión de Devin mostró ~15% de éxito: el repliegue a "human in the loop" no fue cobardía, fue la decisión correcta.
2. La era Co-Training (2024-2026): cuando las curvas se cruzan y empiezan a trenzarse.
- OpenAI o1 (finales de 2024): el primer modelo de razonamiento invierte la brecha por primera vez. La capacidad del modelo supera al harness.
- Claude Code (febrero de 2025): Boris Cherny y el equipo de Anthropic construyen Claude Code pensando en las capacidades del próximo modelo, no del actual. Abandona el IDE por la terminal, le da al modelo acceso a bash y a lectura/escritura de archivos, y reemplaza la aprobación humana por cada cambio con reglas de permisos. El modelo recibe el bucle y esta vez entiende la tarea. Alcanza aproximadamente US$1.000M de ARR en seis meses, según datos reportados por VentureBeat y recogidos en el análisis de Memeburn.
- El harness se vuelve medible: Harness-Bench corrió el mismo modelo sobre las mismas 106 tareas en harnesses distintos y los puntajes variaron entre 52,4 y 76,2 — una dispersión de 23,8 puntos sin cambiar el modelo. En paralelo, OpenAI reportó que añadir solo razonamiento retenido y compactación triplicó la puntuación de GPT-5.6 Sol en ARC-AGI-3, de 13,3% a 38,3%.
- El RL entra al harness: el anuncio de codex-1 en mayo de 2025 decía que el modelo fue entrenado con reinforcement learning en tareas reales. Las dos curvas se unen.
- GPT-5.1-Codex-Max: descrito como "el primer modelo entrenado de forma nativa para operar a través de múltiples ventanas de contexto mediante compactación". El harness empieza a ser absorbido por los pesos del modelo.
- El borrado como métrica de progreso: Thariq Shihipar, de Anthropic, contó que el equipo eliminó 80% del system prompt de Claude Code tras absorber su funcionalidad en el modelo. La medida del ritmo evolutivo del harness es cuánto puedes borrar sin perder capacidad.
3. La era de la atención (2026 hacia adelante): el harness migra al otro lado del humano.
Si cada capacidad del harness termina absorbida por el modelo, ¿qué queda? Lo que no puede absorber el modelo: permisos, identidad, confianza, legibilidad. La absorción no termina el harness, lo invierte. El harness deja de ser la interfaz del modelo hacia la computadora y se convierte en la interfaz hacia el recurso verdaderamente escaso: la atención humana sincrónica.
Como dijo Ryan Lopopolo en el podcast Latent Space: "lo único fundamentalmente escaso es la atención humana sincrónica de mi equipo". Los tokens se volvieron abundantes y confiables; seguimos embotellados en la atención humana.
Por qué esto importa a tu startup
El modelo es la mitad del producto, pero solo el 1,6% del código. Si vendes producto agéntico, la pregunta no es qué modelo usas, es qué harness tienes. Tres decisiones concretas:
- Elige tu superficie de interacción con humanos. Cada vez más empresas de IA tendrán una attention-interface: una política que le dice al agente cuándo puede interrumpirte, cuándo debe seguir trabajando, qué decisiones puede tomar solo y cuáles requieren tu aprobación. Si construyes para empresas, vas a tener que exponer esa superficie. AGENTS.md fue para el código; la attention-interface es para ti.
- Diseña con la idea de que el harness será absorbido. El system prompt de Claude Code pasó de ser crítico a borrarse en 80%. Construye tu agente asumiendo que cada pieza del scaffold será eventualmente redundante. Diseña para la sustracción, no para la acumulación.
- Mide el progreso del harness por lo que puedes borrar. La métrica de madurez es cuánto código innecesario puedes eliminar sin perder capacidad. Si tu equipo está añadiendo complejidad cada trimestre sin borrar nada, vas en dirección contraria a la curva de la industria.
Qué está pasando ahora mismo en el ecosistema
El concepto dejó de ser teórico y se convirtió en producto:
- Microsoft Agent Framework alcanzó GA el 2 de abril de 2026 y llevó su Agent Harness a disponibilidad general, según InfoQ. Su principal ingeniero de software, Wes Steyn, lo resumió así: "un modelo por sí solo solo genera texto; para que llame herramientas y complete tareas multi-paso, lo envuelves en un runtime — ese runtime es el harness".
- TrueFoundry lanzó TrueForge el 19 de agosto de 2026, un harness open-source MIT que se posiciona como equivalente open-source de Claude Managed Agents. Publicó un benchmark reproducible sobre 14 tareas de DevRev's Enterprise-Bench con tres intentos por configuración: TrueForge salió ~30% más barato que Claude Managed Agents con Opus 4.8 y ~75% más barato con GLM-5.2. Forbes, que cubrió el lanzamiento, aclara que el resultado no equivale a un recorte del 50% en el costo operativo total.
- Meta entró a la carrera con Muse Code, potenciado por Muse Spark 1.2, con precios agresivos (US$1,25 / millón de tokens input, US$4,25 output en el tier estándar). Lo reportó Business Insider como respuesta directa a Claude Code y Codex.
- El negocio de Claude Code crece más rápido que el de Anthropic como un todo. Anthropic superó a OpenAI en ingresos trimestrales por primera vez en el segundo trimestre de 2026, con US$11.500M frente a US$6.700M, y el 80-85% de su mezcla de ingresos viene de uso empresarial por API, según Bloomberg. Claude Code aporta aproximadamente US$8.000M a esa cifra trimestral.
Hacia dónde va el mercado
El autor del análisis en Latent Space predice que en menos de un año, cada empresa que construya IA agéntica lanzará una superficie de política de atención humana, igual que todas lanzaron AGENTS.md. Esa superficie gobernará cuándo un agente puede interrumpir, cuándo debe seguir, qué decisiones toma solo y cuáles escala.
Para founders hispanohablantes, la oportunidad concreta está en construir la capa de atención: los productos que medien entre un agente que ya funciona y un humano que no puede estar disponible 24/7. Approvals queues, archivos de progreso de agentes de larga duración, políticas de interrupción y delegación — todo eso es terreno verde y muy poco competido todavía.
El modelo nació como cerebro en una cubeta. El harness le dio un cuerpo. El cuerpo empezó a disolverse dentro del cerebro. Lo que nos queda por construir es la interfaz hacia el único recurso verdaderamente escaso: la atención humana.
Fuentes
- The Evolution of the Agent Harness – Latent Space
- Microsoft Agent Framework Harness and Hosted Agents Reach General Availability – InfoQ
- TrueFoundry Bets Enterprises Will Own Their Agent Runtime – Forbes
- Kimi Code vs Claude Code 2026 – Memeburn
- Anthropic CEO Warns One Wrong Year Could Mean Bankruptcy – Memeburn
- Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent – Business Insider
- Anthropic's Q2 Revenue Overtook OpenAI for the First Time – Forkast
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













