Qué es un agent harness y por qué a AWS le conviene lanzar uno
Un agent harness es la capa de orquestación que rodea al modelo: el bucle de ejecución, las herramientas, la gestión de contexto, la memoria entre sesiones y la recuperación ante desbordes. Los creadores de Strands harness, el equipo de Strands Agents en AWS, explican que muchos builders ya tenían un agente funcionando dentro de Claude Code o Codex en su portátil y, al intentar reconstruirlo desde cero para producción, perdían esa sensación de "simplemente funciona".
El nuevo Strands harness viene empaquetado bajo licencia Apache 2.0, se inicializa con una línea de código en Python o TypeScript, y está pensado como agente de uso general, no como coding agent. Soporta modelos de Amazon Bedrock, Anthropic, OpenAI y Google, además de ejecución local vía Ollama o LiteLLM.
Los números del lanzamiento: 28% menos de coste, 77% menos en el caso más favorable
La promesa central del equipo es que Strands harness cuesta 28% menos con los mismos modelos Claude o GPT en seis benchmarks (ALFWorld, ContextBench, GAIA, WebShop, τ²-bench y Terminal-Bench 2.1), manteniendo precisión igual o superior. La evaluación se ejecutó en modo distribuido sobre Amazon EC2 con Harbor, el framework de los creadores de Terminal-Bench.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLa cara-opus más concreta está en Claude Fable 5 sobre Terminal-Bench 2.1 (89 trials por harness), según reporta Marktechpost:
- Strands harness: 56,29 USD de coste, 69,7 de accuracy
- oh-my-pi: 86,83 USD, 69,7
- OpenCode: 73,42 USD, 66,3
- Claude Code: 248,05 USD, 61,8
- DeepSeek Harness: 40,30 USD, 59,5
Frente a Claude Code, eso es 77% menos de coste y 7,9 puntos más de accuracy. Como matiza el propio equipo, DeepSeek Harness fue el más eficiente en tokens (cerca de 14% más barato) pero obtuvo la accuracy más baja. El promedio de 28% sale exactamente de incluir ese competidor en el cálculo, así que la cifra no es magia de marketing: es la media real con todo el campo.
Este patrón coincide con el estudio independiente HarnessTax, que comparó Claude Code, Codex CLI y Pi en 7 modelos y encontró que el harness apenas movió las tasas de éxito, pero que el mismo modelo podía costar hasta 5 veces más según el envoltorio elegido.
La ingeniería detrás del ahorro: tres reglas de contexto
Strands harness llega con defaults de prompt caching y gestión de contexto ya incorporados. El equipo atribuye la mayoría del ahorro a tres reglas concretas que vienen activadas por defecto:
- Truncado de herramientas: resultados de tools por encima de unos 1.500 tokens se acortan.
- Compactación al 85%: cuando el contexto pasa ese umbral, se dispara una summarization.
- Recuperación dentro del bucle: si la ventana se desborda, el recovery se ejecuta sin salir del loop en marcha.
El resto del paquete trae, sin configuración extra: read/write/edit, shell, web tools que el modelo ya sabe usar, memoria persistente entre runs (reanudar por session ID), delegación a un helper agent para subtareas abiertas con checklist, soporte para cargar "Agent Skills" cuando existan y conexión con servidores MCP.
Cómo se usa en la práctica
Instalación:
- Python:
pip install strands-harness - TypeScript:
npm install @strands-agents/harness - CLI interactiva:
npm install -g @strands-agents/cli
Primer agente en una línea:
from strands_harness import create_harness
agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("Research the top three vector databases and compare their pricing")
El equipo de Strands también construyó sobre su propio harness la Strands CLI, una interfaz en lenguaje natural para prototipar agentes sin código. Una vez que el agente hace lo que querías, /export devuelve el código en Python o TypeScript listo para iterar con el coding agent de preferencia. La propia CLI está construida encima de Strands harness, lo que cierra el círculo: el equipo dogfoodea su producto.
El despliegue es agnóstico del proveedor mientras haya un contenedor Linux: Amazon ECS, Google Cloud Run, Azure Container Apps, Cloudflare Containers, Modal y Amazon Bedrock AgentCore aparecen como destinos oficialmente compatibles, según SiliconANGLE.
Qué significa esto para tu startup
Si ya pagas por Claude Code y Codex, mira las cifras antes de renovar. En el test de Fable 5 sobre Terminal-Bench 2.1, Claude Code costó 248,05 USD contra los 56,29 USD de Strands harness con el mismo modelo y mejor score. Para una startup que ejecuta agentes en producción, esa diferencia de casi 4x no es marginal: puede ser la diferencia entre quemar runway o sostener margen en el siguiente trimestre.
Tres acciones concretas que puedes tomar esta semana:
- Audita el coste real de tu harness actual. Si dependes de Claude Code o Codex para flujos críticos, replica al menos uno de los seis benchmarks sobre tu workload real y mide el coste por tarea. La decisión de cambiar de harness se defiende con números propios, no con benchmarks genéricos.
- Prototipa el siguiente agente en Strands harness antes que en Claude Code. La función
create_harness()con un model string te lleva a un agente real con memoria, herramientas y manejo de contexto en minutos. Si validas la idea,/exportte da el código para llevarlo a producción en cualquier nube. - Centraliza tus reglas en AGENTS.md. Como mostró el hilo sobre Claude Code 2.1.277, mover las instrucciones del repo a un AGENTS.md compartido permite que múltiples agentes lean las mismas reglas sin reescribirlas. Aprovecha la portabilidad que ofrece un harness agnóstico al modelo.
¿Dónde está el límite? El benchmark está hecho por el propio equipo de Strands y, aunque citan el estudio independiente HarnessTax, los anunciantes siempre tienen incentivo a presentar sus propios números. El equipo promete un paper de seguimiento, así que toca esperar esos datos antes de mover cargas críticas sin un piloto interno detrás.
Conclusión
Strands harness es la apuesta de AWS por posicionarse en la nueva capa del stack de IA: la infraestructura alrededor del modelo. Para un founder, el titular real no es "28% más barato", sino "puedo moverme de un agente a otro sin reescribir mi orquestación". En un mundo donde los modelos cambian cada trimestre, esa portabilidad es posiblemente más valiosa que el ahorro en tokens.
Fuentes
- Introducing Strands Harness (fuente original)
- AWS debuts Strands Harness - SiliconANGLE
- AWS Open-Sources Strands Harness - Open Source For U
- AWS Strands Agents Team Releases Strands Harness - Marktechpost
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














