IBM Research descubrió que la memoria de los agentes IA no es un interruptor que se enciende, sino una dosis que debe calibrarse al modelo. En su estudio publicado el 18 de agosto de 2026, evaluaron ocho modelos —desde uno denso de 30B hasta sistemas propietarios de frontera— y encontraron que dar más contexto no siempre mejora el rendimiento: depende del tier del modelo.

El hallazgo tiene implicancias directas para cualquier founder que construya o despliegue agentes IA en producción: la estrategia de memoria correcta puede mejorar la precisión en +16 puntos porcentuales sin inflar el costo, mientras que la estrategia incorrecta puede aumentar los tokens consumidos un 78% con ganancias menores.

¿Cómo funciona la memoria de agentes según ALTK-Evolve?

ALTK-Evolve es un sistema de aprendizaje continuo desarrollado por IBM Research como parte del Agent Lifecycle Toolkit (ALTK), lanzado en marzo de 2026. A diferencia de enfoques tradicionales que simplemente reinyectan transcripciones pasadas en el prompt —lo que hace que el agente «relea» historia sin aprender—, este sistema convierte las experiencias del agente en guías accionables que se inyectan solo cuando son relevantes.

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

El ciclo opera en tres pasos:

  • El agente ejecuta tareas y produce trazas completas (llamadas a herramientas, decisiones, resultados).
  • Un proceso automático extrae patrones estructurales de éxito y fracaso, consolidándolos en un conjunto de guías reutilizables.
  • En tiempo de inferencia, se inyectan solo las guías relevantes al contexto actual —sin actualizar pesos del modelo.

Según un estudio de MIT citado en el artículo original, el 95% de los pilotos de GenAI fallan porque las empresas evitan la fricción operativa: los agentes no se adaptan ni aprenden sobre la marcha. ALTK-Evolve aborda precisamente esta brecha.

Los tres patrones que determinan cuánto necesita tu agente

IBM evaluó los modelos en AppWorld, un benchmark riguroso con 585 tareas multi-paso que simulan interacciones reales con calendarios, mensajería, pagos y otras aplicaciones. Cada tarea se mide con dos métricas: TGC (Task Goal Completion — ¿completó la tarea?) y SGC (Scenario Goal Completion — ¿completó TODAS las variantes del escenario, incluyendo edge cases?).

Los resultados revelaron tres patrones claros:

Modelo fuerte con margen de mejora → necesita el set completo

Modelos como DeepSeek-V3.2 (671B MoE) y Claude Opus 4.6 obtuvieron sus mejores resultados con el set completo de guías. DeepSeek escaló +9.5 puntos porcentuales en TGC y +16.1pp en SGC. Lo interesante: incluso modelos cerca del techo como GPT-5.5 siguieron ganando +7.2pp en SGC, demostrando que la memoria sigue pagando mientras exista un modo de fallo restante.

Modelo débil o mediano → necesita selección curada

Aquí está el hallazgo más valioso para startups con presupuestos limitados: gpt-oss-120b (117B MoE) logró +16.1pp en TGC usando solo un núcleo compacto de guías de alta confianza más algunas recuperadas por tarea. La clave: la recuperación curada fue simultáneamente la opción más precisa Y la más barata —solo +5% de tokens adicionales vs. baseline.

Modelo saturado → no gana nada

GLM-5 (745B MoE) mostró 0.0pp de mejora en ambas métricas. IBM etiqueta esto como patrón saturado: el modelo ya estaba cerca de su techo en estas tareas específicas, o las guías no abordaban sus modos de fallo restantes. Hasta que no se entienda qué le falta, añadir contexto es gasto innecesario.

Modelo Patrón Mejora TGC Mejora SGC Configuración óptima
gpt-oss-120b Débil/selectivo +16.1pp +16.1pp Recuperación curada
DeepSeek-V3.2 Fuerte con margen +9.5pp +16.1pp Set completo
Claude Opus 4.6 Fuerte con margen +4.1pp +7.1pp Set completo
GPT-5.5 Fuerte (cerca del techo) +2.9pp +7.2pp Set completo
GLM-5 Saturado 0.0pp 0.0pp Sin mejora

Fuente: IBM Research, agosto 2026

El costo real de la memoria: por qué la opción más barata puede ser la mejor

Inyectar un set completo de guías infla cada paso del reasoning loop del agente, porque las guías se reenvían en cada turno. IBM reportó estos números:

  • DeepSeek-V3.2 con set completo: de 148K a 263K tokens/task (+78%)
  • gpt-oss-120b con set completo: de 110K a 166K tokens/task (+51%)
  • gpt-oss-120b con recuperación curada: de 110K a 116K tokens/task (+5%)

IBM destaca que en producción, el verdadero palanca de eficiencia es el prompt caching: la porción estática del set de guías es idéntica en cada paso y puede almacenarse en caché, reduciendo drásticamente el costo efectivo. Mantener el prefijo del set de guías estable es algo que vale la pena diseñar desde el inicio.

Qué significa esto para tu startup

Si estás construyendo o escalando agentes IA, este estudio te da tres decisiones concretas:

1. No uses la misma estrategia de memoria para todos tus modelos. Si trabajas con múltiples LLMs (por ejemplo, uno para tareas simples y otro para complejas), cada uno necesita una dosis diferente. Para modelos medianos o débiles, prioriza la recuperación curada: obtendrás el mayor ROI en precisión por token gastado. Para modelos de frontera con margen de mejora, el set completo justifica el costo adicional.

2. Diseña tu arquitectura pensando en prompt caching desde el día uno. Si vas a inyectar guías o contextos estáticos en cada paso del reasoning loop, asegúrate de que el prefijo sea consistente entre llamadas. Esto no es un detalle técnico menor: puede reducir el costo operativo de producción significativamente.

3. Mide SGC, no solo TGC. La métrica Scenario Goal Completion —que exige que el agente acierte en TODAS las variantes de un escenario— revela problemas de confiabilidad que TGC oculta. Si tu agente completa tareas pero falla en edge cases, tu cliente igual va a cancelar. Las guías de ALTK-Evolve muestran mejoras particularmente fuertes en SGC, lo que indica que ayudan a resolver inconsistencias, no solo casos promedio.

Próximos pasos

IBM Research ya trabaja en mejoras: un selector aprendido (actualmente usan similitud coseno, que no predice perfectamente qué guías ayudan a cada tarea), soporte para modelos muy débiles donde la auto-distilación carece de señal, y validación en benchmarks más amplios. El código está disponible en GitHub bajo el nombre ALTK-Evolve, con integraciones para Claude Code, Codex y otros frameworks.

La conclusión central es clara: darle todo lo que tu agente ha aprendido no es la respuesta. Darle la cantidad exacta que puede usar, sí. Y eso requiere calibración, no acumulación.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...