IBM Research presenta ALTK-Evolve: la misma precisión que ACE con 60% menos tokens
ALTK-Evolve, el sistema de memoria de agentes de IBM Research, logra igual o mejor precisión que ACE (Agentic Context Engineering) con una reducción de tokens que alcanza hasta el 60%. En pruebas con DeepSeek-V3.2, ALTK-Evolve alcanzó 89.3% de Task Goal Completion frente al 80.4% de ACE, usando solo 263K tokens por tarea comparado con los 634K de su competidor. Para un founder que despliega agentes IA a escala, esto significa costos de inferencia drásticamente menores sin sacrificar calidad.
Ambos sistemas abordan el mismo problema fundamental: cómo convertir las trayectorias pasadas de un agente en lecciones reutilizables sin actualizar pesos del modelo. Donde difieren es en la entrega: ACE inyecta el playbook completo en cada paso, mientras que ALTK-Evolve envía solo las directrices que el modelo puede usar efectivamente, ajustando la cantidad según la capacidad del modelo.
¿Qué significa esto para tu startup?
Si estás implementando agentes IA en tu producto o procesos internos, la optimización de tokens no es solo un detalle técnico: es un factor de costo directo. Cada token adicional en el contexto se traduce en mayor latencia y gasto en API. Según los datos de IBM Research, ALTK-Evolve reduce el consumo de tokens en un 58.5% con DeepSeek-V3.2 y un 85.1% con gpt-oss-120b, manteniendo o mejorando la precisión.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadDos acciones concretas que puedes implementar hoy:
Evalúa la arquitectura de memoria de tus agentes: Si estás usando enfoques que inyectan contexto completo en cada paso, considera sistemas de recuperación selectiva como ALTK-Evolve. La diferencia no es solo en tokens: en tareas difíciles, la selección per-task de ALTK-Evolve superó a ACE en un 31.8% frente a 23.8% con gpt-oss-120b, demostrando que menos contexto a veces es más efectivo cuando está bien seleccionado.
Implementa métricas de costo por tarea: Más allá de la precisión, mide cuántos tokens consume cada ejecución de tu agente. Según el paper de ACE publicado en arXiv en 2025, los sistemas que optimizan la entrega de contexto pueden reducir significativamente la latencia de adaptación y el costo de rollout. Establece un baseline y compara alternativas no solo por accuracy sino por eficiencia operativa.
La diferencia clave: entrega calibrada vs. fija
La investigación de IBM Research identifica dos puntos críticos donde ALTK-Evolve diverge de ACE: cómo se construye la memoria y cómo se entrega. Mientras ACE crece un playbook único a través de un ciclo Generator → Reflector → Curator, ALTK-Evolve agrupa lecciones similares y las fusiona conservando el conteo de soporte, creando directrices tipificadas con atribución causal.
Pero la diferencia que impacta directamente en tus costos es la entrega. ACE envía el playbook completo en cada paso, independientemente del modelo o tarea. ALTK-Evolve, en cambio, calibra la entrega: un núcleo fijo de directrices de alto soporte, extendido por tarea con un puñado seleccionado específicamente, o el conjunto completo consolidado cuando el modelo tiene capacidad para usarlo.
Resultados que importan para tu negocio
En el benchmark AppWorld con 168 tareas, los números hablan por sí solos:
- DeepSeek-V3.2: ALTK-Evolve logró 89.3% TGC con 263K tokens vs. 80.4% TGC de ACE con 634K tokens
- gpt-oss-120b: ALTK-Evolve alcanzó 56.0% TGC con 116K tokens vs. 54.8% TGC de ACE con 777K tokens
La eficiencia de ACE, según su propio paper de 2025, está en la construcción barata de contexto. La de ALTK-Evolve está en el servicio eficiente: recuperar unas pocas directrices por tarea en lugar de inyectar el playbook completo en cada paso.
Cómo aprovechar esta tecnología en tu stack
ALTK-Evolve está disponible como biblioteca open source con múltiples opciones de integración:
- Modo sin código con Claude Code, Codex e IBM Bob
- Bajo código con agentes ReAct existentes
- Pro código con integración directa en CUGA via MCP
La clave para founders es que no necesitas reescribir tu stack completo. Según la documentación de IBM Research, puedes agregar una sola importación y activar un flag para emitir trazas a una UI como Arize Phoenix, generando directrices de mejora sin cambiar tu infraestructura actual.
El futuro de los agentes eficientes
La tendencia hacia agentes más eficientes en tokens no es solo un ejercicio académico. Con los costos de inferencia siendo una barrera significativa para escalar aplicaciones de IA, sistemas como ALTK-Evolve representan el tipo de innovación que separa a las startups que pueden operar de manera sostenible de aquellas que enfrentan facturas de API insostenibles.
La lección para founders es clara: al evaluar tecnologías de agentes, considera tanto la eficiencia operativa como la precisión. Un agente que es un 10% más preciso pero consume el doble de tokens podría terminar siendo más caro en producción que una alternativa más eficiente.
Fuentes
- Thinking of ACE? We Can Do It with Fewer Tokens
- Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
- ALTK‑Evolve: On‑the‑Job Learning for AI Agents
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













