WikiSkill: Google dota a los agentes de IA de memoria persistente

Por qué los agentes de IA olvidan todo entre tarea y tarea

Un agente de IA que hoy ejecuta un flujo de cinco pasos en tu CRM mañana empieza desde cero. Esa amnesia recurrente es uno de los cuellos de botella menos discutidos pero más caros para cualquier founder que dependa de automatización: cada nueva ejecución paga de nuevo el coste de los errores ya aprendidos. Investigadores de Google Research acaban de presentar WikiSkill, un marco de trabajo diseñado precisamente para romper ese ciclo, y los resultados publicados son los más altos que se han visto en benchmarks multi-tarea para agentes con memoria externa.

En promedio, Gemini 3.5 Flash pasó de 49,5% a 68,1% y Qwen-3.6-27B de 39,4% a 63,3% cuando se les equipó con WikiSkill, según la investigación original recogida por DiarioBitcoin. La métrica corresponde al promedio de cinco benchmarks y se calculó sobre tres ejecuciones independientes.

Qué es WikiSkill y qué problema resuelve

WikiSkill no modifica los parámetros del modelo. Lo que hace es construir una memoria externa estructurada en forma de wiki que el agente consulta antes de cada nueva ejecución para generar instrucciones más precisas sobre sí mismo. La idea parte de una observación atribuida a Andrej Karpathy sobre crear "una especie de wiki" donde la experiencia del modelo se acumule en lugar de evaporarse al cerrar la sesión.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El matiz importa: no es aprendizaje continuo en sentido estricto. El modelo conserva su entrenamiento original; lo que evoluciona son las instrucciones operativas que se entregan al agente en cada corrida. La solución es menos elegante que un fine-tuning permanente, pero evita reentrenar y permite probar cambios de comportamiento de forma reversible.

Las tres capas que separan experiencia, interpretación y acción

El diseño se organiza en tres niveles que cumplen funciones distintas:

  • Raw Layer: conserva las trazas completas de cada ejecución — llamadas a herramientas, respuestas obtenidas, pasos seguidos. Son registros inmutables que sirven como materia prima de auditoría.
  • Wiki Layer: transforma esas trazas en conclusiones estructuradas, como patrones de fallo, recomendaciones operativas y estrategias que funcionaron. Esta capa no se reinicia después de una tarea: crece con cada iteración.
  • Skill Layer: contiene las instrucciones procedimentales que el agente usa durante la ejecución. Es la parte modificable del sistema.

El ciclo opera así: cuando un agente de inferencia termina una tarea, un Wiki Maintainer revisa los registros para identificar qué falló y qué decisiones ayudaron, y un Skill Proposer usa esa lectura para sugerir cambios en las instrucciones activas. Antes de aplicar cualquier modificación, un mecanismo de gating la prueba en un conjunto independiente de tareas; si funciona, se incorpora; si no, se revierte sin borrar la propuesta fallida, que queda registrada para análisis posterior.

En qué tareas mejora — y en cuáles no tanto

El estudio se evaluó en cinco dominios: razonamiento matemático (LiveMath), búsqueda web, manipulación de hojas de cálculo (SpreadSheet), preguntas sobre documentos (OfficeQA) y tareas interactivas en un entorno virtual. Los modelos probados fueron variantes de Qwen de 4.000, 9.000 y 27.000 millones de parámetros, además de Gemma-4-31B y Gemini-3.5-Flash.

Las ganancias más fuertes aparecieron en LiveMath y SpreadSheet. Gemini-3.5-Flash saltó de 33,0% a 72,6% en LiveMath y de 50,5% a 76,6% en SpreadSheet. Qwen-3.6-27B pasó de 33,9% a 61,9% en LiveMath y de 40,8% a 81,7% en SpreadSheet.

En OfficeQA, en cambio, el avance fue más modesto: Gemini-3.5-Flash subió de 48,6% a 60,7%, una mejora relevante pero claramente inferior a la observada en las tareas matemáticas y de hojas de cálculo. La razón probable es que OfficeQA exige manejar contextos largos y responder sobre documentos, donde la habilidad acumulable aporta menos.

Tamaño del modelo y transferencia de habilidades

Los investigadores hallaron dos resultados prácticos para founders:

  1. Los modelos grandes aprovechan mejor las instrucciones evolucionadas. Qwen-3.5-4B tuvo dificultades para sostener estrategias de varios pasos en contextos extensos y solía regresar a su comportamiento predeterminado.
  2. Un modelo pequeño con WikiSkill puede igualar a un modelo mayor sin WikiSkill. Esto abre una vía concreta para extraer más valor de modelos de menor tamaño y menor coste.

También observaron que las habilidades creadas por un modelo pueden transferirse a otro y, en algunos casos, funcionar mejor que las instrucciones que el modelo receptor habría desarrollado por sí solo. El artículo original advierte que esto no garantiza universalidad: una instrucción calibrada para un modelo grande puede no funcionar en uno pequeño, por lo que cada habilidad debe validarse en el entorno objetivo.

Dónde encaja WikiSkill en el ecosistema actual

La propuesta llega en un momento en que toda la industria está reconociendo que la memoria persistente es el cuello de botella de los agentes. InfoQ reportó en agosto de 2026 el lanzamiento de Grok Bot por parte de SpaceXAI, un sistema de agentes persistentes con su propio entorno de cómputo y memoria de flujos de trabajo, capaz de observar una tarea realizada por un humano y guardar el procedimiento para repetirlo después. La propia nota destaca que el producto se apoya en tres de los mismos pilares conceptuales de WikiSkill —agentes persistentes, memoria de workflows y coordinación multi-agente— aunque con foco en interfaces de aplicaciones generales.

En el plano de la investigación abierta, Ars Technica documentó en junio de 2026 el framework ENPIRE del laboratorio Nvidia GEAR junto a Carnegie Mellon y UC Berkeley, que ya utiliza coding agents con memoria, bucles de retroalimentación y verificación para entrenar robots de manera autónoma durante la noche. Jim Fan, director de IA en Nvidia, describió el sistema así: "Una parte de nuestro laboratorio GEAR ahora se mejora sola durante la noche. Nosotros solo leemos los reportes por la mañana."

Para los founders, estas tres señales apuntan en la misma dirección: el diferenciador de los próximos dieciocho meses no será el modelo base, sino el sistema de memoria, validación y reuso de instrucciones que lo envuelve. Analytics Insight lo conceptualiza como Loop Engineering: diseñar bucles de objetivo-acción-observación-verificación-ajuste que obliguen al agente a justificarse y corregirse.

Qué significa esto para tu startup

Si tu equipo está construyendo o integrando agentes, WikiSkill te deja tres lecciones accionables hoy mismo:

  • Instrumenta cada ejecución como si fuera un experimento. Aunque no adoptes WikiSkill, guardar trazas crudas (herramientas llamadas, respuestas, errores) es la materia prima sin la cual ningún sistema de memoria puede funcionar. Empieza con un log estructurado en JSON por tarea y versiona cada cambio de prompt.
  • Separa la observación de la acción. Un bucle tipo Wiki Maintainer + Skill Proposer + gating puede implementarse con tres prompts separados y un evaluador automático sobre un golden set pequeño. Es la palanca para detectar cuándo una nueva versión de prompt rompe tareas que antes funcionaban.
  • Piensa en transferencia, no solo en rendimiento local. Un repositorio compartido de habilidades validadas entre modelos reduce el coste de experimentar con proveedores distintos. La idea es barata: una carpeta por dominio con instrucciones en Markdown y resultados de evaluación.

El aviso del paper es importante: memoria persistente no equivale a aprendizaje continuo. Una mala conclusión incorporada a la wiki puede contaminar ejecuciones futuras. Diseña siempre una ruta de reversión y mantén las trazas originales inmutables para poder auditar cualquier comportamiento sospechoso del agente.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...