Qué es WikiSkill y por qué importa para los AI agents
Google Research y Virginia Tech presentaron WikiSkill, un framework que añade una capa de conocimiento organizado entre la experiencia cruda de un agente y las skills que termina usando. La idea central: cuando un agente auto-mejora sus skills a partir de ejecuciones previas, normalmente descarta el diagnóstico que le permitió identificar un error. Vuelve a tropezar con el mismo fallo una y otra vez y reintenta parches que ya habían sido rechazados.
El paper, disponible en arXiv, fue co-escrito por Liyan Tang, research scientist de Google, junto al equipo de Virginia Tech. El enfoque se inspira explícitamente en el patrón de LLM Wiki que Andrej Karpathy propuso en abril de 2026: raw sources inmutables, una wiki mantenida por un agente LLM y un esquema que define las convenciones de mantenimiento.
La diferencia clave es el output. Karpathy imaginó una wiki de notas personales. WikiSkill apunta a generar un archivo SKILL.md ejecutable, instrucciones de procedimiento que el agente puede invocar en producción.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadCómo funciona WikiSkill: tres capas y cuatro pasos
El framework divide el espacio de trabajo del agente en tres capas:
- Raw Layer: trazas de ejecución inmutables, con acciones, razonamiento, llamadas a herramientas y respuestas. Es el registro histórico de lo que el agente realmente hizo, sin modificar.
- Wiki Layer: conocimiento estructurado extraído de esas trazas. Contiene páginas por cada modo de fallo recurrente y estrategia exitosa, un log de evolución y un tracker del impacto de cada skill propuesta.
- Skill Layer: las instrucciones de procedimiento que el agente consume durante la ejecución. Cada skill apunta de vuelta a los patrones de la wiki que motivaron su creación o modificación.
Cada ciclo de evolución tiene cuatro pasos. Primero, un Inference Agent corre tareas de entrenamiento con las skills actuales y genera nuevas trazas. Después, un Wiki Maintainer analiza una muestra de trayectorias exitosas y fallidas y actualiza la wiki. Luego, un Skill Proposer lee la wiki actualizada y propone una nueva skill o ediciones. Por último, el cambio se valida contra un set independiente y se acepta solo si mejora el mejor score de validación registrado.
El paper incluye un caso ilustrativo con ALFWorld, un entorno simulado de manipulación de objetos. En la primera iteración, el sistema detectó que el agente recogía, examinaba y devolvía objetos a su lugar de origen. El Skill Proposer generó una skill genérica de "acción dirigida a objetivo", que fue rechazada en validación. La wiki conservó tanto el comportamiento observado como la propuesta rechazada. En la siguiente iteración, el proposer creó una regla concreta: "Never Return an Item to Its Origin Location". Esa pasó la validación y mejoró el rendimiento. Cuando surgieron otros patrones de loop más adelante, el sistema refinó la misma skill en lugar de empezar de cero.
Resultados: 3,3 a 12 puntos por encima de la competencia
Los investigadores evaluaron WikiSkill en cinco benchmarks que cubren razonamiento matemático, búsqueda web, hojas de cálculo, preguntas sobre documentos de contexto largo y tareas interactivas en hogares. Probaron modelos de las familias Qwen, Gemma y Gemini, comparando con Trace2Skill (de Qwen), EvoSkill (de Sentient) y SkillOpt (de Microsoft), además de un baseline sin skills.
Los resultados, según reporta VentureBeat citando el paper:
- WikiSkill obtuvo el score promedio más alto en todos los modelos probados, con una ventaja de entre 3,3 y 12 puntos porcentuales sobre el mejor método competidor para cada modelo.
- Las ganancias crecieron con el tamaño del modelo dentro de la familia Qwen: +12,3, +17,5 y +23,9 puntos frente al baseline sin skills, con versiones de 4B, 9B y 27B parámetros respectivamente.
- Las skills se transfirieron entre modelos: Qwen-3.5-9B alcanzó 70,2% en ALFWorld usando una skill evolucionada por Qwen-3.6-27B, frente a 63,4% con su propia skill evolucionada.
- Un modelo más pequeño con skills igualó a uno más grande sin ellas: Qwen-3.5-9B con WikiSkill llegó a 47,4% de accuracy promedio, frente a 39,4% de Qwen-3.6-27B sin skills.
La separación entre la wiki y el skill ejecutable es, además, una decisión de coste de inferencia. La wiki es exhaustiva (la "memoria" completa del sistema), el prompt de producción es compacto. Mantener la wiki fuera del contexto del Inference Agent permite que producción pague solo por skills de 45 a 129 líneas, según los runs del paper.
El ablation confirma esa elección: el setup por defecto, con la wiki disponible para el Skill Proposer pero no para el Inference Agent, promedió 63,7% en pruebas con Gemini-3.5-Flash sobre cuatro benchmarks. Sin acceso a la wiki, el score cayó a 48,7%. Y, contra toda intuición, darle también acceso a la wiki al Inference Agent lo bajó a 60,9%. Los autores explican que, si el agente de inferencia puede resolver las tareas de entrenamiento directamente desde la wiki, sus trayectorias revelan menos sobre las debilidades reales de las skills.
Qué significa esto para tu startup
Si ya operas AI agents en producción, la pregunta inmediata es si estás registrando las trazas completas de ejecución. Sin trazas, no hay wiki posible. La mayoría de frameworks agentic actuales (incluido el Gemini Enterprise Agent Platform de Google, lanzado en abril de 2026 en Las Vegas según TechTimes) ya ofrece observabilidad nativa, pero pocas veces se usan esos logs como insumo para generar conocimiento estructurado.
Dos acciones concretas esta semana:
- Instrumenta el ciclo de feedback de tus agentes hoy. Cada traza de ejecución es un activo. Si tu framework agentic (ADK 2.0, LangGraph, CrewAI, Autogen) ya exporta trazas a OpenTelemetry o a un data lake, diseña un job batch que clasifique cada traza como exitosa o fallida y alimente una estructura de wiki con patrones recurrentes. No necesitas WikiSkill para empezar: el patrón es lo que importa.
- Separa el conocimiento de la skill ejecutable. Trata la wiki como memoria de largo plazo, editable, que crece. Trata cada skill como un módulo procedural, versionado, con criterios de aceptación claros. Mezclar ambas cosas en un solo prompt gigante es exactamente lo que WikiSkill busca evitar: cuando el prompt crece, el coste por inferencia crece y la señal útil se diluye.
El paper deja abiertas tres preguntas que, como founder, deberías tener en tu radar: WikiSkill no testea retrieval de skills cuando la librería crece, no incluye pruning automático de la wiki, y su validation gate rechaza cambios que no produzcan mejora inmediata aunque habiliten ganancias futuras. Son problemas abiertos de la arquitectura, no fallos corregibles mañana.
Conclusión
WikiSkill es la primera implementación publicada que toma la idea de LLM Wiki de Karpathy y la aplica a un problema concreto de AI agents: la amnesia que sufren al evolucionar skills. Los números son sólidos (3,3-12pp sobre los tres frameworks competidores más maduros) y el patrón arquitectónico, separar trazas inmutables, wiki estructurada y skills ejecutables, es replicable sin usar el framework de Google. Para founders construyendo sobre agentes en producción, la lección de fondo es: tu memoria de fallos vale más que tu prompt. Si no la estás acumulando, la estás pagando dos veces cada vez que el agente repite un error.
Fuentes
- Google's WikiSkill gives AI agents a memory of what went wrong — without putting it in the prompt
- LLM Wiki - GitHub Gist (Andrej Karpathy)
- Gemini Enterprise Agent Platform Leads Enterprise AI Governance as OpenAI Starts Billing for Agents
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













