DoGBench: ningún modelo supera 50% en documentación

DoGBench: el primer benchmark de documentación para agentes de IA — y por qué importa a tu startup

DoGBench es el primer benchmark de generación de documentación técnica orientado al usuario final, y sus primeros resultados son un golpe de realidad para quien esté pensando en delegar los docs a un agente de IA. De los 10 sistemas evaluados (7 modelos locales y 3 agentes cloud), el mejor resultado en la división verificada de 117 tareas alcanzó apenas 47,3 puntos sobre 100, y solo un agente cloud con restricciones de internet rozó el 54,8. Ningún modelo —entendido como configuración modelo + harness reproducible— pasó la barrera del 50%.

El benchmark fue presentado por Promptless, la startup detrás de un agente comercial de mantenimiento de documentación, junto con un paper firmado por Frances Liu, Manny Silva, Paige Calvert, Ayu Adiati y Sarah Sanders. Los datos y 735 trayectorias completas de agentes ya están publicadas en Hugging Face y el código en GitHub, lo que permite reproducir las pruebas con nuevos modelos.

¿Qué evalúa exactamente DoGBench?

La mayoría de benchmarks de IA miden si una máquina puede responder una pregunta o aprobar un examen. DoGBench mide algo más difícil: si un agente puede decidir, por sí solo, cuándo la documentación necesita un cambio, y luego producir un patch que un revisor humano experto apruebe.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Para ello, el equipo construyó 292 tareas a partir de proyectos open source reales: Helm, PostHog, Mautic y Doc Detective, entre otros. De esas 292:

  • 205 requieren un cambio en la documentación (crear, actualizar o eliminar contenido).
  • 87 requieren no tocarla (abstenerse, porque el cambio de código no afecta al usuario).

La evaluación principal usa una división estratificada y reservada de 117 tareas: 82 que exigen un patch y 35 que exigen abstención. Los autores publicaron 735 trayectorias completas de 7 agentes no-cloud para permitir reproducción.

Los resultados: por qué ningún agente pasó el 50%

La cifra clave del paper es esta: entre las 7 configuraciones modelo + harness evaluadas de forma reproducible, la puntuación combinada más alta fue 47,3 sobre 100, lograda por Qwen3.8 Max con OpenCode. El leaderboard añade tres sistemas cloud —entre ellos el agente comercial de Promptless— que llegaron hasta 54,8, pero los autores aclaran que no pudieron verificar de forma independiente que esos agentes no consultaran internet para “rellenar” lagunas, lo que deja una sombra de contaminación sobre los mejores resultados.

El sistema de puntuación es exigente por diseño. DoGBench reporta la decisión de actualizar y la calidad del patch por separado, y los combina con la media armónica: 2·D·N / (D+N). Eso significa que ser bueno solo en una dimensión no compensa a la otra: si el agente decide mal cuándo escribir, o escribe bien pero se equivoca al no tocar lo que no debe, el score cae.

Además, cualquier fallo crítico (criterio P0) cape la nota del patch en 60/100, sin importar cuántas otras cosas haya hecho bien. Sobre los 205 ítems que requieren documentación, la rúbrica contiene 3.273 criterios en total, de los cuales 798 son P0.

¿Dónde fallan los agentes? Lo que dice la auditoría

La auditoría más amplia, sobre 1.267 submissions, destapa patrones repetidos:

  • 45,5% tenía una “brecha de finalización de tarea”: le faltaba un prerrequisito, un paso del procedimiento, una verificación o un camino de recuperación.
  • 36,6% contenía inexactitudes técnicas.
  • 32,5% omitía parte del concepto central o información de referencia.
  • 6,1% fabricaba contenido: clases inexistentes, flags inventados, endpoints que no existen.

Los autores subrayan que las categorías se solapan, y que con agentes frontera las alucinaciones son cada vez más sutiles: en lugar de inventar, distorsionan funcionalidad real extendiendo su alcance, cambiando valores por defecto o presentando un comportamiento que solo aplica bajo condiciones específicas como si fuera universal.

El análisis de trayectorias muestra que los agentes suelen detenerse en la primera página plausible que encuentran para editar, sin seguir investigando para confirmar que esa es la página correcta o que están cubriendo todo el caso de uso.

La “P0-clean rate”: la cifra que más importa a un founder

El indicador más crudo de calidad es la P0-clean delivery rate: porcentaje de patches que pasan todos los criterios P0 sin fallo crítico. El mejor de los 7 agentes reproducibles logró 39,0%: GPT-5.6 Sol con Codex entregó un patch limpio en 32 de las 82 tareas held-out que requerían un cambio.

Dicho de otra forma: incluso el mejor agente disponible aprueba solo 4 de cada 10 docs que “debería” escribir si tuvieras que confiar ciegamente en él.

¿Qué significa esto para tu startup?

Si vendes un producto técnico con SDK, API o una capa de configuración medianamente compleja, delegar tus docs a un agente sin revisión humana sigue siendo una apuesta perdedora en 2026. DoGBench lo demuestra con datos: los agentes producen texto pulido, pero omiten prerrequisitos, distorsionan defaults y, en el 6,1% de los casos, fabrican contenido.

Las herramientas comerciales como Promptless, Mintlify o DeepWiki prometen reducir el trabajo manual de mantener docs al día, y en proyectos open source la mejora de velocidad es real: el caso publicado por Mautic en su blog cuenta que, tras integrar a Promptless, pasaron de 392 PRs de docs mergeadas por humanos en más de 4 años a 129 PRs mergeadas en 4 meses, y redujeron el tiempo medio de code-merge a docs-merge de 98 a 27 días. El propio equipo de Mautic, sin embargo, mantiene revisión humana del Education Team en cada draft y documenta casos concretos en los que el agente describió botones inexistentes o duplicó secciones innecesarias.

Acciones concretas que puedes tomar esta semana:

  • No publiques docs de agente sin un checklist de lector-completa. Antes de mergear, pregúntate: ¿puede un usuario nuevo encontrar esta página? ¿Puede completar el procedimiento? ¿Puede verificar el resultado? Si la respuesta a cualquiera es “no”, no es un patch P0-clean, aunque se lea bien.
  • Mide tu P0-clean rate internamente. Toma 20 PRs recientes generadas con ayuda de IA, pide a un revisor senior que las evalúe contra tu propia rúbrica, y compara. Si no llegas al 40%, tu taxonomía de criterios necesita más granularidad antes de confiar más en el agente.
  • Usa DoGBench como benchmark público antes de elegir vendor. Pide a los candidatos (Promptless, Mintlify, GitHub Copilot for Docs, etc.) que reporten su score en el split held-out de 117 tareas. Si no pueden o no quieren, desconfía.

Conclusión

DoGBench no dice que los agentes de IA sean inútiles para documentación: dice que están lejos del estándar que tu equipo necesita para dormir tranquilo. El 47,3 del mejor modelo reproducible, el 39,0% de P0-clean y el 6,1% de fabricaciones explícitas dibujan una frontera clara: el agente puede ser un buen primer borrador, pero la rúbrica, la revisión y el criterio final siguen siendo trabajo humano. Para una startup, eso se traduce en una regla operativa simple: automatiza la velocidad, no la confianza.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...