Qué encontró el estudio de Harvard sobre los agentes de IA
Tras adoptar agentes de codificación con IA, las empresas generaron en promedio 30% más líneas de código, 20% más commits y 23% más solicitudes de cambio. Pero la tasa de resolución de tareas registradas en herramientas como Jira no cambió de forma estadísticamente significativa. Más actividad, mismo software terminado.
El hallazgo viene de un estudio preliminar de Fiona Chen y James Stratton, investigadores de la Universidad de Harvard, que analizó datos agregados de Jellyfish, una plataforma que mide la actividad de equipos de ingeniería. Según la información difundida, el trabajo cubre a 100.000 ingenieros en 500 empresas y abarca el período desde 2021 hasta marzo de 2026.
Para determinar cuándo cada organización incorporó herramientas de IA, los autores combinaron mediciones directas de uso con análisis de actividad en GitHub. Distinguieron entre asistentes de codificación —que apoyan la escritura humana— y agentes capaces de producir y enviar código de forma más autónoma a partir de instrucciones. Luego aplicaron un análisis de diferencias en diferencias para estimar los cambios asociados a esa adopción.
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 díasLa advertencia metodológica es importante: los propios autores señalan que los resultados deben leerse como asociaciones observadas en los datos, no como prueba de que la IA explique por sí sola cada variación. Es un estudio de transición, no un veredicto final.
Más código no es más software: dónde se atasca el proceso
El contraste más fuerte apareció en la etapa posterior a la escritura. El tiempo promedio entre el envío de una solicitud de cambio y su integración en la base de código aumentó 49% tras la introducción de agentes de IA. Los autores usan ese período como medida del proceso de revisión.
Otros indicadores apuntaron en la misma dirección:
- La proporción de solicitudes que recibieron pedidos de cambios casi se duplicó.
- Los comentarios por solicitud subieron 35%.
- La proporción de empleados que revisaban código creció 14%.
La lectura práctica: una mayor generación de código traslada presión a quienes deben examinarlo antes de incorporarlo. El ahorro en la fase de programación se absorbe aguas abajo, en la revisión.
La automatización de esa revisión todavía no compensaba la carga dentro del período estudiado. Para marzo de 2026, 80% de las empresas analizadas usaba alguna forma de revisión de código asistida por IA, pero los agentes solo generaban 23,3% de los comentarios de revisión y participaban en 10,8% de las solicitudes. La mayor parte del trabajo seguía en manos humanas.
La revisión humana, el nuevo cuello de botella
Este patrón no es exclusivo del estudio de Harvard. Microsoft publicó un análisis de su propio despliegue de agentes de línea de comandos —Claude Code y GitHub Copilot CLI— durante los primeros meses de 2026. Según reportó TechRepublic, los desarrolladores que usaron esas herramientas fusionaron aproximadamente 24% más solicitudes de cambio que sin ellas, y el efecto no se desvaneció durante los cuatro meses del estudio.
El detalle interesante está en la intensidad de uso: quienes usaban las herramientas cinco o más días por semana registraron un incremento superior al 50%, frente a cerca de 15% en quienes las usaban tres días por semana. Tener la licencia no basta; el hábito sí importa.
Pero el mismo reporte de TechRepublic recoge un estudio empresarial paralelo —802 desarrolladores y 196.212 solicitudes de cambio entre enero de 2024 y abril de 2026— donde la presión sobre la revisión se volvió evidente: la proporción de solicitudes con al menos una revisión humana cayó de 89% a 68%, la cobertura de revisión automatizada subió de aproximadamente 19% a 84%, y la carga por revisor prácticamente se duplicó.
Un tercer dato, citado por TechTarget, refuerza la idea: un estudio sobre 567 solicitudes de cambio generadas con Claude Code en 157 proyectos de código abierto encontró que 83,8% terminó fusionándose, pero solo 54,9% lo hizo sin cambios adicionales. El resto necesitó revisión humana, especialmente en correcciones de errores, documentación y estándares específicos del proyecto.
¿Qué dicen otros estudios sobre la productividad con IA?
El panorama es más matizado de lo que sugiere el marketing. Forbes recogió el experimento de METR de 2025: 16 desarrolladores experimentados de código abierto, trabajando sobre bases de código maduras que conocían bien, esperaban ser cerca de 25% más rápidos con IA y siguieron creyéndolo después. La medición objetiva mostró que fueron alrededor de 19% más lentos.
La brecha entre productividad percibida y medida es, quizás, el insight más útil del conjunto. No se trata de qué cifra es la correcta, sino de qué se está midiendo y contra qué línea base.
TechTarget también recoge la encuesta de Stack Overflow de 2025, con más de 49.000 desarrolladores: 66% reportó frustraciones con herramientas de IA que producían resultados "casi correctos, pero no del todo", y 45% dijo que depurar código generado por IA consumía más tiempo.
Y el reporte DORA 2025 de Google, citado por TechTarget, describe la IA como un amplificador del sistema de ingeniería existente: magnifica las fortalezas de los equipos maduros y también sus disfunciones. Mayor adopción de IA se asoció con mayor throughput de entrega, pero también con mayor inestabilidad.
Qué significa esto para tu startup
Si lideras un equipo de producto o ingeniería, la conclusión no es "no uses agentes de IA". Es que el cuello de botella se movió de escribir código a revisarlo, y tu operación tiene que reflejar ese cambio.
1. Mide resultados, no volumen. Líneas de código, commits y solicitudes de cambio son métricas de actividad, no de entrega. Empieza a trackear el tiempo entre el envío de una solicitud y su fusión, la tasa de solicitudes que requieren cambios y el porcentaje de trabajo que llega a producción sin retrabajo. Si esas métricas empeoran mientras el volumen sube, tienes un problema de proceso, no de herramientas.
2. Invierte en capacidad de revisión antes de escalar la generación. El estudio de Harvard muestra que la revisión humana absorbe buena parte del impulso. Si vas a duplicar el volumen de código que entra, necesitas revisores disponibles, estándares claros y automatización de los chequeos mecánicos (linters, análisis estático, tests obligatorios) para que las personas se concentren en lo que realmente requiere criterio.
3. Define dónde conviene delegar. Los datos sugieren que los agentes rinden mejor en trabajo acotado y en repositorios nuevos o limpios. En bases de código heredadas, con dependencias enredadas y contexto disperso, el costo de verificación sube. Asigna agentes a boilerplate, scaffolding de tests y transformaciones rutinarias, y reserva el juicio humano para autenticación, pagos, concurrencia y migraciones.
4. Cuida la comprensión del equipo. Un estudio de 2026 en IEEE Transactions on Software Engineering, citado por TechTarget, encontró que quienes usaban IA lograron más del doble de completitud en tareas, pero su capacidad de responder preguntas técnicas sobre el propio código cayó 12,5%. En equipos pequeños, donde cada persona es dueña de su parte del sistema, esa pérdida de comprensión es un riesgo operativo real.
El estudio de Chen y Stratton documenta un período de transición: los agentes eran relativamente nuevos y sus capacidades siguieron actualizándose después del cierre de datos en marzo de 2026. Con experiencia, los equipos pueden ajustar cómo asignan tareas y cómo revisan resultados. Pero esa mejora es una expectativa sobre la evolución de las prácticas, no un resultado demostrado por las cifras. Por ahora, la evidencia apunta a una compensación: más código generado, más tiempo de revisión, y métricas de resolución de tareas que se mantienen planas.
Fuentes
- DiarioBitcoin: Agentes de IA escriben más código, pero no aceleran la entrega de software
- Ars Technica: AI coding agents generate more code, but not more software
- TechRepublic: Microsoft Study Finds AI Coding Agents Lift Pull Requests by 24%
- TechTarget: The risks of AI overreliance in software engineering
- Forbes: Software Engineering Productivity: You're Measuring The Wrong Thing
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días














