Un 30% más de código que no llega a producción
Un estudio de la Universidad de Harvard, firmado por Fiona Chen y James Stratton, encontró que incorporar agentes de IA que escriben código de forma autónoma eleva 30% las líneas de código producidas en una empresa, 20% las confirmaciones (commits) y 23% las solicitudes de cambios (pull requests). El problema: la tasa de resolución de tickets de funcionalidades completas, las que se miden en herramientas como Jira, no mostró un cambio estadísticamente significativo.
La investigación usó datos de la plataforma de analítica Jellyfish: 300 millones de eventos de trabajo y registros de gestión de tareas de más de 700.000 empleados en más de 700 empresas de desarrollo de software, entre 2021 y marzo de 2026. Los autores compararon el comportamiento de cada firma antes y después de sumar asistentes de IA, que autocompletan código escrito mayormente por humanos, y agentes de IA, que redactan y envían código por su cuenta a partir de una instrucción.
El hallazgo central es incómodo para cualquier equipo que esté midiendo el impacto de la IA en líneas de código: más output no es más producto. Como resume Ars Technica al cubrir el estudio, no hay evidencia significativa de que las empresas aumenten el output de software o reduzcan el empleo usando estas herramientas.
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días¿Por qué los agentes de IA generan más código pero no más software?
La respuesta está en la revisión. Según el estudio, el tiempo promedio entre el envío de una solicitud de cambios y su incorporación definitiva al proyecto creció 49% después de sumar agentes de IA. La proporción de solicitudes que un revisor humano devuelve pidiendo correcciones casi se duplicó, y la cantidad de comentarios por solicitud aumentó 35%.
Las empresas reaccionaron reasignando personal: la proporción de empleados dedicados a revisar código creció 14% tras la adopción de estos agentes. Pero los autores no encontraron un cambio significativo en el empleo total cuando cruzaron esos datos con información de LinkedIn. Es decir, los roles se corren hacia la revisión; no desaparecen ni se multiplican.
La revisión automática todavía no resuelve el cuello de botella. Para marzo de 2026, el 80% de las empresas relevadas usaba algún sistema de revisión de código con IA, pero los agentes generaron solo el 23% de los comentarios de revisión y participaron en apenas el 10,8% de las solicitudes de cambios. El grueso del trabajo de control sigue en manos de personas.
Los propios autores advierten que la adopción es reciente: el 95% de las empresas del estudio ya había incorporado agentes al cierre del relevamiento, pero muchas siguen ajustando cómo y cuándo usarlos. Chen y Stratton sostienen que, si la calidad del código generado por IA mejora y reduce la necesidad de revisión manual, buena parte del cuello de botella podría achicarse con el tiempo. Por ahora, sus datos no muestran esa mejora en la práctica.
El contraste más fuerte aparece cuando se mira el otro extremo: en febrero de 2026, Spotify afirmó que sus desarrolladores no habían escrito ni una línea de código desde diciembre de 2025, según el artículo que origina esta nota.
Un patrón que se repite: MIT, JetBrains y el mercado de la validación
Un trabajo separado de investigadores del MIT y la Universidad de Pensilvania, con datos de más de 500.000 desarrolladores de GitHub, llegó a una conclusión parecida: a medida que aumenta la autonomía de las herramientas de IA, la brecha entre el código escrito y el software efectivamente publicado se agranda. Sus autores lo atribuyeron a lo que llamaron un eslabón débil humano en la cadena de producción.
La adopción, mientras tanto, es masiva. La encuesta 2026 Developer Ecosystem Survey de JetBrains, sobre más de 15.000 desarrolladores profesionales, encontró que el 90% usa agentes de código en el trabajo al menos una vez por semana y el 68% los usa a diario, según reportó ADTmag. Claude Code pasó del 18% al 39% de uso laboral entre enero y el período de mayo a julio de 2026, y Codex de OpenAI saltó del 3% al 16%. El volumen de código agéntico va a seguir creciendo.
El mercado está apostando justamente a la capa que este estudio señala como problema. Blacksmith, una startup fundada en 2024 que ayuda a construir, testear y verificar software antes de que llegue a producción, levantó una Serie B de US$45M liderada por Peak XV Partners que la valoró en US$550M, frente a los US$60M de menos de un año antes, reportó TechCrunch en agosto de 2026. La compañía acumula US$58,5M levantados y pasó de 700 a más de 5.000 clientes en menos de un año. Su CEO, Aditya Jayaprakash, lo dijo sin rodeos: validar código sigue siendo un cuello de botella, y es un cuello de botella aún más grande porque la gente escribe más.
Los grandes también se movieron. Google sumó a Conductor, su extensión del Gemini CLI, una función de revisión automatizada que se activa después de que el agente termina: chequea calidad del código, cumplimiento del plan original, guías de estilo, ejecución del suite de tests y seguridad antes de que el código llegue a producción, según detalló WWWhatsnew. La frase del blog de Google resume el problema: que el desarrollo agéntico no signifique desarrollo sin supervisión. Del mismo artículo se desprende un dato incómodo atribuido a CodeRabbit: el código generado por IA introduce 1,7 veces más bugs que el escrito por humanos, con errores de lógica un 75% más frecuentes.
Qué significa esto para tu startup
Si lideras un equipo técnico, el mensaje es claro: la IA bajó el costo de escribir código, no el costo de poner software en manos de usuarios. La eficiencia que se gana escribiendo se absorbe en la revisión.
- Deja de medir líneas de código, commits o pull requests como señal de productividad. El estudio muestra que esas tres métricas suben entre 20% y 30% sin correlato en funcionalidades entregadas. Mide cycle time, tiempo de revisión por PR y tasa de PRs devueltos: son las que se mueven primero cuando aparece el cuello de botella.
- Presupuesta la revisión como una línea de capacidad, no como una tarea suelta. Si el tiempo de merge crece 49%, alguien tiene que absorberlo. Fija un límite al trabajo en curso (WIP) y un tamaño máximo de PR para que los agentes no inunden la cola de revisión.
- Invierte en la capa de validación antes de escalar el uso de agentes. Tests automáticos, integración continua y revisión asistida por IA son la palanca que ataca el eslabón que el estudio señala. El capital está yendo ahí: Blacksmith multiplicó su valuación casi 10 veces en menos de un año por ese motivo.
- Define una política explícita de uso. El 95% de las empresas ya usa agentes, pero muchas no tienen reglas sobre qué se delega, qué se revisa siempre y con qué estándares. Sin política, el equipo improvisa y la deuda técnica se acumula.
Para equipos chicos de LATAM y España, el punto es doblemente relevante: cuando el plantel es reducido, la revisión es el recurso más escaso. Sumar agentes sin sumar capacidad de revisión no acelera el delivery, solo mueve el trabajo de lugar.
Conclusión
El estudio de Chen y Stratton no dice que los agentes de IA no sirvan. Dice algo más útil: que la velocidad en la escritura choca contra la capacidad humana de verificar. La adopción ya es casi universal y el eslabón débil sigue siendo el mismo. La pregunta para tu startup no es cuántos agentes sumas, sino cuánto código revisado y testeado puedes sostener por semana.
Fuentes
- Infobae (fuente original)
- Ars Technica
- TechCrunch
- ADTmag
- WWWhatsnew
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días













