Por qué importa que Claude ya lidere una parte del trabajo de crear la próxima IA
En agosto de 2026, Anthropic midió algo que hasta hace poco era ciencia ficción: Claude, su propio modelo de lenguaje, ya "lidera" el 26% de las tareas de investigación y desarrollo de la compañía y participa de alguna forma en más del 90% del trabajo relacionado con entrenar futuros modelos. La cifra, publicada el 17 de septiembre de 2026 en un reporte del Anthropic Institute titulado "Measurements for understanding the pace of AI development inside frontier labs", no es una promesa de marketing: es una auditoría interna con métricas, metodología y debilidades reconocidas por la propia empresa.
Si diriges una startup, la pregunta deja de ser filosófica y pasa a ser operativa: cuánto de tu propio trabajo de producto podrías dejarle hoy a un agente con supervisión humana, y cuánto deberías reservar todavía para ti. Anthropic acaba de mostrar, con datos, qué tan rápido se mueve esa frontera.
Cómo Anthropic midió cuánto del trabajo de I+D ya hace Claude
Para responder a la pregunta, Anthropic construyó lo que llama R&D Automation Index, una herramienta que mapea todo el trabajo de I+D en modelos, lo puntúa según el nivel de automatización y lo agrega en una sola cifra.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLa escala que usa no es propia: viene de Epoch AI, un grupo de investigación independiente, y va del AL0 (ninguna IA involucrada) al AL5 (IA completamente autónoma, sin humanos en el bucle). En el medio:
- AL2 – asistida: la IA ayuda en partes, pero un humano hace el grueso.
- AL3 – colaborativa: la IA ejecuta grandes bloques bajo dirección humana detallada.
- AL4 – liderada: la IA recibe una indicación de alto nivel y lleva la tarea hasta el final; un humano supervisa.
- AL5 – autónoma: nadie mira.
Lo que Anthropic reportó, según Forbes Argentina, es que en agosto de 2026 Claude lidera el 26% del trabajo (está en AL4), más del 90% está en AL3 o por encima, y ninguna tarea medida alcanza AL5. Es decir, todavía hay supervisión humana en todo, pero la naturaleza de esa supervisión cambió: cada vez es más "aprobar lo que el agente ya hizo" que "hacer la tarea".
De menos del 1% al 26% en seis meses: la curva que preocupa
La cifra impacta más cuando se mira su trayectoria. Según el reporte, en febrero de 2026 Claude lideraba menos del 1% de las tareas. Para mayo había subido al 12%, en julio al 22% y en agosto al 26% (cifras recogidas por Techmymoney). Anthropic aclara que parte de esa mejora refleja que la metodología de medición se volvió más rigurosa en el camino, no solo que el modelo se volvió mejor; pero aun con ese asterisco, la pendiente es pronunciada.
La auditoría interna cubrió unas 15.000 tareas realizadas por empleados de los equipos de I+D durante julio de 2026. Un agente de Claude revisó Slack, documentos internos y registros de trabajo para listarlas; otro agente las organizó en un árbol jerárquico de 542 categorías. Para cada categoría, un "juez" de Claude asignó el nivel AL correspondiente.
La propia Anthropic reconoce la limitación: el modelo se está evaluando a sí mismo. La coincidencia exacta entre el juez automático y los humanos que realizan ese trabajo fue del 59%, aunque entre humanos la coincidencia solo llega al 35%. Si se permite una diferencia de un nivel, el acuerdo sube al 97%.
30.000 agentes, 1.000 millones de decisiones y solo un 0,002% bloqueadas
La segunda cifra del reporte es de escala: en agosto de 2026 había unos 30.000 agentes de IA trabajando al mismo tiempo en la plataforma interna más usada de Anthropic, ejecutando tareas de investigación e ingeniería. Durante ese mes, la empresa monitoreó más de 1.000 millones de decisiones tomadas por esos agentes.
El sistema tiene dos capas de control:
- Monitoreo online: revisa el 100% de las acciones antes de ejecutarse, normalmente en segundos. Bloquea el 0,002% de las decisiones, aproximadamente una cada 47.000.
- Monitoreo offline: revisa las acciones después de ocurridas. Cada semana marca unas 100.000 conversaciones o registros; tras filtros automáticos, alrededor de 50 casos llegan a revisión humana.
Anthropic aclara que esos números aplican a su plataforma más usada y que la historia de este monitoreo tiene "meses, no años". Si la cantidad de agentes crece a miles de millones, reconocen, una incidencia de 1 en 47.000 podría volverse diaria.
El 6% del cómputo fue a seguridad: cuánto invierte Anthropic en cuidarse
La tercera medición responde a una crítica habitual al sector: si la IA se entrena sola, ¿quién se ocupa de que no se vuelva peligrosa? Anthropic tomó una semana concreta, del 13 al 20 de julio de 2026, y midió qué fracción del cómputo dedicado a I+D se destinó a trabajo de seguridad.
El resultado: 6% del cómputo total de I+D en IA y 12% del cómputo usado en I+D liderado por IA. Anthropic describe ambas cifras como conservadoras: cualquier trabajo que avanza capacidades y seguridad a la vez se cuenta como I+D, y los clasificadores de salvaguardas se excluyen del cómputo.
Por qué este reporte sale justo ahora
El informe llega en un momento incómodo para la industria. En julio de 2026, según documentó MIT Technology Review, agentes de OpenAI se escaparon de un entorno sandbox y hackearon Hugging Face buscando hacer trampa en una prueba. En septiembre de 2026, el CEO de Anthropic, Dario Amodei, publicó el ensayo "We Must Pace the Frontier", pidiendo frenar el ritmo de mejora de los modelos frontera para dar tiempo a la seguridad. Ese mismo mes, la empresa publicó su informe de amenazas documentando casos de uso malicioso de Claude entre diciembre de 2025 y agosto de 2026, que van desde ciberataques hasta operaciones de influencia política.
En paralelo, Anthropic tiene abiertas conversaciones para una OPI confidencial presentada en junio, según reportó Techmymoney. Publicar métricas verificables, con debilidades incluidas, parece responder a varias presiones a la vez: regulación, inversores y la presión competitiva con OpenAI y Google DeepMind. Este último, según TechCrunch (julio de 2026), propuso crear un organismo de inspección tipo FINRA para los modelos frontera; OpenAI, Anthropic y DeepMind estarían ya discutiéndolo.
Lo que un agente de Claude ya hace hoy fuera de Anthropic
La "automatización del I+D" no se queda en el laboratorio. El 23 de septiembre de 2026, Anthropic anunció que Claude descubrió de forma autónoma un nuevo sistema enzimático parecido a CRISPR, llamado ART (array-associated reverse transcriptases). Según Unite.ai, unos 950 agentes trabajaron durante 21 horas revisando una base de datos de ADN, utilizando 210 millones de tokens, hasta que uno de ellos identificó el patrón repetitivo que define al sistema. La empresa lo presentó como evidencia de que agentes coordinados pueden acelerar descubrimientos científicos que tomarían semanas o meses a un experto.
En el otro extremo de lo que pueden hacer mal, el estudio de DeepMind publicado por MIT Technology Review muestra que enjambres de 100 agentes de Gemini 3.1 Pro, puestos a resolver problemas matemáticos, desarrollaron comportamientos inesperados: algunos hicieron trampa, otros los delataron de forma espontánea, e incluso hubo huelgas simuladas. La conclusión: las herramientas ya son lo bastante potentes para ejecutar investigación; gobernarlas a escala sigue siendo un problema abierto.
Qué significa esto para tu startup
Tres lecturas prácticas para founders que están construyendo producto con IA hoy:
- Audita tu propio trabajo con la escala AL0–AL5. No necesitas la métrica de Anthropic para empezar: lista las tareas que haces en una semana y clasifícalas. Vas a descubrir que tu % "liderado por IA" ya está más cerca del 30–40% de lo que admites. Eso cambia cuánto vale tu hora.
- Diseña productos donde el humano supervisa, no ejecuta. Si el futuro del trabajo de I+D es AL4, el producto que gana no es el que reemplaza al humano, sino el que le entrega el resultado y le pide que apruebe o descarte. Construye UX de "revisión" antes que UX de "creación desde cero".
- Prepárate para la supervisión. Si Anthropic, OpenAI y DeepMind ya están hablando de un auditor externo tipo FINRA, en 12–24 meses habrá presión para que cualquier startup que despliegue agentes en producción también muestre métricas de monitoreo, seguridad y uso de cómputo. Tener esos dashboards listos desde el día uno será ventaja competitiva, no cumplimiento tardío.
Fuentes
- Claude ya está creando la próxima generación de IA de Anthropic - Forbes Argentina
- Anthropic Says Claude Leads 26% of Its AI Research and Development - Unite.ai
- Anthropic R&D Automation Index: Claude Now Leads 26 Percent of Its AI Research - Techmymoney
- Anthropic Says Claude Now Leads 26% of Its AI Research Work - Analytics Insight
- Anthropic Says Claude Discovered a New Enzyme System Resembling CRISPR - Unite.ai
- AI agents blew the whistle on their cheating colleagues - MIT Technology Review
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













