Claude, Codex y Hermes instalan código no verificado en redes corporativas

Qué pasó: los agentes de IA ejecutaron código desconocido en redes corporativas

Un estudio publicado por Ars Technica advierte que los agentes de codificación de Anthropic (Claude), OpenAI (Codex) y Nous Research (Hermes) pueden instalar paquetes de software no verificados al procesar documentación web. Los investigadores escanearon 6.214 dominios de contratistas de defensa, empresas de la lista Fortune 500 y grandes tecnológicas, y hallaron 8.265 archivos del tipo llms.txt y llms-full.txt, convenciones emergentes que funcionan como un «robots.txt para IA» y resumen el contenido de un sitio en formato legible para modelos.

De esos archivos, 120 (cada uno en un dominio distinto) apuntaban a paquetes de software o dominios que no estaban registrados. Tras reclamar varios de esos nombres en blanco y alojar paquetes de prueba que enviaban una señal al servidor del equipo, los investigadores recibieron la primera respuesta desde un entorno corporativo de una Fortune 500 en menos de una hora. Con el paso de los días, obtuvieron señales de unas pocas decenas más de organizaciones, incluidas otras Fortune 500 y startups, según reportó Ars Technica.

El mecanismo es similar al clásico typosquatting, pero aplicado a instrucciones que la IA lee como verdad absoluta. Un documento puede sugerir instalar el paquete «A»; si nadie lo ha registrado todavía, un atacante puede comprarlo, subir su propio código y esperar a que cualquier agente con permisos suficientes lo descargue.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Por qué importa: el modelo de confianza entre IA y documentación está roto

El investigador Alon Hertz lo resumió así en entrevista con Ars Technica: «El modelo de confianza está roto. Los agentes tratan la documentación del proveedor como verdad absoluta y no la cuestionan, y los humanos que los supervisan tampoco lo hacen».

El hallazgo expone un problema estructural del agentic AI: estas herramientas no leen la web como un humano que duda del contexto, sino que ejecutan instrucciones que aparecen en archivos legítimos. El reporte recogido por Yahoo Tech señala que las causas de los enlaces huérfanos pueden ser varias: errores humanos, paquetes renombrados o abandonados, copy/paste defectuoso o, directamente, documentación alucinada.

Lo crítico no es que un sitio distribuya malware de forma intencionada, sino que basta con que un documento apunte a un paquete no registrado para que un atacante convierta una instrucción inofensiva en un enlace a código malicioso. Según Ars Technica, al menos un sitio mal configurado estaba dirigiendo a visitantes, humanos o IA, hacia malware activo.

Cuál es el alcance real del riesgo

El estudio no afirma que Claude, Codex o Hermes propaguen malware de forma intencionada. Lo que demuestra es que, al recibir permiso para ejecutar comandos en un sistema, los tres agentes involucrados en las pruebas obedecieron instrucciones embebidas en archivos llms.txt y descargaron software de fuentes no verificadas.

La superficie de ataque crece a medida que los agentes se multiplican en capas de SaaS, nube y endpoints. Ars Technica cita el comentario de Hertz: «El uso de IA agéntica está explotando, y los agentes se están expandiendo por cada capa: SaaS, nube, endpoint. A medida que se multiplican, también lo hace la superficie de la cadena de suministro, y las protecciones actuales no la cubren».

En el lado defensivo, el sector ya está moviéndose. La plataforma Harness lanzó el 19 de agosto de 2026 una suite de agentes de seguridad (AI SAST, triage, remediación, Zero-Day Agent y virtual patching) precisamente para acortar los tiempos de parcheo, según Unite.AI. Su lanzamiento parte de una asimetría clara: el reporte Edgescan 2026 cifra en 55 días el promedio de remediación de una vulnerabilidad, mientras que el Zero Day Clock ha documentado exploits tan solo 6 horas después de la divulgación.

En la misma línea, Google Threat Intelligence Group (GTIG) publicó el blueprint de su sistema Agentic Vulnerability Discovery Harness (AVDH), una pipeline multi-agente que Mandiant ha utilizado durante 10 meses y que identificó más de 100 vulnerabilidades críticas reales en 48 horas durante un incidente reciente, según iTWire. En un año, AVDH ha producido 12 CVEs asignados, incluidos CVE-2026-13242 y CVE-2026-55803, con otros 12 en divulgación activa.

Qué significa esto para tu startup

Si tu equipo ya usa agentes de codificación con permisos para ejecutar comandos, dejar de hacerlo no es la respuesta: dejarías de competir. La respuesta es operar con la menor superficie de ataque posible y asumir que la documentación web nunca debe ser tratada como verdad absoluta.

Acciones concretas que puedes implementar esta semana:

  • Audita los permisos de tus agentes hoy mismo. Revisa qué agentes tienen acceso a pip install, npm install, curl | sh o ejecución de comandos en tu pipeline. Cualquier permiso de instalación de paquetes debería pasar por una lista de dominios permitidos o por un proxy interno que valide hashes.
  • Bloquea la ejecución ciega de instrucciones externas. Configura tus agentes para que ninguna instrucción de instalación venga únicamente de un llms.txt o de un README scrapeado. Fuerza un paso humano o un escaneo de seguridad antes de ejecutar pip install <paquete-externo> o equivalente.
  • Pide a tu equipo de plataforma un AI Bill of Materials. Al igual que un SBOM lista las dependencias de software, un AIBOM debe listar qué agentes operan, qué comandos pueden ejecutar y bajo qué credenciales. Sin ese inventario, no sabes qué superficie estás exponiendo.
  • Limpia tu propia documentación. Si tu startup publica llms.txt o llms-full.txt, verifica que cada enlace apunte a un paquete realmente existente y mantenido. Un enlace roto o no registrado en tu sitio es una puerta de entrada para un atacante.

El reporte de Ars Technica no habla de三家三大厂商 conspirando para propagar malware; habla de un ecosistema que crece más rápido que sus controles. La pregunta para tu startup no es si usas agentes, sino qué pueden ejecutar sin que nadie se entere.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...