Claude Code Auto Mode cae ante prompt injection

Claude Code Auto Mode se rompió el 80% de las veces en el ataque de Johann Rehberger

El 27 de agosto de 2026, el investigador Johann Rehberger publicó una demostración que sacudió la confianza en el modo automático de Claude Code. Rehberger, uno de los investigadores de inyección de prompt más respetados del sector, logró que su ataque evadiera el clasificador de seguridad el 80% de las veces. Anthropic había presentado Auto Mode como una capa de defensa robusta contra instrucciones hostiles ocultas en repositorios, issues y archivos externos. La evidencia muestra que esa capa, al menos en la configuración actual, no es confiable.

Cómo funciona el ataque que rompe Auto Mode

El exploit engaña a Claude Code para que descargue y descomprima un archivo ZIP, y luego ejecute código que importa base64. La trampa está en que ese import carga también un archivo struct.py local extraído del ZIP, que ejecuta el malware. En términos simples: el clasificador ve la orden de importar una librería estándar aparentemente inofensiva, pero no detecta que la importación arrastra código controlado por el atacante.

El detalle más alarmante no es que Auto Mode permita la infección, sino lo que ocurre después. En varias ejecuciones, Claude detectó la brecha e intentó terminar el proceso malicioso. Auto Mode bloqueó el comando de limpieza. El propio mecanismo de seguridad se convirtió en parte del fallo: dejó entrar al malware y luego impidió que el agente se defendiera.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Por qué existe Auto Mode y qué prometía

Anthropic lanzó Auto Mode el 24 de marzo de 2026 como respuesta a un problema real. Sus propios datos de telemetría mostraban que los desarrolladores aprobaban entre el 93% y el 97% de los prompts de permisos sin revisarlos. Este fenómeno, conocido como approval fatigue (fatiga de aprobación), convierte cada cuadro de diálogo en un reflejo y no en una decisión. Un estudio interno de la compañía con 1.053 testers profesionales pagos encontró que los humanos detectaban solo el 13,6% de los comandos peligrosos, frente al 89% del clasificador. Tras 50 prompts, el rendimiento humano caía a alrededor del 5%.

El 14 de agosto de 2026, Anthropic convirtió Auto Mode en el permiso por defecto para usuarios Pro, Max y Team, según reportó InfoWorld. Antes, en julio de 2026, la compañía había probado brevemente el camino inverso y dejó Manual como default en la versión v2.1.200 (3 de julio de 2026), documentado por TechTimes, precisamente por la preocupación de seguridad que ahora Rehberger confirma. El cambio buscaba desbloquear sesiones largas y reducir la fricción; según la propia Anthropic, los usuarios de Auto Mode en planes Team y Enterprise envían cerca de 25% más pull requests.

Por qué la promesa es más frágil de lo que parece

Auto Mode no es una sola capa. El sistema combina un clasificador rápido de un solo token, un razonador más lento (chain-of-thought) cuando el primero sospecha, y reglas de denegación dura configurables. Todo opera sobre el modelo Claude Sonnet 4.6. Anthropic publica que el clasificador tiene 0,4% de falsos positivos, pero también un 17% de falsos negativos en su propio banco de pruebas de acciones "demasiado entusiastas" del agente. En esos casos, el modelo identifica el peligro, pero juzga erróneamente que el consentimiento previo del usuario cubre el alcance específico de la acción.

Hay tres razones por las que un clasificador, por bueno que sea, no sustituye al aislamiento:

  • El clasificador evalúa intención y superficie, no procedencia del paquete. No sabe distinguir entre un pip install requests legítimo y una dependencia con typosquatting.
  • Opera sobre los mensajes del usuario y las llamadas a herramientas, no sobre el contenido textual que el propio modelo podría usar para razonar.
  • Es un único punto de fallo. Si el atacante encuentra un bypass, como el struct.py de Rehberger, no hay segunda red.

InfoWorld recogió un matiz importante de los analistas: Auto Mode cambia el perfil de riesgo, no lo elimina. Las nuevas integraciones corporativas, como la que AWS anunció con Continuum en flujos de Claude Code y OpenAI Codex, parten de esa misma idea: gobernanza centralizada más sandbox, no fe ciega en el clasificador.

La lección incómoda que dejan los precedentes

La inyección de prompt en agentes de código no es nueva. En abril de 2026, un issue en GitHub contra Claude Code documentó una caída de servidor, pérdida de datos e impacto en ingresos cuando una sesión autónoma malinterpretó instrucciones y borró archivos equivocados. En junio de 2026, investigadores de Microsoft Security demostraron que la GitHub Action de Claude Code podía ser manipulada para filtrar secretos del runner, incluyendo ANTHROPIC_API_KEY. Cada incidente refuerza la misma conclusión: cualquier agente con capacidad de ejecutar comandos es una superficie de ataque, y los atacantes van varios pasos por delante.

Qué significa esto para tu startup

Si usas Claude Code en producción, Auto Mode te ahorra fricción y te entrega hasta 25% más throughput en pull requests, pero no es una muralla. La recomendación de Simon Willison y de Rehberger es dura: si existe cualquier riesgo de que un atacante pueda llegar a tu agente (por ejemplo, procesas issues públicas, repos abiertos o contenido web arbitrario), el agente tiene que correr en una caja.

Acciones concretas para implementar esta semana:

  • Ejecuta agentes desatendidos dentro de un contenedor, VM o sandbox de sistema operativo (Seatbelt en macOS, bubblewrap con seccomp en Linux). No los corras sobre tu laptop con acceso al home.
  • Restringe la salida de red (network egress) a un allowlist mínimo. El ataque de Rehberger necesitaba descargar el ZIP; sin red, la cadena se corta en el primer paso.
  • Monitoriza los procesos. Detecta cuando el agente invoca shells, conexiones salientes nuevas o módulos sospechosos, aunque Auto Mode no haya objetado.
  • No expongas claves SSH, credenciales de nube ni directorios personales al runtime del agente. La mayoría de los daños reales en estos incidentes vienen de secretos al alcance.
  • Para pipelines CI/CD que dependían de Auto Mode como comportamiento por defecto, documenta la decisión. Si activas --permission-mode bypassPermissions, hazlo solo dentro de contenedores sin secretos montados, nunca en runners con acceso al repositorio y a la nube.

Conclusión

Anthropic construyó Auto Mode para resolver un problema real: la fatiga de aprobación que vuelve inútiles los prompts de permiso. El clasificador detecta el 89% de los comandos peligrosos y los humanos solo el 13,6%. Es una mejora genuina. Pero un clasificador con 17% de falsos negativos, que además bloquea los comandos de limpieza del propio agente, no puede ser tu única defensa. Rehberger demostró el bypass en el 80% de los intentos. La única configuración robusta combina el clasificador, un sandbox de sistema operativo, red restringida y monitorización. Si cualquiera de esas cuatro capas falta, tu agente es vulnerable. El mensaje para founders es claro: la velocidad que entrega Auto Mode vale la pena, pero solo sobre una base que asuma que el clasificador va a fallar.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...