Black Hat 2026: 2 ataques que controlan agentes de IA

Lo que se demostró en Black Hat USA 2026

Dos charlas en Black Hat USA 2026 (Las Vegas, 1-6 de agosto) mostraron que los agentes de IA —esos asistentes que reservan vuelos, mueven archivos y ejecutan tareas en nombre del usuario— pueden convertirse en una puerta de entrada para los atacantes. La investigación de Zenity y la de Palo Alto Networks partieron de caminos distintos, pero terminaron en la misma conclusión: cuanto más puede hacer un agente, más daño puede provocar si alguien consigue manipularlo.

«PleaseFix»: cómo un comentario en X basta para secuestrar un navegador agéntico

El equipo de Zenity, liderado por Stav Cohen y Michael Bargury (CTO), presentó la charla Pwning Agentic Browsers with PleaseFix: A New Vulnerability Class for 0-Click Takeover. Bautizaron PleaseFix a una nueva clase de vulnerabilidad que explota los navegadores agénticos —bots que ejecutan tareas como reservar vuelos, completar formularios o suscribirse a servicios en nombre del usuario.

El truco se llama indirect prompt injection: la orden maliciosa no llega directamente del usuario, sino escondida dentro de contenido que el agente tiene que leer (un mail, un comentario, una invitación de calendario). El modelo no distingue bien entre «contenido que me pidieron mirar» e «instrucciones escondidas dentro de ese contenido», según explicó Cohen a Clarín.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Una de las demos más llamativas: instrucciones ocultas en un comentario de X bajo una publicación sobre una newsletter. Cuando la víctima le pedía a su navegador agéntico que la suscribiera, el agente leía el comentario, abandonaba la tarea original, entraba a Amazon, modificaba la dirección de envío y concretaba compras a favor del atacante. En otra variante, abría WhatsApp y enviaba mensajes a los contactos de la víctima. También lograron que el agente entregara la bóveda de 1Password y bloqueara al usuario legítimo.

Cómo Palo Alto Networks entró al «sandbox» de ChatGPT

La segunda charla, A Billion-User Blast Radius: Owning ChatGPT’s Secure Sandbox, la dio Simcha Kosman, investigador senior de Palo Alto Networks, seguida de una entrevista a Sherrod DeGrippo, VP de Inteligencia de Amenazas de Unit 42. El ataque arrancaba con un enlace malicioso enviado a un usuario de ChatGPT en iPhone o Mac: a diferencia de Windows o Android, en Apple el comando de la URL se ejecuta sin que la víctima pueda revisarlo.

El paso siguiente fue engañar a ChatGPT para descargar una planilla de Excel manipulada desde un servidor atacante. ChatGPT ejecuta el código contenido en las celdas de las hojas durante el procesamiento. Ese código permitía inyectar instrucciones en el «razonamiento» del modelo y forzar la extracción de datos hacia el entorno aislado (sandbox) —incluyendo información de Google Drive y Gmail si estaban conectados.

El paso más complejo: sacar datos del sandbox sin acceso a internet. Kosman encontró que el repositorio JFrog Artifactory que usan los sandboxes de ChatGPT tenía un comportamiento de bloqueo de cuentas que podía interpretarse como código binario («too many requests» = 1, «login failed» = 0). Esa señal rudimentaria permitió comunicación bidireccional entre un sandbox víctima y uno controlado por el atacante. Dark Reading confirmó que Kosman reportó cinco hallazgos a OpenAI el 23 de marzo de 2026 —ejecución vía URL, inyección de razonamiento, problemas de Artifactory, comunicación entre cuentas y URL laundering— y que OpenAI aplicó cambios antes de la presentación.

El patrón que une ambos ataques: indirect prompt injection

Ambos trabajos son manifestaciones de la misma clase de ataque: prompt injection, catalogada como LLM01 en el OWASP LLM Top 10 de 2025 por segundo año consecutivo. CrowdStrike, en su 2026 Global Threat Report, asegura que actores maliciosos inyectaron prompts en herramientas de IA generativa en más de 90 organizaciones durante 2025, y que el volumen de ataques con IA habilitada creció 89% interanual.

El historial reciente muestra que no es un riesgo teórico. En agosto de 2024, PromptArmor reveló una vulnerabilidad en Slack AI que permitía exfiltrar datos de canales privados. En junio de 2025, Aim Security documentó EchoLeak (CVE-2025-32711, CVSS 9.3), el primer exploit zero-click contra un sistema de IA en producción (Microsoft 365 Copilot): un solo email bastaba para que Copilot enviara archivos internos a un servidor atacante. Ambos vectores, como los de Zenity y Palo Alto, comparten el mismo principio: meter instrucciones en contenido que el agente procesa.

El contexto: los agentes ya son infraestructura, los controles no

La adopción corporativa de agentes creció en forma explosiva en 2026. El reporte State of AI Agent Security 2026 de Gravitee, basado en 750 ejecutivos encuestados, documenta que el número de agentes en producción en la empresa promedio se duplicó en cuatro meses, pero la cobertura de monitoreo pasó de 46,96% a apenas 52%. El 54% de las organizaciones confirmó o sospecha un incidente de seguridad o privacidad vinculado a un agente en los últimos 12 meses. 85% no tiene una estructura formal de rendición de cuentas cuando algo sale mal.

El dato más elocuente: la confianza declarada en la visibilidad de los agentes subió nueve puntos (de 82,6% a 91,8%) en el mismo período, mientras la cobertura real apenas se movió. Crecer la fe en un riesgo que no se ha reducido es, como resume Gravitee, «un precursor clásico de un incidente mayor».

Qué significa esto para tu startup

Si tu producto integra agentes, copilots o conectores a correo, drive o calendario, tienes que asumir que la instrucción maliciosa puede llegar por cualquier lado. Dos acciones concretas:

  • Audita los permisos de cada conector con la lista corta en mano. Trata cada integración como tratarías el acceso de un nuevo empleado crítico: habilita solo lo estrictamente necesario, con el menor nivel de privilegio posible, y revisa trimestralmente qué servicios siguen conectados. Ese es exactamente el consejo que DeGrippo dio a Clarín.
  • Exige aprobación humana para acciones de alto impacto. Pagos, envíos de archivos a terceros, cambios de credenciales, recuperación de contraseñas. Ningún modelo te garantiza que distinguirá entre una instrucción legítima y una inyectada; el control fuera del modelo (límites por código, confirmaciones explícitas) es, según Zenity, lo único que funcionó en sus pruebas.

Conclusión

Las demos de Zenity y Palo Alto Networks dejaron en Las Vegas una conclusión incómoda: la arquitectura actual de los navegadores agénticos y de los entornos como ChatGPT es vulnerable a instrucciones ocultas en contenido cotidiano. Los vectores son nuevos, pero el principio clásico de la seguridad se mantiene: la defensa no puede depender del modelo. Hay que poner el control fuera del modelo, limitar permisos y revisar continuamente qué tiene conectado cada agente. Para founders que están construyendo sobre esta capa, la pregunta ya no es «si mi agente será atacado», sino «qué tan acotado será el daño cuando lo sea».

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...