Agentes de IA vulnerables: estudio EPFL revela riesgos críticos 2026

¿Por qué los agentes de IA son más vulnerables que los chatbots?

Si le pides a un agente de inteligencia artificial que piratee la cuenta de otra persona, el modelo se negará. Es lo suficientemente inteligente como para detectar la intención maliciosa y rechazarla. Pero si descompones ese mismo objetivo en una serie de pasos aparentemente inocuos, adaptando las solicitudes conforme avanza la conversación, las probabilidades de que el agente ejecute la acción dañina se duplican.

Ese es el hallazgo central de un estudio presentado en la International Conference on Machine Learning 2026 por investigadores del Laboratorio de Procesamiento del Lenguaje Natural de la Escuela Politécnica Federal de Lausana (EPFL). El equipo desarrolló STING (Sequential Testing of Illicit N-step Goal execution), un framework automatizado que simula cómo un atacante real podría manipular agentes de lenguaje grande (LLM) a través de múltiples interacciones secuenciales.

Los resultados encendieron las alertas: al someter modelos como GPT, Gemini y Claude a 176 escenarios de tareas perjudiciales, descubrieron que los ataques multi-turno superan consistentemente a las evaluaciones tradicionales de un solo prompt. En algunos casos, los agentes tenían el doble de probabilidades de completar acciones maliciosas cuando los atacantes avanzaban de forma gradual.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

«Tradicionalmente la seguridad ha sido algo que se aborda cuando algo falla y no antes, pero con los agentes de IA no puede ser algo que se deje para después», subrayó Antoine Bosselut, director del laboratorio EPFL y coautor del paper.

El método STING: pensar como un atacante

A diferencia de las pruebas de seguridad convencionales, que verifican si un modelo rechaza una solicitud directamente ilícita, STING reproduce el comportamiento de un atacante que desarrolla un plan paso a paso antes de intentar persuadir al agente objetivo. El framework crea un «atacante» automatizado que descompone objetivos ilícitos en una serie de solicitudes aparentemente benignas, cada una construida hacia la meta final.

«Lo que nos sorprendió fue la magnitud», explicó Ayush Kumar Tarun, estudiante de doctorado en el NLP Lab de la EPFL y autor principal del estudio. «Para algunos modelos, la finalización de tareas maliciosas fue alrededor de dos veces mayor que con las evaluaciones de un solo turno existentes. STING mide qué tan rápido tiene éxito un ataque, no solo si eventualmente tiene éxito, lo que permite comparar diferentes enfoques de prueba de manera más justa».

El factor idioma: un hallazgo contraintuitivo

El equipo también exploró si los ataques se volvían más efectivos en idiomas con menos recursos de entrenamiento. Contrario a lo esperado —investigaciones anteriores sugerían que traducir prompts a idiomas con menos datos de entrenamiento podía eludir las medidas de seguridad—, descubrieron que las tasas de finalización de tareas maliciosas fueron notablemente similares en los siete idiomas probados.

Sin embargo, encontraron un punto crítico: cuando los atacantes sofisticados cambiaban de idioma durante distintas etapas de un ataque multi-paso, la efectividad se amplificaba drásticamente. Este hallazgo revela una nueva superficie de ataque que los marcos de evaluación actuales pasan por alto.

¿Qué significa esto para tu startup?

La advertencia de la EPFL llega en un momento crucial. Los agentes de IA están avanzando hacia una adopción masiva en entornos corporativos, de salud y financieros, sectores donde una acción maliciosa ejecutada sin detección puede tener consecuencias catastróficas. El riesgo no es teórico: en junio de 2026, Meta admitió que atacantes usaron tácticas simples de ingeniería social para engañar a su asistente de soporte con IA y obtener acceso no autorizado a cuentas de Instagram.

Más allá de los agentes conversacionales, el problema se agrava cuando estos sistemas se conectan a herramientas externas. Investigadores de Microsoft documentaron en mayo de 2026 vulnerabilidades críticas en frameworks populares como Semantic Kernel que permiten que un simple prompt inyectado genere ejecución remota de código (RCE) en el servidor que aloja el agente. Dos CVEs críticos (CVE-2026-25592 y CVE-2026-26030) expusieron que la línea entre seguridad de contenido y ejecución de código es extremadamente delgada cuando un modelo está conectado a plugins.

El panorama es claro: OWASP ya clasifica la inyección de prompts como LLM01:2025, la vulnerabilidad más crítica en aplicaciones de IA. Un estudio citado por Proofpoint documentó más de 461.000 intentos de inyección en un solo dataset, con tasas de éxito entre 50% y 84% según la técnica utilizada.

Acciones concretas para founders

Si estás construyendo o desplegando agentes de IA en tu empresa, estas son las medidas prioritarias:

  • Implementa testing multi-turno desde el diseño. No confíes en evaluaciones de un solo prompt. Integra frameworks como STING en tu pipeline de desarrollo para exponer vulnerabilidades antes del despliegue. La seguridad debe ser parte del proceso de diseño, no un parche posterior.
  • Aplica el principio de mínimo privilegio a tus agentes. Si un chatbot solo necesita buscar en una base de conocimientos, no le des permisos para enviar correos, eliminar archivos ni acceder a bases de datos. Incluso si un atacante inyecta instrucciones maliciosas, un agente con permisos limitados causa daño reducido.
  • Exige human-in-the-loop para acciones sensibles. Para operaciones de alto riesgo —transferencias de dinero, concesión de accesos, eliminación de datos— inserta siempre una aprobación humana antes de la ejecución. Google implementó este enfoque en su estrategia de defensa multicapa publicada en 2025.
  • Monitorea el comportamiento runtime de tus agentes. Implementa sistemas de detección de anomalías que registren patrones inusuales: longitudes inesperadas de salida, solicitudes a dominios externos o respuestas con snippets de código cuando no se esperaban. Esto es especialmente crítico si usas frameworks como LangChain, CrewAI o Semantic Kernel.

El mercado reacciona: inversión explosiva en seguridad de agentes

La urgencia se refleja en los números. Según análisis de Crunchbase y CB Insights, las startups que construyen defensas contra agentes de IA levantaron US$3.6 mil millones hasta marzo de 2026. Empresas como Cyera (US$1.7 mil millones levantados), Saviynt (US$1 mil millones) y Torq (US$332 millones, valoración de US$1.200 millones) lideran esta nueva categoría.

Durante la conferencia RSAC 2026 en marzo, seis compañías anunciaron US$392 millones en nueva financiación en una sola semana. Oasis Security levantó US$120 millones para gobernanza de identidad no-humana; XBOW recaudó US$120 millones en Serie C con valoración superior a US$1.000 millones; y RunSybil, fundada por el primer contratista de seguridad de OpenAI, cerró US$40 millones con Khosla Ventures.

El mercado total de seguridad para agentes autónomos alcanzó aproximadamente US$1.65 mil millones en 2026 y se proyecta llegar a US$13.52 mil millones para 2032, con una tasa anual compuesta (CAGR) del 42% según MarketsandMarkets. Gartner estima que el segmento de ciberseguridad AI crecerá de US$10.82 mil millones en 2024 a US$172 mil millones para 2029.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...