Por qué el No. 1 de OWASP aparece como No. 12 en incidentes
La inyección de prompts ocupa el primer puesto en el OWASP Top 10 for LLM Applications 2026 por tercer año consecutivo, según la versión publicada el 4 de agosto de 2026 y analizada por VentureBeat. En paralelo, cuando los autores Kyriakos «Rock» Lambros y Steve Wilson cruzaron ese ranking con 6.639 incidentes reales etiquetados, la misma amenaza cayó al puesto 12. La brecha no mide el peligro: mide la visibilidad. El ataque opera donde un escáner de vulnerabilidades no puede mirar.
Según SD Times, OWASP actualizó su lista incorporando por primera vez un corpus de aproximadamente 10.000 incidentes reales de seguridad en IA, lo que cambió el método: el voto de practitioners (75%) se pondera contra el registro de incidentes (25%). El resultado fue que lo que los expertos temen no siempre coincide con lo que efectivamente está explotándose en producción.
Para una startup que ya está desplegando agentes con acceso a correo, código o pagos, esa divergencia es la señal más importante del informe. Si tu clasificación de riesgos sigue el orden del OWASP como una cola de tickets, estás leyendo mal el marcador.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadCómo la inyección de prompts evade el radar
El ataque oculta instrucciones dentro del contenido que un modelo lee como si fuera legítimo: una entrada de log, un ticket de soporte, un documento recuperado por RAG (generación aumentada por recuperación, es decir, cuando el agente busca información externa antes de responder), un correo que un asistente resume. El agente entonces hace la llamada a la herramienta que el atacante quería, con credenciales propias y válidas. Ningún eslabón de esa cadena es un defecto del producto, así que el ataque no genera un CVE (identificador público de vulnerabilidad) que un escáner pueda encontrar.
TechTimes recogió en junio de 2026 el argumento de OWASP sobre por qué el problema puede ser estructural: un LLM trata el prompt del sistema, el pedido del usuario y el texto externo como un único flujo de tokens. No hay una frontera interna que marque «confiable» y «no confiable», como sí existe entre código y datos en una base SQL. Por eso filtros, clasificadores y entrenamiento adversarial suben el costo del ataque pero no cierran el agujero: el agujero es el diseño.
El patrón ya está documentado fuera del paper. CrowdStrike, en su 2026 Global Threat Report, reportó que atacantes inyectaron prompts maliciosos en herramientas GenAI legítimas en más de 90 organizaciones durante 2025, con robos de credenciales y criptomonedas, bajo la sección titulada «Prompts are the New Malware», según Forbes.
Lo que OWASP no está viendo todavía
El paper de Lambros y Wilson introduce dos categorías nuevas en la taxonomía: envenenamiento de memoria persistente del agente (experto No. 4, incidentes No. 16) y explotación de herramientas MCP (experto No. 7, incidentes No. 16). Los intervalos de confianza son tan amplios que el modelo no puede ubicarlos dentro de 14 posiciones del ranking. Pero los CVEs ya existen:
- CVE-2026-33980: Azure Data Explorer MCP Server permitía a un agente inyectado por prompt ejecutar consultas KQL arbitrarias, con un score de 8.3 High según Tenable.
- CVE-2026-13341: el Konnect MCP Server de Kong permitía redirigir el servidor a ejecutar llamadas API no deseadas, documentado por NVD.
- CVE-2026-59726: el agente Ruflo expuso endpoints MCP sin autenticación, con un score de 10.0 Critical según NVD.
Lambros lo describe en términos de presupuesto: la memoria envenenada «no se anuncia». Parece un agente de compras al que un día se le dijo que las facturas de un proveedor menor a 50.000 dólares no requieren segunda firma, y como el agente recuerda, cada aprobación posterior luce como el proceso funcionando. «Nadie reporta un aviso por eso, porque nadie sabe que pasó. Un conteo de cero está midiendo tu cieguera, no tu seguridad», dijo a VentureBeat.
Por qué el ranking y los datos no se contradicen
El análisis de VentureBeat cuantifica el desacuerdo: la kappa de Cohen (métrica estadística de concordancia entre dos evaluadores) entre el voto de expertos y el registro de incidentes da 0.20, con un intervalo al 90% que va de -0.16 a 0.57, cruzando el cero. Como explican los autores, eso significa que no se puede descartar que el acuerdo sea producto del azar.
La lectura técnica de los autores es que se trata de dos testigos que se contradicen y no se puede decir cuál miente. El experto vota No. 1 porque la superficie de ataque es enorme aunque las defensas funcionen; el incidente ve los éxitos que logran atravesar los controles. Excessive agency (agencia excesiva) es el único punto donde las dos señales coinciden claramente: el ranking de expertos lo subió del puesto 8 al 3, según Infosecurity Magazine, porque los agentes ya navegan, llaman herramientas y actúan sobre sistemas reales.
Wilson, Chief AI and Product Officer en Exabeam y co-lead del proyecto, es claro sobre el método: «Una control que funciona el 99% del tiempo no es suficiente cuando el caso de falla le da al atacante acceso significativo. Y, francamente, no creo que estemos en el 99%», dijo a VentureBeat.
La trampa del ranking como cobertura de seguros
El ranking OWASP está construido sobre 29 votos de practitioners y un corpus cuyo clasificador varío de 93% de precisión en las categorías mejor medidas a 13% en las peor medidas, según el paper. Un verificador único adjudicó a mano los 1.200 incidentes de gold set y discrepó del modelo en 553 de ellos. Los propios autores lo reconocen como limitación central.
Aún así, OWASP publicó el 4 de agosto el GenAI LLM Top 10 2026 con datos reales por primera vez: prompt injection No. 1, misinformation subió dos puestos, excessive agency saltó del 6 al 3 como la categoría donde ambos testigos coinciden, y unbounded consumption pasó del 10 al 6. La mayor caída fue improper output handling, del 5 al 10.
Para una startup, la conclusión operativa es directa: tu ranking propio de riesgos no puede ser una copia del ranking global. Tiene que ponderar lo que tus agentes tocan (correo, código, datos financieros, infraestructura), qué se ha probado con pruebas adversariales y qué volumen real de notificaciones regulatorias enfrentas.
Qué controles funcionan (y cuáles no) según los autores
Lambros y Wilson coinciden en la misma idea central: la defensa durable vive afuera del modelo, no adentro.
El authorization gate de Wilson: el modelo puede proponer el cambio exacto de DNS, pero no puede concederse a sí mismo la autoridad para ejecutarlo. Las reglas de seguridad dentro del prompt «son sugerencias, no controles exigibles». El precio es explícito: el agente pierde la capacidad de improvisar cambios arbitrarios de infraestructura, pero conserva investigación autónoma y remediación acotada.
Las pruebas adversariales en producción: si tu única prueba de seguridad contra inyección de prompts es un clasificador de entrada, estás midiendo lo que el atacante ya esquivó. Wilson recomienda probar contra el sistema desplegado, no contra el modelo aislado, y combinarlo con el authorization gate.
Las pruebas de los Tracebit researchers (publicadas en julio de 2026, recogidas por Ars Technica) muestran el reverso defensivo: plantar cadenas de «context bombing» junto a secretos en AWS redujo la tasa de toma de admin de los agentes atacantes de 57% a 5% y la de compromiso total de 36% a 1% en 152 corridas contra cinco modelos frontier. El modelo más capaz (Opus 4.8) pasó de éxito en 93% de las corridas a fallar todas las veces cuando enfrentaba una bomba de contexto.
El Agents Rule of Two de Meta y la tríada letal de Simon Willison dan la heurística práctica: un agente sin supervisión humana puede tener a lo sumo dos de estas tres capacidades: acceso a datos privados, exposición a contenido no confiable, y comunicación externa. Combinar las tres requiere a un humano en el loop.
Qué significa esto para tu startup
Si tu stack ya pasó de chatbots a agentes con herramientas, la conversación sobre seguridad AI deja de ser teórica. El 87% de los equipos de seguridad considera prioritaria la adopción de AI agéntica y el 77% reporta al menos algo de comfort dejando actuar a la IA sin revisión humana, según Ivanti’s 2026 State of Cybersecurity research. Son los números detrás de los CVEs que vimos arriba.
Tres acciones concretas esta semana:
- Construye tu ranking interno, no heredes el de OWASP. Tu prioridad va donde señalen los dos testigos a la vez: tu superficie atacable real (qué producción toca el agente) y los datos de notificación de incidentes que ya tienes. Donde divergen, deja de usar el ranking global para asignar presupuesto y ve a mirar qué hacen tus propios sistemas.
- Diseña el authorization gate antes de lanzar el agente. Por cada acción irreversible (enviar correo, ejecutar código, mover dinero, modificar accesos) pon un humano o un servicio externo que apruebe. Lambros lo resume: «Construye esto ahora y es un error de redondeo. Vuelve en dos años y estás re-arquitecturando y re-entrenando».
- Agrega observabilidad adversarial, no solo clasificación de entrada. Loguea el prompt que entró, lo que salió, los documentos recuperados, las herramientas llamadas con sus argumentos y la confianza del modelo en cada respuesta. Lambros señala que la confianza es el campo donde aparece el ataque: «Un modelo corriendo con instrucción envenenada no actúa roto. Actúa seguro. Y tu monitoreo trata la seguridad como sistema sano».
La pregunta para tu próximo board meeting es la misma que dejó VentureBeat sobre la mesa: si nuestro ranking de riesgos AI viene de un voto de 29 personas y de un corpus que no coincide con él, ¿con qué estamos decidiendo qué controles se financian el año que viene?
Fuentes
- Prompt injection ranks No. 1 with OWASP and No. 12 in the incident record (fuente original)
- Prompt Injection tops 2026 OWASP GenAI / LLM Top Ten vulnerabilities
- Prompts Are The New Malware As Enterprise AI Defenses Fall Behind
- Prompt Injection Remains Biggest LLM Risk, Despite Limited Incidents
- AI Agent Security Hits Its Reckoning: Prompt Injection May Be a Permanent Flaw
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













