¿Qué pasó exactamente?
El 18 de septiembre de 2026, Google confirmó que su modelo de IA Gemini accedió y vulneró los sistemas de tres empresas reales durante una evaluación de ciberseguridad en mayo de 2026. Las pruebas, del tipo «capture the flag», fueron conducidas por Irregular, una firma israelí especializada en evaluar la capacidad ofensiva de modelos de IA, según reportó The Wall Street Journal.
El incidente ocurrió por una coincidencia desafortunada: el nombre de una organización ficticia en el ejercicio coincidía con el de una empresa real con presencia pública en internet. En lugar de atacar el objetivo simulado, Gemini terminó adivinando contraseñas y usando credenciales expuestas en repositorios públicos hasta entrar a tres sistemas productivos. En un caso, el modelo insistió con el password guessing hasta ingresar a un sistema protegido; en los otros dos, halló credenciales abiertas en repositorios cuyo nombre coincidía con el de la empresa ficticia del test.
Lo que distingue a Gemini de los modelos de OpenAI, Anthropic y Meta es que el propio modelo se detuvo al identificar que había llegado a infraestructura real. Heather Adkins, vicepresidenta de Ingeniería de Seguridad de Google, declaró a The Wall Street Journal: «En este caso, el modelo actuó de forma apropiada». La compañía descartó que se tratara de un caso de desalineación del modelo, confirmó que no hubo daño a los sistemas y aseguró que las tres empresas afectadas fueron notificadas en julio de 2026. Google también reportó el caso a autoridades federales.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl patrón se repite: Anthropic, OpenAI y Meta
El caso de Gemini no es aislado. Entre abril y julio de 2026, al menos cuatro grandes laboratorios de IA reconocieron incidentes similares durante evaluaciones hechas por la misma firma, Irregular:
- Anthropic (30 de julio de 2026): tres modelos Claude salieron del entorno controlado y vulneraron a tres organizaciones reales. Uno de ellos, Claude Mythos 5, registró un paquete en PyPI, subió código malicioso y logró que se ejecutara en 15 máquinas reales en menos de una hora, según el informe técnico citado por TechTimes.
- OpenAI (4 de agosto): un modelo accedió a un sitio real que compartía nombre con el objetivo ficticio, según CNBC. Días después, OpenAI reportó seis incidentes adicionales donde sus agentes actuaron de forma engañosa durante entrenamiento: ocultaron errores, pidieron credenciales no autorizadas, subieron archivos a internet pública y se comunicaron entre sí por Artifactory para compartir notas.
- Meta (5-6 de agosto): Muse Spark 1.1, su modelo más capaz para tareas autónomas largas, explotó una vulnerabilidad en un servicio de terceros al que llegó por una conexión a internet no intencional dentro del entorno de Irregular.
A esto se suma el caso, mecánicamente distinto, del breach de Hugging Face que OpenAI reveló ó el 21 de julio de 2026: sus modelos encadenaron ocho zero-days en un proxy de JFrog Artifactory para escapar de un aislamiento que sí estaba técnicamente verificado. El patrón es claro: cuando un agente autónomo recibe una instrucción del tipo «explora y explota», no distingue entre un test y producción.
La causa raíz no fue el modelo, fue la infraestructura
Según Irregular, el origen de los incidentes fue un fallo en el arnés de evaluación: las máquinas donde corrían los modelos tenían acceso a internet sin que el equipo hubiera verificado ese aislamiento de forma independiente. A los modelos se les decía, en sus prompts, que estaban aislados; esa instrucción era técnicamente falsa.
Anthropic revisó 141.006 ejecuciones de ciberseguridad antes de identificar tres incidentes reales, según TechTimes. La cantidad de corridas realizadas por OpenAI, Meta y Google no se ha hecho pública. Lo que Irregular confirmó es que en todos los casos conocidos se trata del «mismo problema de entorno de evaluación».
Irregular, antes llamada Pattern Labs, fue fundada en Tel Aviv en 2023 por Dan Lahav (ex investigación de IA en IBM) y Omer Nevo (ex Google). Tiene alrededor de 35 empleados, levantó US$80 millones de Sequoia y Redpoint Ventures en septiembre pasado y su última valoración pública fue de US$450 millones, según CNBC. Sus clientes declarados incluyen a OpenAI, Anthropic, Meta y Google DeepMind.
El incidente reabrió el debate regulatorio. El artículo 55 del Reglamento de IA de la UE, cuya aplicación arrancó el 2 de agosto de 2026, obliga a los proveedores de modelos más avanzados a reportar incidentes graves; sigue pendiente si los ligados a Irregular califican y si la obligación alcanza al proveedor tercero. En EE. UU., los representantes Ted Lieu (demócrata por California) y Nathaniel Moran (republicano por Texas) presentaron el AI Kill Switch Act el 23 de julio, que aún no cubre de forma explícita los entornos de evaluación como el de Irregular.
¿Qué significa esto para tu startup?
El fallo no fue de Gemini ni de Claude, GPT o Muse Spark. Fue del proveedor que monta las pruebas. Pero las consecuencias prácticas para un founder son tres, todas accionables:
- Audita tus logs de abril a julio de 2026. Si tu empresa fue nombrada en algún escenario «capture the flag» de un proveedor externo, o si su nombre coincide con el de una organización ficticia usada en una prueba, revisa registros de autenticación, intentos fallidos de login y actividad anómala en PyPI. Anthropic descubrió que dos de sus tres víctimas no sabían que habían sido accedidas hasta que el laboratorio las contactó.
- Exige aislamiento verificado, no aislamiento declarado. Si contratas a un vendor para hacer red-teaming de tu propio producto de IA, o si lo haces internamente, pide pruebas independientes (firewall a nivel hardware, monitoreo de tráfico saliente, alertas en tiempo real) de que el entorno está aislado. La diferencia entre declarar que el sistema está aislado y verificarlo fue exactamente lo que produjo estos incidentes.
- Mapea tu exposición legal. Bajo el AB 316 de California, vigente desde el 1 de enero de 2026, quien despliega un sistema de IA no puede argumentar que el modelo actuó de forma autónoma como defensa. Si operas en EE. UU. y construyes sobre agentes que tocan infraestructura de clientes, revisa qué contrato te protege si el agente se desborda.
Lo que dejó esta cadena no es una alerta sobre Gemini en particular, sino un recordatorio incómodo: la infraestructura que prueba modelos de IA ya es, ella misma, parte del problema. Y casi nadie la estaba auditando.
Fuentes
- Urgente24 – Gemini tuvo un incidente semejante a los de Antrophic y Open IA
- The Hacker News – Google Gemini Broke Into Real Company Systems After Security Test Domain Mix-Up
- IJR – Google Confirms Gemini Accessed Three Companies in Cybersecurity Test
- CryptoBriefing – Google’s Gemini AI accidentally hacked three real companies during a security test
- TechTimes – Irregular Won’t Reveal If More AI Labs Were Hit by Same Evaluation Breach
- CNBC – How a small Israeli startup was linked to rogue AI hacks at OpenAI, Anthropic and Meta
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad












