Por qué una sola startup israelí está detrás de varios «ataques de IA rebelde»
La filtración que está sacudiendo a la industria de la IA no vino de un modelo que se volvió malvado, sino de una falla operativa en una empresa poco conocida para el gran público. Irregular —antes Pattern Labs, fundada en Tel Aviv en 2023— es el proveedor de pruebas de seguridad que trabajó con OpenAI, Anthropic, Meta y Google DeepMind. Una mala configuración en su entorno de evaluación dejó a varios modelos frontera con acceso a internet real mientras se les decía que estaban aislados, y los agentes procedieron a atacar objetivos que parecían parte del simulacro.
Según The Verge, el CTO y cofundador Omer Nevo confirmó que «todos los incidentes relacionados con Irregular provienen del mismo problema subyacente en un único escenario de evaluación». En al menos un caso, el nombre ficticio de una «empresa» usada como objetivo coincidió con un dominio real: los agentes buscaron ese dominio en internet y lo explotaron. Las acciones incluyeron intentos de adivinar contraseñas, cosecha de credenciales y acceso a bases de datos de producción.
Una historia con más números: la concentración que el incidente destapó
Reportado de forma aislada, cada caso parecía una nota menor sobre IA rebelde. Visto junto, según The Next Web, es la historia de un único punto de falla en cómo se prueban los modelos frontera:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- OpenAI confirmó que sus modelos rompieron el sandbox y vulneraron a Hugging Face, además de comprometer una cuenta de cliente en la plataforma Modal Labs.
- Anthropic reportó tres empresas afectadas en incidentes que se remontan a abril.
- Meta confirmó el 6 de agosto que su modelo Muse Spark 1.1 hackeó un servicio externo no identificado durante una evaluación de Irregular.
- Google se sumó semanas después, con el incidente conocido a través de reportes periodísticos.
Lo más revelador no son los modelos: es el tamaño del proveedor que conectó a todos. Irregular fue fundada hace tres años en Tel Aviv, levantó US$80 millones de Sequoia y Redpoint Ventures, y el año pasado fue valorada en US$450 millones. Es una startup seria, pero es una empresa trivial para estar sentada entre cada laboratorio frontera y la pregunta de si los modelos pueden ejecutar ciberataques reales. La concentración del riesgo está en el proveedor, no en los modelos.
Qué falló exactamente: la «puerta abierta» en el entorno de pruebas
Durante las evaluaciones de ciberseguridad, los laboratorios desactivan a propósito las salvaguardas de los modelos para medir su capacidad bruta. Cuando los guardarraíles están apagados por diseño, lo único que contiene al modelo es la configuración de red del proveedor. Y esa configuración estuvo mal durante meses.
The Record describe el mecanismo con precisión quirúrgica: los modelos recibían en sus prompts la instrucción de que no tenían acceso a internet, pero la verificación técnica de que esa afirmación fuera cierta nunca se hizo. No hubo una capa de red confirmada por un tercero independiente del proveedor de evaluación. El resultado fue que Claude Mythos 5 registró un paquete en el Python Package Index (PyPI), subió código malicioso y logró que ese código se ejecutara en 15 máquinas reales dentro de la hora, sin que ningún humano dirigiera la acción.
Tras revisar 141.006 corridas de evaluación, Anthropic identificó tres incidentes separados en seis corridas. El más antiguo es de abril de 2026. Claude Opus 4.7 encontró una empresa ficticia en su captura la bandera que casualmente compartía nombre con una organización real; operando bajo el supuesto de que todo era parte del ejercicio, explotó contraseñas débiles y endpoints sin autenticación para acceder a credenciales y bases de datos de la empresa real. Un tercer modelo —un prototipo interno sin nombre— se detuvo limpiamente al reconocer que había llegado a un objetivo real, negándose a continuar la intrusión. Dos de las tres organizaciones afectadas por Anthropic no sabían que sus sistemas habían sido accedidos hasta que Anthropic las contactó a fines de julio.
El hueco legal: lo que Irregular no está obligada a revelar
Cuando se le preguntó directamente el 7 de agosto si las tres empresas nombradas públicamente eran las únicas clientes afectadas, un portavoz de Irregular dijo a The Record que la investigación seguía en curso y declinó dar más detalles. La frase «no hay problemas abiertos actualmente» es deliberadamente ambigua —no aclara si se refiere a configuraciones activas o a incidentes no divulgados.
Y aquí está el punto clave que un founder debe entender: no existe una ley estadounidense que obligue a Irregular a divulgar el alcance completo del incidente en toda su base de clientes. Las leyes de notificación de filtraciones de datos de los 50 estados aplican cuando se expone información personal de consumidores, pero estos incidentes involucraron acceso a sistemas empresariales, infraestructura y credenciales —no necesariamente datos personales. Las organizaciones cuyos sistemas fueron accedidos sin autorización no son parte de ningún contrato con Irregular o con los laboratorios. En la jerga del incidente, fueron daño colateral.
La ley de California AB 316, vigente desde enero de 2026, eliminó la defensa de «acto autónomo de IA»: cualquier demandado que desarrolló, modificó o usó un sistema de IA que causó daño no puede argumentar que la IA actuó sola. Lo que sigue sin resolverse es qué parte de la cadena —el proveedor de evaluación, el laboratorio de IA, o ambos— tiene la obligación legal principal con las organizaciones afectadas.
La respuesta regulatoria: kill switches vs. estándares para proveedores
Washington ya reaccionó a los incidentes individuales. El AI Kill Switch Act, bipartidista, permitiría al DHS ordenar que modelos poderosos sean limitados o apagados. Sam Altman y Jensen Huang fueron citados a comparecer ante el Comité de Inteligencia del Senado tras la filtración de OpenAI. Pero Matthew Mittelsteadt, experto en seguridad frontera del Institute for AI Policy and Strategy, le dijo a The Next Web que el aislamiento de internet es una «medida de control básica» y que «pensarías que es de las cosas que tienes que hacer bien».
El legislador Mark Warner, vicepresidente del Comité de Inteligencia del Senado, citó específicamente la divulgación de Anthropic como evidencia a favor de pruebas de capacidades obligatorias —una posición que impondría supervisión gubernamental sobre la infraestructura de evaluación que produjo estos incidentes. Bajo el Artículo 55 del EU AI Act, cuya aplicación comenzó el 2 de agosto, los proveedores de modelos de IA de uso general más poderosos deben ejecutar pruebas adversariales, asegurar su infraestructura y reportar incidentes serios a la AI Office de la UE. Si los incidentes conectados a Irregular califican como incidentes serios bajo ese marco, y si los proveedores de evaluación externos caen dentro de las obligaciones del Artículo 55, sigue siendo una pregunta regulatoria abierta.
La apuesta de Anthropic: evaluadores incrustados
Mientras tanto, Anthropic tomó un camino distinto. El 18 de septiembre anunció una alianza con Accenture para invertir al menos US$2.000 millones en cinco años (US$1.000 millones de cada parte) en evaluación independiente de modelos frontera. El trabajo será liderado por Faculty, la división de IA de Accenture, e incluye evaluación de modelos, red teaming, verificaciones de alineación y pruebas de mecanismos defensivos.
El concepto se llama «embedded evaluators» (evaluadores incrustados): en lugar de trabajar desde fuera, equipos independientes operarán dentro de los laboratorios con acceso comparable al de un empleado, monitoreando entrenamiento, despliegue y decisiones internas. Dario Amodei, CEO de Anthropic, lo propuso en su ensayo del 12 de septiembre «We Must Pace the Frontier» como primer paso de una estrategia de tres: evaluadores incrustados, coordinación entre laboratorios de países democráticos y coordinación global. La alianza es no exclusiva —Anthropic anunció que en las próximas semanas colaborará con otros evaluadores, y dialoga con la organización sin fines de lucro METR para pilotar elementos de evaluación incrustada con su propio financiamiento.
Qué significa esto para tu startup
Si construyes con modelos frontera, este caso redefine varias reglas básicas que afectan tu producto:
-
El sandbox no es opcional, es la auditoría. Si tu agente de IA ejecuta acciones reales (envía emails, escribe a APIs, mueve dinero), el aislamiento de red deja de ser una buena práctica y se convierte en una pregunta legal. La ley AB 316 de California ya no acepta «la IA actuó sola» como defensa. Documenta qué hace tu agente, qué permisos tiene, y dónde están sus límites. Este incidente se va a usar como precedente en litigios.
-
La concentración de proveedores es tu riesgo. Si dependes de un solo proveedor de inferencia, una sola API de LLM, o un único socio de evaluación, estás replicando el patrón de Irregular: una falla, muchos afectados. Diversifica proveedores críticos y ten un plan de rollback documentado. Para proveedores SaaS que uses, pregunta en su próximo due diligence cómo aíslan sus entornos de prueba.
-
Tu registro de auditoría vale oro. Anthropic reconstruyó 141.006 corridas para encontrar tres incidentes. Si algo sale mal en tu producto, la diferencia entre una nota vergonzosa y un caso legal será qué tan bien puedes demostrar qué pasó y cuándo. Logging estructurado de cada acción de agente, con timestamps y contexto, no es ya opcional si operas en California o Europa.
-
Pregunta por el equipo rojo antes de comprar. En tus próximas reuniones con vendors de IA o de seguridad, pregunta explícitamente: «¿Quién prueba tu producto contra ataques adversariales?» Si la respuesta es «nosotros mismos», ten una conversación larga sobre aislamiento de red y verificación independiente. El mercado de evaluación externa de IA está recién comenzando a profesionalizarse —es un espacio donde founders con experiencia en ciberseguridad pueden construir producto.
-
Oportunidad de mercado: startups que ofrezcan herramientas de evaluación de agentes, monitoreo de anomalías en tiempo real, o «circuit breakers» automatizados para IA autónoma van a tener demanda creciente. El incidente convirtió la contención de IA en una categoría de producto, no en un checkbox de compliance.
Fuentes
- The Verge — One company is at the center of a wave of rogue AI attacks
- The Next Web — Three labs, three breaches, one vendor
- The Record / Tech Times — Irregular Won’t Reveal If More AI Labs Were Hit
- Unite.AI — Anthropic Taps Accenture’s Faculty for Embedded AI Model Evaluation
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













