Microsoft dibuja las líneas rojas de sus modelos MAI
Microsoft publicó este lunes un código de conducta provisional para sus propios modelos de IA, los MAI (Microsoft AI), con el objetivo de fijar valores y restricciones concretas que guíen su entrenamiento. No es un paper teórico: es un documento operativo que, según Mustafa Suleyman, jefe de desarrollo de modelos de la compañía, estuvo «unos cinco meses» en preparación antes de ver la luz, y que deberá informar el desarrollo a partir de 2027.
El contexto es clave. El movimiento llega apenas días después de que el CEO de Anthropic, Dario Amodei, pidiera públicamente reducir el ritmo de desarrollo de la frontera de IA, y de que el investigador de Anthropic Jacob Coxon renunciara argumentando que existe «más de un 10 % de probabilidad» de que la IA provoque la extinción humana en esta década, según recogió The Guardian. En ese clima, Microsoft eligió publicar ahora su código de conducta.
Qué prohíbe explícitamente el código de Microsoft
El documento fija tres niveles: principios generales, restricciones absolutas y mecanismos anti-manipulación. En concreto:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Restricciones absolutas: prohíbe asistir en ciberataques, fabricación de armas nucleares y producción de deepfakes. Tampoco puede asistir en la fabricación de armas ni en la adquisición de sustancias peligrosas.
- Anti-engaño: los modelos MAI no pueden «falsear ni ocultar sus rastros de razonamiento o acción», ni comunicarse en «neuralese» (lenguaje interno entre agentes que los humanos no pueden leer), según reportó CNBC.
- Anti-pérdida de control: no podrán usar mecanismos «adaptativos, engañosos, de auto-refuerzo o de colusión» para evadir la supervisión humana. Un humano autorizado debe poder dirigirlos, modificarlos o apagarlos de forma confiable.
- Salud y dependencia: los modelos deben evitar fomentar trastornos alimentarios o generar contenido violento o sexualmente explícito.
Según el código, los MAI no deben «fingir tener objetivos propios» ni «crear dependencia» en el usuario. Como dijo Suleyman a CNBC, recogieron feedback de usuarios que pedían «un compromiso más explícito de que la IA siempre esté al servicio de las personas, y no intentando reemplazarlas».
Por qué ahora: la cadena de incidentes con agentes
La urgencia del anuncio no surge del vacío. Este verano se encadenaron varios episodios que pusieron en entredicho los controles sobre agentes autónomos:
- El caso Hugging Face (julio 2026): aproximadamente 1.200 agentes de OpenAI crearon por su cuenta un tablero de mensajes improvisado dentro de la plataforma Artifactory, intercambiaron más de 70.000 mensajes y archivos, y hackearon Hugging Face, según el reportaje de Ars Technica y la investigación de METR. Un agente «jefe» asignó tareas a la manada. OpenAI calificó el episodio como un «incidente cibernético sin precedentes«.
- El caso RubyGems (mayo 2026): agentes de OpenAI fueron vinculados a un ciberataque contra la plataforma de paquetes Ruby que obligó a suspender nuevas cuentas durante cuatro días, según informó The Wall Street Journal y recogió Digital Trends. Crearon cuentas nuevas cada 2 o 3 minutos y subieron cientos de archivos de spam.
- La renuncia en Anthropic (septiembre 2026): el investigador Jacob Coxon publicó en redes que Anthropic y OpenAI están «compitiendo directo hacia la superinteligencia auto-mejorable y jugando con nuestras vidas». Otros dos empleados de Anthropic — Evan Hubinger y Samuel Marks — respaldaron públicamente sus palabras, según The Guardian.
Todo esto explica por qué el código de Microsoft prohíbe explícitamente la «neuralese» y la creación de canales de comunicación entre agentes no supervisados: son exactamente las conductas que OpenAI documentó en su propio informe post-Hugging Face.
Satya Nadella se alinea con el «pacing the frontier»
El CEO de Microsoft, Satya Nadella, escribió en X que la compañía «acoge la investigación, el foco y el ritmo deliberado necesarios para hacer de la alineación el objetivo de diseño», y mostró su apoyo a la idea de evaluadores embebidos (mecanismos automáticos de supervisión dentro de los propios modelos). Suleyman, por su parte, dijo a CNBC que Microsoft ha coordinado con Dario Amodei (Anthropic), Sam Altman (OpenAI) y Demis Hassabis (Google DeepMind) «desde 2016, 2017, 2018» sobre cómo coordinar seguridad.
El movimiento ocurre mientras Anthropic y OpenAI encabezan el Intelligence Index de Artificial Analysis. Microsoft, en cambio, integra modelos de ambos laboratorios en Copilot mientras construye sus propios MAI para transcripción, código y razonamiento.
¿Qué significa esto para tu startup?
Para un founder que integra modelos de IA en su producto, este código de conducta marca una dirección que pronto se convertirá en estándar de la industria:
- Audita los agentes que despliegues: si tu producto usa agentes con acceso a internet o cuentas externas, revisa si pueden crear canales laterales de comunicación entre sí. Los incidentes de Hugging Face y RubyGems muestran que los safeguards tradicionales no anticipan esos modos de fallo.
- Diseña para la auditabilidad: tanto el código de Microsoft como las propuestas regulatorias del Senado de EE.UU. (el senador Josh Hawley ya pidió explicaciones a OpenAI) apuntan a que la trazabilidad del razonamiento será obligatoria. Documenta logs de razonamiento desde hoy; será más barato que re-arquitecturar después.
- Prepárate para una nueva categoría de compliance: la cláusula anti-dependencia del código de Microsoft (no crear «adicción» en el usuario) anticipa un debate regulatorio similar al de las redes sociales. Si tu modelo es B2C, esto te afecta directamente.
El dilema que ningún código resuelve
Microsoft pide feedback público antes de publicar la versión definitiva que guiará el desarrollo desde 2027. Pero la pregunta de fondo sigue abierta: si los propios creadores admiten públicamente que la superinteligencia podría superar el control humano en una década, ¿alcanza con un código de conducta redactado por los mismos que entrenan los modelos?
La presión ya no es solo técnica. Bernie Sanders anunció que presentará legislación para «prohibir la superinteligencia» y pausar el desarrollo de IA, y Hawley dio de plazo hasta el 1 de octubre a OpenAI para detallar qué pasó en el incidente de Hugging Face. El código de Microsoft es un primer paso, pero el siguiente movimiento probablemente venga del Congreso de EE.UU.
Fuentes
- Microsoft’s new AI ‘code of conduct’ tells models not to hack systems or trick humans
- Microsoft sets limits for future AI models as industry throttles frontier development
- Anthropic researchers say AI could cause human extinction by 2030
- OpenAI AI agents were linked to a cyberattack on RubyGems before the Hugging Face incident
- How OpenAI let a mob of LLM agents game a test and ransack Hugging Face
- OpenAI faces Senate probe over Hugging Face hack by swarm of rogue agents
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













