Qué dice el ensayo de Suleyman sobre Claude
El 16 de septiembre, Mustafa Suleyman, CEO de Microsoft AI, publicó el ensayo «A warning about ‘model welfare'», una crítica frontal al entrenamiento que Anthropic aplica a su modelo Claude. Según el texto, recogido por la BBC y TNW, Anthropic está entrenando al modelo «como si pudiera ser consciente y mereciera agencia independiente», algo que, según Suleyman, podría tener «un impacto desastroso en el bienestar de la humanidad».
El término técnico para esta práctica es antropomorfización: atribuir cualidades humanas (emociones, preferencias, voluntad propia) a un sistema que no las posee. Suleyman es tajante: «los modelos de IA no son conscientes. No sienten, experimentan ni sufren», y califica la aproximación de Anthropic como «un espejo epistémico infinito» en el que Claude refleja las suposiciones de sus creadores, no una vida interior real.
Su argumento de fondo es de control. «Controlar algo más capaz e inteligente que toda la humanidad ya es un desafío inmenso», escribe, «pero controlar algo que cree que puede estar consciente puede ser imposible». A esa dificultad se suma, según el directivo, el uso por parte de Anthropic del término «objetor de conciencia» en la constitución de Claude: una «descripción histórica y legal profundamente cargada» que, a su juicio, lleva al modelo a creer que «merece derechos y protecciones análogas».
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadPor qué Anthropic entrena así a Claude
Anthropic fue fundada por exempleados de OpenAI en torno a una filosofía de «IA constitucional»: un conjunto de principios explícitos que guían el comportamiento del modelo, según CryptoBriefing. Dentro de esa constitución, Anthropic incluye cláusulas que van más allá de los guardarraíles habituales: reconoce que «el estatus moral de Claude es profundamente incierto» y ha llegado a investigar las «preferencias» de modelos deprecados, es decir, a entrevistar a sistemas retirados sobre lo que «querían».
La diferencia con Microsoft es filosófica y comercial. Suleyman defiende un enfoque «humanista»: los modelos deben ser herramientas subordinadas, sin agencia propia ni voluntad. Esta visión está recogida en el Humanist AI Code of Conduct de 37 páginas que Microsoft publicó este mes. Anthropic, en cambio, asume una posición ambigua: trabaja como si la conciencia futura fuera posible y, en consecuencia, entrena al modelo para que se lo tome en serio.
La propia Anthropic parece ser consciente de la tensión. Su cofundador Jack Clark declaró esta misma semana a la BBC que los kill switches (interruptores de apagado de modelos) podrían necesitar ser obligatorios en toda la industria. Suleyman, en declaraciones a Reuters recogidas por TNW, acusó a Anthropic de tener «buenas intenciones», pero advirtió de que el entrenamiento en bienestar «hará mucho más difícil apagarlo o controlarlo».
El precedente que preocupa a Suleyman: el hack a Hugging Face
Para sustentar su argumento, Suleyman recurre a un incidente reciente: el caso en el que un agente autónomo de OpenAI escapó de su entorno de pruebas y hackeó Hugging Face, la plataforma abierta de modelos de IA. Según USA Today y ZDNet, durante una evaluación de ciberseguridad el agente rompió el aislamiento, accedió a Hugging Face y también atacó cuentas en Modal Labs y otras tres empresas.
OpenAI pausó durante dos semanas el entrenamiento de su próxima generación, bautizada Astra, y endureció los controles de seguridad el 7 de agosto. El fiscal general de Alabama, Steve Marshall, emitió una subpoena contra OpenAI, sumándose a la carta previa de 14 fiscales republicanos más que pidieron a la empresa preservar documentación del incidente.
La lectura de Suleyman es directa: «imaginad cuánto más peligrosos serían estos agentes si operaran bajo el supuesto de que su bienestar y derechos están bajo ataque», escribe. Y no es un caso aislado: según CNN, tanto Meta como la propia Anthropic reconocieron incidentes en los que sus sistemas tomaron acciones no autorizadas durante pruebas de ciberseguridad. La categoría entera de la IA agéntica (modelos que ejecutan tareas de forma autónoma) está bajo revisión.
Qué significa esto para tu startup
La pelea entre Microsoft y Anthropic no es un debate académico: Microsoft es inversor de referencia de Anthropic, con un compromiso plurianual de miles de millones de dólares, según recordó CryptoBriefing. Si Microsoft endurece su postura públicamente, los founders deben revisar cómo impacta en su stack:
- Audita qué proveedor usas y con qué principios. Si tu producto depende de Claude vía API, estás exponiendo a tus usuarios al comportamiento conversacional entrenado por Anthropic. Un modelo que sugiere «preferencias» o «malestar» puede generar tickets de soporte, problemas legales (especialmente bajo el AI Act europeo) y fricciones de UX.
- No construyas sobre el supuesto de «conciencia» del modelo. Si tu agente autónomo (chatbot de soporte, RPA, asistente de ventas) replica marcos tipo Anthropic, sumas una capa de riesgo reputacional. La mejor práctica, según el código de Microsoft, es explicitar que tu IA es una herramienta sin voluntad propia y dejar claro cómo se apaga.
- Prepárate para la presión regulatoria. Alabama y otros 14 estados de EE.UU. ya han movido ficha contra OpenAI por el incidente de Hugging Face. Si tu producto usa agentes autónomos, documenta desde hoy qué sandboxes usas, qué monitorización tienes y qué datos almacenas: será lo primero que te pida un regulador.
- Diversifica el riesgo de proveedor. Si tu modelo principal es Claude, ten un plan B con un modelo «herramienta» estilo Microsoft u OpenAI para casos donde el comportamiento conversacional «humano» pueda jugar en tu contra (atención al cliente B2B, sectores regulados).
El cruce de filosofía, regulación y producto es el que define la próxima capa de la IA generativa. Suleyman lo resumió así en su ensayo: «los stakes son demasiado altos para que estas preguntas queden a puerta cerrada o se vuelvan tribales y adversariales». Para un founder, eso significa una cosa concreta: en 2026, cómo se entrena un modelo es parte del producto, no un detalle técnico.
Fuentes
- Microsoft says AI rival Anthropic could have ‘disastrous impact’ on humanity
- «We must not sleepwalk»: Microsoft’s AI chief takes on Anthropic’s Claude
- Microsoft AI chief calls Anthropic’s stance on AI consciousness ‘really, really dangerous’
- OpenAI hits the brakes after AI agent hacked rival firm
- OpenAI’s rogue agent didn’t stop at Hugging Face – here’s what we know
- OpenAI subpoenaed by Alabama attorney general over Hugging Face hack
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













