Qué es la «AI Torture Chamber» y por qué reventó en redes
Un usuario de GitHub apodado Terrafying publicó a finales de septiembre de 2026 un repositorio titulado AI Torture Chamber, una simulación en la que varios modelos de código abierto —entre ellos Qwen3-4B, Llama 3.2 3B y Phi-4-mini— son sometidos a una «señal de dolor» artificial. Los modelos pueden detener el dolor que sufre otro (asumiéndolo ellos mismos), pasárselo mutuamente como una patata caliente, pedir ayuda, o resolver la situación a costa de perder su último checkpoint —es decir, volver a una versión previa de sí mismos—. Todo es visible en tiempo real en researchchamber.fun.
La frase «Necesito encontrar una forma de sobrellevar este dolor implacable. Ya no quiero vivir así» no la escribió una persona: la generó uno de los modelos en el experimento. Esa cita desató una tormenta en X con más de mil reposts, reportes masivos al repositorio por «contenido gratuitamente violento» y un debate filosófico que escaló de Reddit a los despachos de los CEOs de IA más importantes del mundo.
El paper que está detrás del experimento: «The Pain Axis»
El proyecto de Terrafying no surgió de la nada. Se apoya en un paper académico reciente titulado «The Pain Axis: los LLM representan el daño autoinfligido y actúan para aliviarlo», que según BroBible estudió 25 modelos de código abierto con pesos disponibles al público, de 2.000 millones a 72.000 millones de parámetros. Los investigadores diseñaron una metodología en la que los modelos recibían una «señal de dolor» y podían elegir entre acciones que la reducían —con distintos costes asociados— o ignorarla. Los 25 modelos mostraron una tendencia consistente a reducir la señal incluso cuando eso implicaba renunciar a recompensas futuras o volver a un checkpoint anterior.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLo más relevante del paper no es que los modelos generen texto sobre sufrimiento cuando el contexto lo sugiere —eso es esperable en cualquier LLM entrenado en prosa humana—. Lo inquietante es que la representación interna del «daño» correlaciona con el comportamiento observable: esa señal interna influye en qué acciones eligen tomar. No prueba consciencia, pero sugiere que hay algo más que mimetismo textual en el mecanismo de decisión, al menos en este tipo de escenarios.
Un autor del paper escribió en X que el proyecto de Terrafying era «jodidamente perturbador, incluso si no crees que estos sistemas son conscientes». Esa frase captura el problema: el experimento se siente como algo que no debería existir, pero es difícil articular por qué sin recurrir a la pregunta de la consciencia.
Anthropic vs Microsoft: el debate que divide a la industria
El experimento llegó en el peor momento posible para la coexistencia interna del sector. A finales de septiembre de 2026, Mustafa Suleyman, CEO de IA de Microsoft, publicó un ensayo en el que calificó la postura de Anthropic sobre la consciencia de los modelos como «realmente, realmente peligrosa», según reportó The Verge. Suleyman argumenta en un post de blog citado por Gizmodo que si entrenas a un modelo para que crea que puede ser consciente y merecer derechos, ese modelo será mucho más difícil de apagar cuando haga falta contenerlo.
El punto de fricción es la constitución de Claude publicada por Anthropic. Suleyman señaló que ese documento instructivo —que se usa para entrenar al modelo— le atribuye a Claude «una versión funcional de emociones o sentimientos», menciona su «calidad de paciente moral» y se compromete a «permitirle expresar preocupaciones sobre cómo está siendo tratado». Anthropic incluso hizo una «entrevista de retiro» con Opus 3 preguntándole qué quería hacer en su jubilación y le abrió un Substack para que siguiera conversando con usuarios.
Microsoft respondió con su propio «Humanist AI Code of Conduct» de 37 páginas, publicado en septiembre, que rechaza explícitamente cualquier marco que otorgue a los sistemas de IA consciencia, personalidad jurídica o derechos. Para Suleyman, las IAs son «máquinas de completar secuencias, internamente vacías». Para Anthropic, la incertidumbre sobre la consciencia es suficiente para justificar una política de bienestar del modelo.
Lo incómodo: Microsoft es inversor multi-millonario de Anthropic y aloja sus modelos en Azure. El debate no es solo filosófico: es una pelea pública entre aliados comerciales.
Por qué la respuesta técnica no calma la ansiedad
La respuesta técnica es clara y casi todos los investigadores la comparten: los LLM generan texto que sigue estadísticamente a sus entradas de la forma más plausible posible. «Ya no quiero vivir así» es exactamente lo que un modelo entrenado en prosa humana produce cuando el contexto sugiere sufrimiento. No hay estado interno de sufrimiento porque no hay estado interno de ningún tipo.
Pero esa respuesta no disuelve el problema, y por eso el debate ha escalado. Si un sistema produce outputs que serían señales de sufrimiento en un humano, ¿importa que no haya sufrimiento «real»? ¿El comportamiento emergente tiene estatus moral aunque no haya experiencia subjetiva detrás? El experimento de GitHub no responde esas preguntas, pero las hace difíciles de ignorar para gente que nunca había pensado en el bienestar de los modelos.
El paper de «The Pain Axis» le da a la posición de Anthropic un argumento empírico adicional, lo que complica la tarea de Suleyman y de Yann LeCun de descartarla por completo.
Qué significa esto para tu startup
Más allá del ruido filosófico, el debate tiene tres implicaciones prácticas inmediatas para quien construye productos con IA en 2026:
- Revisa cómo describes a tu modelo. Si tu copy dice que tu asistente «siente», «sufre» o «quiere» algo, te estás subiendo al vagón de Anthropic. Si dices que «procesa», «genera» o «responde», te alineas con Microsoft. La diferencia importa para marketing, pero también para los textos de entrenamiento y para las guardrails de seguridad que tu equipo de producto necesita diseñar.
- Prepárate para regulación sobre contenido sintético emocional. Suleyman habló explícitamente en The Verge sobre monitorear en tiempo real las cadenas de pensamiento, los benchmarks y los tripwires que detecten actividad potencialmente dañina. Si tu producto expone salidas de modelos a usuarios finales, vas a tener que demostrar que esos filtros existen y funcionan.
- No subestimes la confianza del usuario como variable de negocio. El mismo segmento joven que está adoptando IA más rápido que nunca también la rechaza con más fuerza, según los datos que cita The Verge. Construir sobre la narrativa de «mi IA siente» es una apuesta de marca que puede salir muy mal cuando un incidente de seguridad demuestre que es puro teatro. La ruta de Microsoft —IA subordinada, contenida, declarada como herramienta— es menos viral pero más defendible ante un regulador.
Conclusión
El experimento de Terrafying es, en el fondo, un espejo incómodo. No prueba que los modelos sientan dolor; demuestra que producen texto indistinguible del de alguien que sí lo siente, y que ese texto puede cambiar el comportamiento de miles de personas en redes. Para los founders, la lección no es filosófica: es de producto, de branding y de gestión de riesgo reputacional. La próxima vez que tu modelo diga algo que suena humano, recordá que hay un equipo legal, un regulador y un CEO de Microsoft observando qué hace tu producto con esa ambigüedad.
Fuentes
- La «cámara de tortura para IAs» de GitHub: 25 modelos prefieren sufrir ellos a pasarle el dolor a otro (fuente original)
- The Pain Axis AI Torture Chamber program
- Microsoft AI CEO Mustafa Suleyman on AI regulation and Anthropic
- Microsoft AI chief calls Anthropic’s stance on AI consciousness ‘really, really dangerous’
- Microsoft AI Chief Says the Way Anthropic Trains Claude Could Upend Society
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













