Qué es SlopShape y por qué importa para el contenido digital
Detectar si un texto lo escribió una persona o un modelo de lenguaje se ha vuelto una de las tareas más rentables —y más frustrantes— del ecosistema tech. El investigador Jochen Madler acaba de publicar el estudio SlopShape, un sistema que, según sus pruebas, distingue escritura humana de escritura IA con un macro F1 cercano al 98%. La cifra supera con holgura a detectores comerciales que llevan meses en el mercado y que, como recuerda Xataka, fallan más que acertaban al calificar textos.
El detalle clave es metodológico: SlopShape no "lee" el texto y emite un veredicto. En su lugar, un modelo de lenguaje responde un cuestionario de más de 200 preguntas sobre cómo está construido el texto. Esa es la diferencia que puede importar a un equipo de contenido o a una redacción: en lugar de mirar palabras sueltas, analiza la arquitectura del discurso.
Cómo funciona el detector de IA según Madler
Lo que SlopShape rastrea es la "forma del slop" —de ahí su título—. El sistema se enfoca en cinco dimensiones del texto, según resume Xataka, por las que un LLM deja huella sin importar el tema:
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días- El orden de las ideas y si el artículo anuncia su estructura por adelantado.
- La posición de la tesis: muchos textos IA la presentan en el primer párrafo y luego la repiten al final.
- Cómo se citan las fuentes: a menudo con afirmaciones genéricas o sin atribución directa.
- La orientación práctica: la típica estructura de "definición, ventajas, pasos, errores y recomendaciones".
- El cierre: conclusión que parafrasea la idea ya anunciada en la introducción.
El conjunto de esos rasgos —no uno aislado— es lo que el sistema aprende a detectar. Es un enfoque estructural porque ataca la forma en lugar del vocabulario, lo que lo hace más resistente a paraphrasing simple.
El experimento: 11.250 textos bajo la lupa
Para entrenar y validar el detector, Madler reunió 2.250 posts de blogs de 268 medios de comunicación, todos anteriores al lanzamiento del propio chatGPT y recuperados desde Wayback Machine. Luego pidió a cinco modelos que escribieran su propia versión a partir de un resumen de cada post original.
Los modelos usados fueron GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 y Kimi K2.5, todos frontier frontier. El resultado fueron 11.250 versiones —los originales humanos más las reescrituras de cada modelo, escritas y vueltas a reescribir— para probar desde cambios menores hasta reescrituras profundas.
Los números que reporta el estudio:
- 97–98% de macro F1 en la clasificación IA vs. humano, una métrica que combina precisión y cobertura.
- El score bajó a 88,1 solo cuando se modificaron características explícitas de estilo.
- En el 79% de los casos, el sistema identificó además qué modelo había escrito cada texto por los "dejes" de cada uno.
Limitaciones: solo inglés y el peso de los datos previos a ChatGPT
Madler es transparente con los caveats. Los artículos del estudio están en inglés, así que los patrones no se pueden extrapolar directamente al español u otros idiomas. Y los posts originales provienen de redacciones y agencias de comunicación que ya usaban estructuras corporativas parecidas —es decir, el "estilo IA" que detecta el sistema es también un estilo heredado del entrenamiento de los propios modelos.
En palabras de Xataka, "que se cumplan estos rasgos no demuestra que un texto lo haya escrito una IA"; significa que el texto encaja con un patrón aprendible. Es la diferencia entre probabilidad y prueba, algo clave cuando un detector se usa en un proceso editorial, académico o de compliance.
Qué significa esto para tu startup
Si publicas contenido a gran escala —posts de SEO, newsletters, descripciones de producto, contenido generado por tu equipo de marketing— SlopShape apunta a un problema operativo concreto: los detectores actuales de plumas de LLM ya no son suficiente. Para un founder, esto tiene tres implicaciones prácticas.
Acciones concretas que puedes tomar esta semana:
- Audita tu pipeline de contenido con tu equipo. Pasa tus últimos 20 posts por un detector comercial (GPTZero, ZeroGPT, Copyleaks) y compara resultados. La inconsistencia entre herramientas ya es una señal: si tu contenido limpio dispara falsos positivos, tienes un problema de estilo —no de honestidad— que va a escalar.
- Diversifica la firma editorial con tu equipo. Textos donde la tesis aparece al inicio y se parafrasea al final, con bullet points de apartados y listas equilibradas de pros y contras, son los que más disparan los detectores según SlopShape. Reescribir esa plantilla —mover la tesis al final, romper la simetría pros/contras, citar fuentes con nombre y fecha— reduce la huella sin sacrificar calidad.
- Documenta el rol humano en tu proceso editorial. Para clientes B2B, agencias o medios, un proceso donde se muestre el prompt usado, la edición humana y las fuentes consultadas empieza a ser un activo de confianza. OpenAI lanzó por separado un sistema de marcas de agua para textos; tu trazabilidad interna puede ser tu ventaja mientras esa infraestructura madura.
Contexto: detectores y marcas de agua en 2026
SlopShape no llega solo. El 5 de octubre de 2026, la propia OpenAI anunció el despliegue progresivo de textGrain, una tecnología de marca de agua invisible para textos generados por sus modelos. Según reporta Unite.AI, la herramienta se ofrece como opt-in para clientes de API a nivel global y se activa por defecto solo en la Unión Europea, en cumplimiento del artículo 50 del Reglamento de IA de la UE, aplicable desde el 2 de agosto de 2026.
Las cifras que OpenAI publica sobre textGrain dan una idea del techo realista: a una tasa de falso positivo del 1%, el detector identifica la marca en cerca del 80% de los pasajes de 200 tokens y del 95% en los de 400 tokens. Si se reemplaza el 10% de las palabras por sinónimos, la detección cae del 92% al 66%; si se reemplaza el 25%, baja al 17%. La marca de agua es útil como señal, no como veredicto.
En el frente académico, un equipo de Princess Sumaya University for Technology (Jordania) presentó en Neural Computing and Applications el sistema AISciDetector, que combina BigBird con una arquitectura CNN-BiLSTM y reporta un 91,5% de accuracy y 91,49% de F1-score sobre textos científicos generados por ChatGPT, Gemini y LLaMA-3, según recoge Bioengineer.org. Es la misma familia de problemas que ataca SlopShape, pero sobre prosa científica.
Tres líneas convergen: detectores estructurales como SlopShape, marcas de agua como textGrain y detectores de dominio como AISciDetector. Ninguno zanja el debate; los tres lo industrializan.
Conclusión
SlopShape no es la herramienta definitiva contra el texto sintético —su creador lo admite y los datos lo respaldan: 88,1% cuando se manipula el estilo, pruebas solo en inglés, dependencia del tipo de redacción original—. Pero es la evidencia más reciente de que detectar IA ya no es un problema de vocabulario: es un problema de arquitectura textual.
Para un founder, la pregunta ya no es "¿me van a pillar usando IA?" sino "¿estoy publicando contenido con la estructura que cualquier detector —de aquí a dos años— va a marcar como sospechoso?". La respuesta está en editar como editor, no como prompt.
Fuentes
- Alguien ha entrenado un modelo IA para detectar textos escritos con IA y dice detectarlos con un 98% de precisión — Xataka
- New AI Detector Spots Machine-Written Science Papers With 91.5% Accuracy — Bioengineer.org
- OpenAI Begins Phased Text Watermarking Under EU AI Act Rules — Unite.AI
- ChatGPT users, your AI-written text will soon carry a hidden watermark — Android Authority
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días













