Microsoft: scraping de noticias, «el mayor robo laboral»

El documento interno que sacude la defensa de Microsoft y OpenAI

Un documento judicial desclasificado el 17 de septiembre de 2026 por los demandantes del caso New York Times vs. OpenAI y Microsoft expone frases atribuidas al director de Applied Science de Microsoft, Brent Hecht, en las que el scraping de noticias para entrenar IA se describe como un "asombroso robo de proporciones sin precedentes" y posiblemente "el mayor robo de mano de obra en la historia humana". El texto, parte de una moción de summary judgment, contradice frontalmente la defensa de uso legítimo (fair use) que ambas tecnológicas han sostenido en los tribunales durante casi tres años. Ars Technica tuvo acceso al PDF del escrito y publicó las citas verbatim.

Lo que vuelve a este capítulo especialmente dañino para la defensa no es solo el lenguaje, sino quién lo firma: un científico aplicado de Microsoft describiendo el "doom loop", el círculo vicioso en el que los propios modelos de lenguaje terminan devorando a los medios que producen la información con la que fueron entrenados.

Qué dice el documento interno de Microsoft

El escrito de los demandantes recoge varias comunicaciones internas que, según ellos, prueban que Microsoft y OpenAI anticiparon el daño a los medios antes de lanzar ChatGPT y Copilot:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Brent Hecht (Microsoft, Director of Applied Science) escribió que el scraping masivo de noticias hacía "una completa burla de la idea de fair use".
  • Un documento interno de Microsoft reconoció que era "muy inusual que un producto final amenace las bases económicas de sus proveedores esenciales", en referencia al periodismo.
  • Otro documento describió el riesgo de un "doom loop" que "perjudicará el rendimiento de nuestros modelos y de toda la web al mismo tiempo".

En paralelo, mensajes internos de OpenAI muestran que el jefe de ChatGPT, Nick Turley, ya había alertado de que los editores enfrentarían una "amenaza existencial" por productos comerciales entrenados con su contenido que pueden sustituir a los propios medios. Un ingeniero de software de OpenAI llegó a admitir que "no importa cuán prominentemente mostremos los enlaces, los usuarios no harán clic".

La caída de tráfico que los números internos ya mostraban

El propio expediente de las tecnológicas registra el impacto cuantificado del que habla el caso:

  • Microsoft documentó caídas de 83% a 93% en tasas de clic para algunos demandantes, y de 51% a 94% para otros.
  • Datos internos de OpenAI confirman tasas de clic bajas en resultados de búsqueda de ChatGPT.
  • Comunicados de medios de noticias corroboran caídas de tráfico sostenidas durante el período de despliegue de los chatbots.

El CEO de Microsoft, Satya Nadella, declaró bajo juramento que las empresas de IA no deberían saltarse los términos de uso de los sitios saltándose sus paywalls. Su testimonio admitió implícitamente la sustitución: describió al chatbot como alguien que "te da la información ahí mismo en la plataforma de IA en vez de necesitar ir a la fuente original". Según el escrito, el presidente de OpenAI, Greg Brockman, respondió "Ah, nice" cuando un empleado, Nick Ryder, le informó de un hack para que los crawlers de OpenAI sortearan el paywall del New York Times.

Por qué importa a un founder fuera del sector periodístico

El caso NYT vs. OpenAI ya dejó hace meses de ser un litigio entre medios y tecnológicas. CryptoBriefing reportó que 160 medios regionales se sumaron a la demanda en septiembre de 2026, y que el Departamento de Justicia de EE.UU. presentó un escrito apoyando la defensa de fair use de OpenAI, lo que añade una dimensión regulatoria federal al conflicto. Silicon Review, por su parte, documentó que The Seattle Times y Newsday acaban de presentar una nueva demanda pidiendo no solo daños sino la "destrucción" de los modelos entrenados con su contenido. Si esa medida prospera, los precedentes afectan a cualquier modelo entrenado con material bajo disputa.

Para un fundador hispanohablante de SaaS, edtech, healthtech o IA aplicada, la pregunta ya no es abstracta. Tres implicaciones prácticas:

  • Si entrenas modelos propios, la auditoría de procedencia de datos deja de ser nice-to-have y se vuelve un riesgo legal directo. Las desarrolladoras chinas, indias y de Europa del Este con frecuencia scrapean agregadores de noticias en español sin verificar licencias: el caso sienta un precedente de cómo se mide la "transformative use".
  • Si dependes de la IA para contenido de marketing, resúmenes o SEO, los chatbots están absorbiendo tráfico que antes iba a tu sitio. Estudios sobre AI Overviews de Google citados por NPR documentan caídas comparables, lo que significa que la tendencia no depende solo de ChatGPT: es estructural.
  • Si vendes a medios o editas contenido de terceros, el modelo de licenciamiento va a cambiar. Ya hay indicios de acuerdos individuales entre grandes editores y las big tech; el resto del ecosistema quedará negociando en desventaja si no se agrupa.

Las grietas de la defensa de fair use

Microsoft intentó neutralizar las citas de Hecht asegurando a Ars Technica que esos documentos "reflejan la perspectiva individual de un empleado, no son un análisis legal y no representan la visión de la empresa". El comunicado defendió sus productos de IA como un "uso legítimo transformador" que no sustituye a los sitios de noticias. La posición legal sostiene que entrenar modelos con contenido con copyright es comparable al uso que un investigador hace de documentos para producir un trabajo nuevo.

Los demandantes contraatacan con dos líneas:

  1. Sustitución directa: cuando un chatbot reproduce párrafos verbatim de artículos, no es transformación; es competencia. La prueba que aportan los medios incluye prompts como "¿cuál es la siguiente línea?" o "califica el sesgo de este artículo", donde los chatbots escupieron extractos extensos del contenido original.
  2. El dilema del prisionero: si una sola IA paga por licenciar contenido y las demás no, la que paga queda en desventaja. Encontrar que copiar noticias para IA no es fair use forzaría a todas las empresas a sentarse en igualdad de condiciones, justo el resultado que, según los demandantes, Microsoft y OpenAI querían evitar individualmente pero saben necesario colectivamente.

El propio Brockman reconoció en un mensaje interno su motivación "por los gazzillions" (los miles de millones) que se podían obtener comercializando la tecnología de OpenAI, según cita la moción. Ese tipo de frase es exactamente lo que un jurado o un juez de summary judgment quiere leer.

¿Qué significa esto para tu startup?

Más allá del drama judicial, hay señales concretas que cualquier founder debería traducir a decisiones operativas:

  • Audita hoy mismo tu pipeline de datos: si usas scraping de sitios con paywall, robots.txt restrictivo o términos de uso que prohíben minería de textos para entrenamiento, asume que estás expuesto. Considera datasets sintéticos, acuerdos con proveedores de datos con licencia explícita, o agregadores como Common Crawl con filtros más estrictos.
  • Diseña una estrategia de atribución y citación en tus productos de IA: las salidas que enlazan a la fuente original tienen más probabilidades de sobrevivir un escrutinio legal que las que la ocultan. El modelo de grounding con referencias visibles no es solo buena UX, es seguro legal.
  • Prepárate para un escenario de licenciamiento obligatorio: si la corte falla contra OpenAI y Microsoft, esperá cascadas de acuerdos de licenciamiento similares a los que ya sellaron The Associated Press y Axel Springer. Si tu modelo de negocio depende de entrenar con contenido abierto, tu unit economics tiene que absorber el costo de licencias, o pivotar a modelos pequeños entrenados con datos propios o sintéticos.
  • Monitoreá el tráfico orgánico de tu propio sitio: la misma fuerza que está reduciendo clics a los medios está reduciendo clics a cualquier sitio cuya información ahora entrega un chatbot. Si tu SEO depende de que el usuario visite tu página para convertir, necesitás un plan B.

El precedente que viene

La corte federal del Distrito Sur de Nueva York, a cargo del juez Sidney H. Stein, debe resolver las mociones de summary judgment en los próximos meses. Una decisión adversa a OpenAI y Microsoft no destruiría la industria de la IA, pero la obligaría a transparentar sus pipelines de entrenamiento y a pagar por datos que hoy toman como gratuitos. Una decisión favorable consolidaría el fair use como escudo legal de los LLM, pero dejaría a los medios sin más remedio que litigar caso por caso cada reproducción verbatim.

En cualquier escenario, la conversación pública cambió: ya no es "¿es legal entrenar con noticias?", sino "¿es justo?". Y ahí los documentos internos publicados esta semana son devastadores, porque muestran que los propios ingenieros de las big tech ya sabían la respuesta antes de que se la preguntaran los tribunales.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...