El memo interno que sacude la demanda de NYT contra OpenAI y Microsoft
Un memo interno de enero de 2023 firmado por Brent Hecht, Director de Applied Science de Microsoft, calificó al scraping masivo de contenido como "el mayor robo de trabajo de la historia", según los nuevos filings desclasificados en la demanda que The New York Times presentó contra OpenAI y Microsoft hace tres años. La cita aparece en un expediente judicial dado a conocer este mes y vuelve a poner sobre la mesa la pregunta central del caso: si entrenar modelos de IA con contenido protegido por copyright es fair use o no.
La magnitud del impacto económico ya está documentada dentro de la propia Microsoft: sus propios datos muestran que el "answer engine" de Copilot redujo el click-through rate del dominio de The New York Times hasta un 93% comparado con la búsqueda tradicional en Bing. Una presentación interna de enero de 2024, también firmada por Hecht, describe ese desplome como un "doom loop" que "dañaría el rendimiento de nuestros modelos y de toda la web al mismo tiempo". Para cualquier founder que monetiza vía tráfico orgánico, esa cifra es la que importa: el comportamiento del usuario ya cambió, con o sin sentencia.
¿Qué revela el nuevo filing de NYT contra OpenAI y Microsoft?
El expediente contiene material previamente bajo sello que, según la propia cubierta del caso, describe cómo OpenAI y Microsoft reunieron contenido de The New York Times, Daily News y Center for Investigative Reporting para entrenar sus modelos. Las acusaciones centrales son tres: scraping masivo para construir datasets de entrenamiento, elusión de paywalls sin ser detectados, y eliminación deliberada de avisos de copyright antes de pasar los datos al modelo.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl filing incluye por primera vez cifras concretas sobre el volumen de copia: los datasets de mid-training de OpenAI contienen más de 91.692 copias de obras de los tres demandantes, y un dataset derivado de Common Crawl incluyó más de 2 millones de documentos de nytimes.com, según reporta TechCrunch citando el expediente.
Además, el material expone una operación cruzada entre las dos compañías: OpenAI entregó el dataset completo de entrenamiento de GPT-3 a Microsoft, y Microsoft devolvió datos a OpenAI a través de iniciativas internas denominadas "Project Taxi" y "Project Mango". Este último, según el filing, ensambló un dataset de entrenamiento con al menos 160.903 obras únicas de los editores demandantes.
¿Qué dijeron los ejecutivos bajo juramento?
El expediente no depende solo de documentos: también recoge declaraciones de figuras clave que contradicen directamente la defensa de fair use de OpenAI.
- Satya Nadella, CEO de Microsoft, declaró a comienzos de 2026 que "cualquier contenido detrás de un paywall debería ser licenciado por cualquiera que quiera usarlo, ya sea para grounding o para entrenamiento", y que si hubiera sabido que OpenAI scrapeó contenido paywalled, habría "invocado el derecho de Microsoft a exigirle reentrenar sus modelos".
- Nick Turley, Head of ChatGPT en OpenAI, escribió en comunicaciones internas que los publishers enfrentan una "amenaza existencial" por productos como ChatGPT, que son "en gran medida sustitutivos" y lo serán cada vez más.
- Greg Brockman, presidente de OpenAI, describió los modelos como "excelentes para noticias" y, ante un mensaje del investigador Nick Ryder sobre un "hack para saltar el paywall del New York Times", respondió: "ah, qué bien".
- Brent Hecht escribió en su memo de enero de 2023 que la práctica era "un robo asombroso de proporciones sin precedentes" y "el mayor robo de trabajo de la historia".
En conjunto, las declaraciones lesionan dos de los cuatro pilares del test de fair use en EE. UU.: la naturaleza del uso (no transformativo, según el argumento del Times) y el efecto sobre el mercado potencial del trabajo original.
¿Cómo se acumuló la evidencia hasta llegar a este punto?
El caso, presentado en diciembre de 2023, ha crecido en alcance y en fuerza probatoria en los últimos meses. Según reporta CryptoBriefing, aproximadamente 160 medios regionales se unieron a la demanda en septiembre de 2026, transformándola de un litigio individual en una batalla representativa de la industria. El discovery también habría revelado la existencia de una base de datos con unos 78 millones de conversaciones de ChatGPT que eran monitoreadas para verificar cumplimiento de copyright, lo que contradice afirmaciones previas de OpenAI sobre su incapacidad para rastrear contenido protegido en sus datos de entrenamiento.
En el frente procesal, el 4 de abril de 2025 el juez Sidney H. Stein, del Distrito Sur de Nueva York, rechazó varias mociones de descarte de OpenAI y Microsoft, incluidos reclamos por infracción directa y contributiva de copyright, aunque descartó otros cargos como competencia desleal por common law, según The Logical Indian.
El 1 de septiembre de 2026, el Departamento de Justicia de EE. UU. presentó un escrito apoyando la posición de OpenAI: argumentó que el entrenamiento con material con copyright es, en principio, fair use y que una lectura restrictiva "perjudicaría severamente el progreso tecnológico". Esta intervención, reportada por Reason, agrega peso político al caso, pero no resuelve la cuestión: sigue siendo el juez quien decide, en un escenario donde el Times sostiene que el material se usa "sin pago para crear productos que sustituyen al Times y le roban audiencia".
¿Qué significa esto para tu startup?
Más allá del veredicto, lo que se ventila en este caso reconfigura tres palancas que tocan directamente a quien construye un producto de IA, contenido o ambos.
1. Audita tu pipeline de datos hoy, no cuando llegue la demanda. Si tu producto usa scraping de sitios de terceros para entrenar, ajustar o hacer grounding, revisa contrato por contrato de qué fuente sale cada dataset. El expediente describe ingeniería deliberada para eludir paywalls y remover avisos de copyright; aunque tu caso sea de buena fe, "no sabíamos" tiene cada vez menos defensa judicial. Documentar el origen del dato será un requisito, no un nice-to-have.
2. Replantilla tu modelo de monetización frente al "doom loop" del 93%. Si dependes de tráfico orgánico, ese click-through desplomado por Copilot sobre el dominio de NYT es un anticipo de lo que viene. Empieza a diversificar ingresos hacia suscripción, datos licenciados, API de acceso a tu contenido, o partnerships directos con proveedores de IA. OpenAI ya reporta acuerdos con más de 20 medios que cubren más de 160 outlets, según The Logical Indian. Si tu contenido tiene valor para entrenar modelos, hay un precio posible: negocia antes de que te scrapeen.
3. Diseña tu producto asumiendo que el "fair use" se está angostando. Aunque la tendencia judicial en EE. UU. ha sido mayoritariamente favorable a las empresas de IA, los filings prueban que los propios ejecutivos sabían que sus productos eran sustitutivos. Una sentencia contra OpenAI/Microsoft dispararía licenciamiento obligatorio por ley; una a favor no te exime de responsabilidad contractual. La estrategia defensiva correcta es construir tu stack de datos como si el fair use no existiera: solo contenido propio, solo licencias claras, o solo datos sintéticos y públicos.
El desenlace del caso aún no tiene fecha, pero el expediente que se desclasificó esta semana ya cumplió su función: dejó por escrito, con la firma y la voz de los protagonistas, lo que el ecosistema editorial sospechaba desde 2023. Para founders hispanohablantes que construyen sobre IA, la lección no es esperar el fallo: es ajustar el modelo de datos y de negocio antes de que la siguiente cita interna los ponga a ellos en una deposition.
Fuentes
- Microsoft exec called AI scraping 'the largest theft of labor in human history,' new unredacted filings reveal — TechCrunch
- NYT slams Microsoft for building copyright-infringing supercomputer for OpenAI — Ars Technica
- OpenAI staff recognized AI's existential threat to publishers, New York Times claims in ongoing lawsuit — CryptoBriefing
- DOJ Says Barring AI Training on Copyrighted Material Could 'Severely Hamper' Tech Progress — Reason
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














