Ejecutivo de Microsoft tildó de robo histórico al scraping de OpenAI

Las palabras exactas que pueden cambiar el caso del siglo en IA

Un documento sin censurar del juicio NYT vs OpenAI y Microsoft contiene una frase que ningún abogado defensor quería ver sobre la mesa: el Director de Ciencia Aplicada de Microsoft, Brent Hecht, escribió que copiar millones de artículos de periódicos sin permiso era, literalmente, «el mayor robo de trabajo en la historia de la humanidad», y añadió que el uso no autorizado de contenido era «un robo asombroso de proporciones sin precedente».

Esa frase llegó al expediente público el 17 de septiembre de 2026, después de que el juez Sidney H. Stein, del Distrito Sur de Nueva York, levantara las censuras que protegían a las dos compañías. Para entonces, los daños potenciales bajo la ley estadounidense de copyright ya se estimaban en un mínimo de US$7.500 millones según la demanda, y los nuevos documentos pueden empujar la cifra al alza.

Los documentos no censurados, en palabras de los propios ejecutivos

Las revelaciones no se quedaron en Hecht. Otros tres documentos del mismo paquete judicial repiten el patrón, siempre en privado y casi nunca en público:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Nick Turley, jefe de producto de ChatGPT en OpenAI, escribió que los productos de su empresa «son en gran medida sustitutivos, y punto» y que serán «cada vez más sustitutivos» con el tiempo.
  • Jack Clark, director de política de OpenAI, señaló que el trabajo de la compañía «va a llevar cada vez más a crear sistemas que sustituyen el trabajo de las personas que definen la ‘cultura’ de la sociedad».
  • Greg Brockman, cofundador y presidente de OpenAI, respondió «ah, nice» cuando le contaron que un equipo había encontrado un «hack» para saltarse el paywall del New York Times, según reportó Reuters a través de Straits Times.
  • Satya Nadella, CEO de Microsoft, testificó bajo juramento que las conversaciones con chatbots «han sustituido» a los sitios web de los editores, y que si hubiera sabido que OpenAI scrapeó contenido de pago habría «invocado el derecho de Microsoft a exigir que OpenAI reentrenara sus modelos».

La ironía es exacta: en sus comparecencias públicas, OpenAI y Microsoft han sostenido que entrenar modelos con artículos de prensa es un uso legítimo y transformador del contenido. En sus correos internos, lo llamaron robo.

Por qué esta filtración complica la defensa de fair use

La defensa de fair use en el derecho estadounidense se apoya en cuatro factores. El cuarto —si el uso «sustituye» al original o afecta su mercado— es el más sensible para este caso. Cuando los propios ejecutivos de las dos compañías escribieron que sus productos son «sustitutivos, y punto», ese párrafo puede usarse directamente contra ellas en el cuarto factor del análisis.

El Daily News publicó extractos adicionales que se mueven en la misma dirección:

  • Un documento interno de Microsoft habla de un «doom loop» en el que «nuestra estrategia de contenido con IA ha empezado un bucle que perjudicará el rendimiento de nuestros modelos y de toda la web al mismo tiempo».
  • Los propios expertos de Microsoft reconocieron que, como mínimo, el 1,3% de 45.000 conversaciones de Copilot eran de actualidad.
  • ChatGPT tenía 1.000 millones de usuarios mensuales en mayo, según Sensor Tower, y OpenAI detectó internamente que «la demanda de noticias locales confiables ya es visible dentro de ChatGPT a un ritmo de aproximadamente 1 millón de prompts por semana», dato de febrero de 2026 que la demanda sacó a la luz.

Las cifras que ya están sobre la mesa

Los números concretos que los medios están presentando al juez dibujan un cuadro incómodo para OpenAI y Microsoft:

  • 3,9 millones de copias del NYT usadas para entrenar.
  • 7,3 millones de copias del Orange County Register, New York Daily News, Chicago Tribune, Orlando Sentinel, Denver Post y Mercury News combinadas.
  • Caídas de entre el 83% y el 93% en clics hacia el NYT y los periódicos aliados cuando el usuario llega vía chatbot.
  • El 28,6% de los ex-suscriptores del Register y del Daily News ahora piden noticias a la IA en lugar de renovar.
  • El 36% de los suscriptores del NYT que usan ChatGPT dijeron que «ya no necesito noticias del NYT».

CryptoBriefing, citando el expediente, recordó además que aproximadamente 160 medios regionales se unieron al caso en septiembre de 2026, y que OpenAI tenía una base de datos interna con 78 millones de conversaciones de ChatGPT que podían auditarse para detectar infracciones de copyright, algo que la empresa negó inicialmente.

La reacción de Microsoft y la jugada política de Washington

Microsoft respondió a las filtraciones intentando marcar distancia: calificó los comentarios de Hecht como «la perspectiva individual de un empleado» y aseguró que la posición legal de la compañía está en sus escritos judiciales, donde sostiene que los usos son transformativos y que Copilot «no es un sustituto del periodismo de los editores».

En paralelo, el Departamento de Justicia de la administración Trump presentó el 1 de septiembre un escrito amicus curiae defendiendo el fair use de OpenAI, argumentando que permitir el entrenamiento es clave para que EEUU gane la carrera global de IA. La demanda colectiva de 400 periódicos regionales y locales llegó el mismo día, acusando a las dos compañías de «robo sistemático y deliberado de cientos de miles de artículos». El contraste es difícil de ignorar: la misma semana en la que el DOJ defiende a OpenAI en los tribunales, periodistas locales piden al Congreso que persiga la misma práctica.

Qué significa esto para tu startup

El caso ya no es solo una pelea entre gigantes. Cualquier startup que entrene modelos, fine-tunee LLMs con contenido de terceros o construya productos sobre scraping web necesita tomar nota:

  • Audita tu pipeline de datos ahora, no después del juicio. El expediente describe cómo se eliminaron avisos de copyright del material de entrenamiento. Si tu dataset tiene rastros similares, documenta el origen de cada documento y la licencia bajo la que lo incorporaste antes de que un demandante te lo pregunte.
  • Diversifica tus fuentes con licencias explícitas. El estudio conjunto de Press Ranger y OtterlyAI publicado el 20 de agosto de 2026 cruzó 129,3 millones de citas en siete buscadores de IA contra 91 acuerdos de licencia confirmados y concluyó que los editores con un acuerdo con OpenAI reciben un 48% más de citas en ChatGPT que los no licenciados. Licenciar no es solo defensa legal: es una palanca de distribución.
  • Calcula el coste de no tener un acuerdo. OpenAI viene ofreciendo a editores entre US$1 millón y US$10 millones anuales según el tamaño, una cifra que muchos analistas consideran baja comparada con el rango de daños que podría fijar un juez. Si dependes de contenido editorial para tu producto, presupuestar una línea de licensing no es opcional.
  • Piensa en citabilidad y atribución, no solo en entrenamiento. Los medios firmaron acuerdos que están funcionando porque ChatGPT los cita más, no porque el modelo «aprenda» mejor de ellos. Si tu producto muestra fuentes, premia a los licenciantes con atribución visible: el incentivo es real y medible.

El juicio sumario resolverá en los próximos meses qué reclamaciones llegan a un juicio completo. Hasta entonces, los documentos del juez Stein son la mejor guía pública sobre lo que un tribunal estadounidense considera un uso legítimo del contenido en IA, y lo que no.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...