Microsoft: menos del 1% de chats de Copilot copiaron al NYT

Microsoft presenta 8,2 millones de chats de Copilot y dice que casi ninguno copió al NYT

Microsoft entregó 8,2 millones de registros de conversaciones con Copilot como parte del discovery del caso que enfrenta junto a OpenAI contra The New York Times, editores de noticias y autores. La compañía asegura que, tras analizarlos, menos del 1% contenía siquiera 16 palabras coincidentes con artículos protegidos por derechos de autor. El número exacto que cita la compañía: 59.545 chats con ese umbral mínimo de coincidencia textual.

Los registros, según el documento legal presentado el viernes, fueron seleccionados porque «activaban palabras clave asociadas a los sitios web de los demandantes», es decir, los casos más desfavorables para Microsoft. Aun así, el análisis muestra un solapamiento mínimo: 24 respuestas en los 8,2 millones de chats presentaban 30 o más palabras coincidentes, y solo 10 de los 212 libros evaluados arrojaron cualquier tipo de coincidencia.

Un experto contratado por el Center for Investigative Reporting (CIR) encontró, dentro de ese mismo dataset, 51 instancias de «solapamiento sustancial» con contenido del CIR. Los demandantes —The New York Times, CIR y la Authors Guild— no respondieron de inmediato a la solicitud de comentarios de The Verge.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Qué argumenta Microsoft con estos números

La estrategia legal de Microsoft es directa: si los modelos rara vez reproducen material protegido en sus respuestas, entonces el uso de ese material para entrenar los modelos difícilmente puede considerarse una infracción sustituible del original. La compañía sostiene que, aunque los sistemas como Copilot dependan de contenido con derechos de autor, el propósito del modelo entrenado es «significativamente diferente» del propósito de la obra original.

El escrito resume esa idea así: el hecho de que un LLM en ocasiones reproduzca secciones de texto «apenas socava el propósito transformador del entrenamiento». Es la aplicación práctica del argumento de fair use que las grandes tecnológicas vienen sosteniendo desde que arrancó el litigio: lo que hacen los modelos con el material no compite directamente con la obra original en el mercado.

Microsoft pide al juez que emita un summary judgement —una resolución anticipada sin llegar a juicio completo—. Si el juez falla a favor de editores y autores, el caso continúa en cortes.

El gobierno de EE.UU. entró al ring esta misma semana

El martes 1 de septiembre, el Departamento de Justicia de EE.UU. presentó un statement of interest ante el juez Sidney H. Stein, del Distrito Sur de Nueva York, apoyando la postura de OpenAI de que entrenar LLMs con material protegido es «extraordinariamente transformador» y debería considerarse fair use, según reportó Wired. El escrito argumenta que un fallo en contra de las grandes tecnológicas «amenazaría la seguridad nacional» y «daría ventaja competitiva a adversarios extranjeros».

El amicus del gobierno se inscribe en la línea marcada por la orden ejecutiva del 23 de enero de 2025, «Removing Barriers to American Leadership in Artificial Intelligence», que declara como política de EE.UU. «sostener y mejorar el dominio global de EE.UU. en IA».

Para los demandantes la movida es una señal preocupante. El portavoz del New York Times, Graham James, respondió que «la Administración se está poniendo del lado de un puñado de empresas de IA valoradas en billones de dólares a expensas de los incontables creadores estadounidenses cuyo trabajo robaron». El medio ha gastado más de 30 millones de dólares en litigios relacionados con IA, según Nieman Lab.

Los precedentes que ya existen en EE.UU.

El de Microsoft y OpenAI no es el único caso abierto. Ya hay dos fallos federales relevantes sobre si entrenar modelos con material con copyright es legal:

  • Anthropic (junio 2025): el juez William Alsup (Distrito Norte de California) dictó que usar libros comprados para entrenar a Claude fue «excedentemente transformador» y constituía fair use. Sin embargo, Anthropic perdió por separado: había descargado millones de libros pirateados, lo que derivó en un acuerdo de 1.500 millones de dólares con los autores.
  • Meta (caso Kadrey v. Meta): el juez Vince Chhabria concluyó que entrenar con material protegido «en la mayoría de los casos» podría ser ilegal, porque los modelos generativos «tienen el potencial de inundar el mercado con cantidades infinitas de imágenes, canciones, artículos, libros y más». Meta ganó técnicamente, pero el fallo dejó la puerta abierta a que entrenamientos similares sí sean considerados infracción en otros contextos.

El Departamento de Justicia criticó explícitamente la lectura de Chhabria en su escrito del martes, calificándola de «aplicación incorrecta de los principios de copyright».

¿Qué implica esto para el ecosistema de startups?

La pelea judicial entre gigantes define reglas que terminarán aplicándose a cualquier startup que entrene o fine-tune modelos con datos propios o de terceros. Los escenarios que se abren son tres:

  • Si gana Microsoft/OpenAI (fair use amplio): cualquier startup podrá entrenar modelos sobre prácticamente cualquier corpus público sin pagar licencias. Es el escenario que el gobierno de EE.UU. defiende con su amicus.
  • Si ganan los editores (licencias obligatorias): entrenar modelos propios será más caro y probablemente exigirá acuerdos con agregadores de contenido. Las startups con menos caja podrían quedar fuera del juego de modelos frontera.
  • Si se establece un punto medio:会出现 el mercado de licencias que ya se está formando — OpenAI ha firmado acuerdos con medios grandes en distintos países, dejando afuera a publicaciones chicas, según reportó Nieman Lab.

Mientras tanto, nuevos pleitos siguen sumándose. Sony y Warner Music demandaron a Anthropic la semana pasada por uso de canciones en el entrenamiento de Claude, siguiendo una demanda previa de Universal Music.

Qué significa esto para tu startup

  • Audita tu pipeline de datos hoy, no cuando llegue la demanda. Documenta el origen, la licencia y la trazabilidad de cada dataset con el que entrenas o haces fine-tuning. El caso Anthropic demuestra que tener los datos «en el modelo» no protege: importar libros pirateados fuera del pipeline de entrenamiento sigue siendo infracción.
  • No confundas fair use con uso libre. El fallo de Meta dejó claro que «transformativo» no es un escudo automático. Si tu producto compite directamente con el contenido original —por ejemplo, un generador de artículos deportivos que sustituye al de un medio—, el riesgo legal sube aunque la salida sea palabra por palabra distinta.
  • Diseña con el «modo licensing» en mente. Aunque tu modelo actual no pague licencias, prevé una arquitectura que pueda incorporar contenido con licencia por opt-in (como las API oficiales de editores o agregadores como News Corp). Cambiar después es mucho más caro que hacerlo desde el diseño.
  • Mide el solapamiento con las fuentes. Las métricas de Microsoft (palabras coincidentes, longitud de tramos reproducidos) son el tipo de evidencia que se está presentando en los tribunales. Tener tu propio panel de detección de regurgitación puede ser la diferencia entre un due diligence técnico limpio y un problema legal.

Conclusión

Los 8,2 millones de logs que Microsoft puso sobre la mesa son, en realidad, una batalla narrativa: la compañía quiere que el caso se decida por números y no por principios abstractos. Si el juez Sidney H. Stein concede el summary judgement, Microsoft gana esta ronda sin haber necesitado litigar el fondo. Si lo deniega, el descubrimiento entrará en una fase más profunda y los demandantes podrán exigir más evidencia.

El resultado reconfigurará cuánto cuesta —y a quién se paga— por los datos con los que se entrena cualquier modelo. Para founders hispanohablantes que construyen sobre LLMs, la decisión marcará el costo de entrada al juego en los próximos años.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...