Anthropic gastó decenas de millones en millones de libros para entrenar Claude
Anthropic invirtió decenas de millones de dólares en aproximadamente un año para adquirir y escanear millones de libros físicos, destruyendo los ejemplares después de digitalizarlos. Esta práctica, revelada por investigaciones de The Washington Post y confirmada en litigios judiciales, responde a un problema crítico que enfrentan las empresas de IA en 2026: la escasez de datos humanos de calidad para entrenar sus modelos.
Para founders que dependen de IA para escalar sus operaciones, entender esta dinámica es crucial. La carrera por datos limpios está redefiniendo costos de entrenamiento, estrategias de licenciamiento y las barreras de entrada para nuevos players en el mercado de IA generativa.
¿Por qué las empresas de IA destruyen libros después de escanearlos?
El proceso documentado en el caso de Anthropic —conocido internamente como Project Panama— sigue una cadena industrial específica: las empresas compran libros de segunda mano, descatalogados o de baja circulación a través de intermediarios y librerías de viejo; los envían a plantas donde les cortan el lomo para escanear las páginas de forma rápida; digitalizan el contenido; y finalmente trituran los volúmenes para reciclar el papel.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLa destrucción física no es caprichosa. Forma parte del argumento jurídico de fair use (uso legítimo) que Anthropic presentó ante la corte federal de EE. UU. El juez William Alsup dictaminó que el escaneo destructivo de libros adquiridos legalmente puede considerarse fair use porque el uso es transformativo: los libros no se revenden ni se distribuyen, sino que se convierten en datos para entrenar un modelo de lenguaje.
Este matiz legal es fundamental. La legalidad depende de que el libro haya sido comprado lícitamente y de que el resultado no sustituya la obra original en el mercado. Sin embargo, el fallo no cubre el uso de copias pirateadas, y litigios paralelos continúan sobre si el entrenamiento compite indirectamente con el mercado editorial.
¿Qué es el IA slop y por qué contamina los datos de entrenamiento?
El término IA slop describe el contenido generado por IA de baja calidad que está saturando internet desde 2023-2024. A medida que modelos como GPT-4, Claude y Gemini se volvieron accesibles, una proporción creciente del contenido web pasó a ser sintético: artículos generados automáticamente, reseñas falsas, tutoriales repetitivos y texto optimizado para SEO pero carente de valor real.
Para las empresas de IA, esto representa un problema técnico grave. Cuando entrenas un modelo con datos que ya fueron generados por otra IA, ocurre un fenómeno de degradación de calidad: el modelo aprende patrones sintéticos, repite errores y pierde la riqueza del lenguaje humano editado. Los libros publicados antes de 2022 son particularmente valiosos porque son textos humanos, editados y estructurados, libres de contaminación por IA generativa.
Libreros de todo el mundo han detectado compras masivas de libros descatalogados y especializados. Las empresas buscan obras técnicas, académicas y de nicho que ofrecen densidad informativa superior a un blog promedio. El problema: estas compras pasan por intermediarios y bases de datos de ISBN, lo que dificulta rastrear al destinatario final y genera presión al alza sobre libros que pueden tener valor documental o histórico.
¿Es legal entrenar IA con libros comprados legalmente?
El precedente judicial más relevante en 2026 es el fallo preliminar del juez William Alsup en el caso de Anthropic. La corte determinó que entrenar modelos con libros adquiridos legalmente puede ser fair use bajo la doctrina de uso transformativo de EE. UU. Esto significa que la digitalización con fines de entrenamiento de IA no necesariamente infringe copyright si:
- Los libros fueron comprados legalmente (no pirateados)
- El uso es transformativo (no se distribuye el libro digitalizado)
- El resultado no compite directamente con el mercado de la obra original
Sin embargo, la situación legal sigue siendo inestable. Fuera de EE. UU., otras jurisdicciones no usan el mismo estándar de fair use. En Europa, por ejemplo, las excepciones de texto y minería de datos (text and data mining) tienen límites más estrictos y pueden requerir licencias explícitas. Además, continúan los litigios sobre copias pirateadas y sobre si el entrenamiento de modelos comerciales compite indirectamente con el mercado editorial.
Para founders que operan globalmente, esto significa que la estrategia de datos debe considerar la jurisdicción. Lo que es legal en California puede no serlo en Madrid o Buenos Aires.
¿Qué significa esto para tu startup?
Esta dinámica del mercado de datos tiene implicaciones directas para emprendedores que construyen productos con IA:
1. Los costos de entrenamiento están subiendo
La escasez de datos limpios está encareciendo el acceso a corpus de calidad. Si tu startup depende de fine-tuning de modelos open-source, deberás presupuestar no solo cómputo, sino también adquisición o licenciamiento de datos. Los acuerdos con editoriales, medios especializados y plataformas de contenido curado se están volviendo comunes, pero requieren capital y negociación legal.
2. Los datos propios son tu ventaja competitiva
Si tu startup genera datos únicos a través de su producto (interacciones de usuarios, transacciones, contenido generado por la comunidad), ese corpus es más valioso que nunca. Las empresas que pueden entrenar con datos propietarios limpios tienen una ventaja sostenible sobre quienes dependen de datos públicos contaminados por IA slop.
3. Considera estrategias alternativas de datos
No todas las startups pueden competir en la compra masiva de libros. Explora estas alternativas:
- Acuerdos de licencia con creadores de nicho (newsletters, blogs especializados, autores independientes)
- Datos sintéticos generados con control de calidad, aunque úsalos con cautela para evitar degradación
- Web crawling selectivo con filtros agresivos para excluir contenido generado por IA
- Datasets multimodales (audio, video, documentos técnicos) que tienen menos contaminación
- Colaboraciones con instituciones (universidades, bibliotecas, archivos) que tienen corpus curados
4. Documenta la procedencia de tus datos
Si planeas escalar o levantar capital, los inversores preguntarán sobre la legalidad de tus datos de entrenamiento. Mantén registros claros de:
- Fuentes de adquisición (compras, licencias, scraping con términos de servicio respetados)
- Jurisdicciones aplicables
- Procesos de filtrado y limpieza
Esto reduce riesgo legal y facilita due diligence en rondas de funding.
Alternativas que están explorando las empresas de IA
Además de la compra destructiva de libros, las grandes empresas están diversificando sus fuentes de datos:
- Acuerdos de licencia directos con editoriales (Random House, Penguin), medios (The New York Times, Associated Press) y plataformas (Reddit, Stack Overflow)
- Corpus internos curados de datos empresariales, científicos y técnicos con permisos explícitos
- Datos de interacción humana (feedback de usuarios, RLHF) que ofrecen señal de calidad superior
- Web crawling más selectivo con modelos de clasificación que filtran spam, duplicados y contenido sintético
- Datasets multimodales que combinan texto con audio, video y código, reduciendo la dependencia de texto puro
El riesgo de depender exclusivamente de datos sintéticos es real: si entrenas un modelo con output de otro modelo, la calidad se degrada progresivamente (fenómeno conocido como model collapse). Por eso, los datos humanos curados siguen siendo el gold standard en 2026.
Conclusión
La práctica de Anthropic y otras empresas de comprar y destruir libros físicos para entrenar IA refleja una realidad incómoda: el internet abierto ya no ofrece suficientes datos humanos de calidad. Para founders, esto significa que la ventaja competitiva ya no está solo en el modelo o el cómputo, sino en el acceso a datos limpios y legales.
Las implicaciones legales siguen evolucionando, pero el precedente de fair use en EE. UU. ofrece cierto respaldo para empresas que adquieren datos legalmente. Sin embargo, la estrategia óptima es diversificar fuentes, documentar procedencia y, cuando sea posible, generar datos propietarios a través del producto.
La escasez de datos humanos es un problema estructural del ecosistema de IA en 2026. Las startups que lo resuelvan creativamente —ya sea mediante licenciamiento inteligente, colaboraciones institucionales o generación de datos únicos— tendrán una ventaja sostenible en un mercado cada vez más competitivo.
Fuentes
- Las empresas de IA están comprando toneladas de libros viejos porque están libres de IA Slop. Luego los destruyen
- Cuando el conocimiento de internet ya no es suficiente: la IA les pone el ojo a las librerías de segunda mano
- Cómo Silicon Valley construyó la IA comprando, escaneando y descartando millones de libros
- Anthropic destruyó millones de libros físicos para entrenar su IA
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














