¿Por qué Amazon destruye libros físicos para entrenar su IA?
Amazon está comprando miles de libros físicos, escaneándolos página por página y destruyéndolos en el proceso. La práctica, revelada esta semana por una investigación de 404 Media, tiene un objetivo concreto: alimentar los conjuntos de datos que alimentan a la familia de modelos de lenguaje Nova de la compañía.
El hallazgo no es casual. Los grandes modelos de lenguaje (LLM) ya consumieron prácticamente todo el texto disponible en internet. Para seguir mejorando, las empresas buscan fuentes alternativas de texto humano genuino, y los libros impresos antes de 2022 representan lo más cercano a un corpus libre de contaminación por IA.
La técnica —cortar el lomo del libro para digitalizarlo rápidamente— no es nueva. Anthropic la empleó para entrenar sus propios modelos Claude, y el tema saltó a la luz pública durante la demanda de autores contra la empresa, que se resolvió con un acuerdo de USD 1.500 millones aprobado en julio de 2026.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl rastreo hasta Las Vegas
El equipo de 404 Media realizó una operación de seguimiento directa: colocó un dispositivo AirTag dentro de un lote de libros antiguos vendidos a través de Biblio, la plataforma especializada en libros raros y descatalogados. Según los datos de rastreo, el paquete viajó por avión y camión durante semanas hasta llegar a un almacén de Amazon en Las Vegas identificado como VGT3.
Dentro de ese centro opera un equipo específico cuya tarea, según explicaron empleados al medio, consiste en recibir libros físicos, cortarles el lomo y escanear el contenido página por página. El corte de la encuadernación agiliza la digitalización, pero implica destruir irremediablemente el ejemplar original. Todo el contenido digitalizado va al conjunto de datos para entrenar los modelos Nova.
Según TechCrunch, el centro VGT3 se identifica con un símbolo de un dinosaurio sosteniendo un libro en sus garras. Tras conocerse la investigación, Amazon confirmó la práctica a través de un portavoz, quien dijo que la tecnológica "compra libros a través de canales comerciales para mejorar los productos y servicios que ofrece a sus usuarios", sin detallar volúmenes ni métodos.
La lógica detrás de la destrucción
La estrategia de Amazon responde a dos preocupaciones técnicas concretas:
Calidad del dato. Los LLMs tienen un problema conocido como "colapso del modelo" (model collapse): cuando se entrenan con texto generado por otras IAs, la calidad de sus respuestas se degrada progresivamente. Al elegir libros impresos antes de 2022, Amazon asegura que los autores no usaron herramientas como ChatGPT para escribirlos.
Protección legal. Un juez de Estados Unidos dictaminó que escanear y destruir libros comprados para entrenar IA puede considerarse "uso legítimo" (fair use). Al destruir el ejemplar físico, la empresa no genera copias adicionales del producto, por lo que no constituye una infracción directa de derechos de autor bajo esa interpretación judicial.
Amazon solo digitaliza libros con ISBN, lo que le permite llevar un registro sistemático de qué títulos ya fueron procesados. Sin embargo, esto deja fuera de su corpus a ediciones muy antiguas, autoeditadas o sin registro formal.
Qué significa esto para tu startup
Esta noticia revela una tendencia estructural del ecosistema de IA que afecta directamente a fundadores que construyen productos basados en modelos de lenguaje:
El agotamiento de datos públicos es irreversible. Ya no basta con hacer scraping de la web abierta. Las empresas están explorando fuentes físicas, bases de datos privadas, contenido licenciado y mercados alternativos de información. Esto crea tanto oportunidades como riesgos para startups que compiten por talento y datos.
Los libros son ahora materia prima estratégica. Lo que antes era un objeto cultural se convirtió en insumo industrial para entrenamiento de IA. Si tu startup trabaja con contenido editorial, académico o especializado, este cambio redefine el valor de tus activos de datos.
Acciones concretas para founders
Si tu startup depende de datos de entrenamiento o construye sobre modelos de lenguaje, aquí hay tres pasos accionables:
- Audita la procedencia de tus datos. Si usas datasets públicos o scrapeados, verifica que no estén contaminados con contenido generado por IA. El colapso del modelo es un riesgo técnico real, no teórico. Documentá dónde viene cada fuente.
- Explora licenciamiento directo de contenido. A medida que las fuentes públicas se agotan, el valor del contenido licenciado crece. Negociar acuerdos directos con editoriales, instituciones académicas o creadores puede ser una ventaja competitiva sostenible.
- Monitoreá el marco regulatorio. La decisión judicial sobre fair use en EE.UU. sienta precedente. Si operás globalmente, especialmente en LATAM o Europa, seguí de cerca cómo evolucionan las leyes de copyright aplicadas a IA. La regulación podría cambiar radicalmente la viabilidad de estos modelos de adquisición de datos.
El debate ético no está cerrado
Aunque la interpretación de "uso legítimo" beneficia a las empresas de IA hoy, el debate público sigue abierto. La destrucción de ejemplares históricos —muchos de ellos irreemplazables— genera resistencia entre bibliotecarios, historiadores y comunidades de coleccionistas. Este tipo de controversias pueden derivar en legislación específica que restrinja estas prácticas en el futuro.
Para fundadores, esto significa que las estrategias de adquisición de datos basadas en grises legales podrían volverse insostenibles si el marco regulatorio cambia. Diversificar fuentes y construir relaciones directas con creadores de contenido es una apuesta más segura a largo plazo.
Fuentes
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













