¿Qué descubrió la investigación de 404 Media sobre Amazon?
Una investigación periodística publicada hoy por 404 Media reveló que Amazon está comprando grandes volúmenes de libros raros, los escanea para alimentar sus modelos de inteligencia artificial y luego los destruye. La prueba llegó tras colocar un AirTag oculto en un libro antiguo vendido por un librero que sospechaba que las empresas de IA estaban adquiriendo lotes masivos de obras raras con ese propósito.
El rastreo del dispositivo llevó al centro de formación de IA de Amazon en Las Vegas, identificado como VGT3, donde un equipo especializado arranca las páginas de los libros desde sus lomos y los escanea sistemáticamente. El propio logo en la puerta del almacén mostraba un Tyrannosaurus rex devorando un libro, una imagen que no pasó desapercibida ante la creciente controversia.
Lo que hace este hallazgo relevante para cualquier founder que construya productos con IA es que expone un problema estructural del ecosistema: la carrera por obtener datos únicos de entrenamiento está generando externalidades negativas reales sobre el patrimonio cultural, y la transparencia sobre estas prácticas sigue siendo prácticamente nula.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad¿Por qué las empresas de IA necesitan estos libros?
Los modelos de lenguaje frontier requieren cantidades masivas de texto único para mantenerse competitivos frente a rivales como Google, OpenAI o Anthropic. Los libros raros —obras antiguas, textos sin traducir a idiomas poco difundidos, ediciones nunca distribuidas ampliamente— representan contenido original que no aparece en los conjuntos de datos públicos ya utilizados por la industria.
Según discusiones de trabajadores de VGT3 documentadas por 404 Media, Amazon se quedó sin libros para escanear a principios de este año. La situación fue tan alarmante que los empleados temieron que el almacén cerrara si no conseguían más material. En un momento dado, el suministro se agotó completamente. El centro sigue operativo, pero ahora confirma que los pedidos masivos de libros raros llegan allí y son sistemáticamente destruidos.
La práctica refuerza una teoría que los libreros habían sostenido durante meses: las empresas de IA están comprando libros seleccionando por ISBN, buscando completar listas sistemáticas de cada libro impreso existente. Los trabajadores de VGT3 fueron entrenados para escanear códigos de barras e ISBNs antes de procesar los libros, lo que da credibilidad a esta hipótesis.
La respuesta de Amazon y el debate ético
Amazon declinó comentar específicamente sobre el uso de estos libros para entrenamiento de IA, limitándose a una declaración genérica que también proporcionó a Ars Technica: «Amazon compra libros a través de canales comerciales para ayudar a desarrollar y mejorar los productos y servicios que usan nuestros clientes». La declaración no menciona la IA.
Esta evasión contrasta con la posición pública de competidores como Anthropic y xAI, que han declarado explícitamente que no entrenan sus modelos en libros raros o anticuados. Esta diferencia estratégica podría convertirse en un factor diferenciador importante para las startups que buscan construir confianza con audiencias preocupadas por la ética de la IA.
El debate público se intensificó rápidamente. El inversor Michael Burry calificó la práctica como «la encarnación del mal», mientras que en Reddit usuarios debaten si realmente importa que libros olvidados terminen destruidos cuando llevan décadas acumulando polvo en estantes de libreros.
Sin embargo, como señaló el librero escocés Derek Walker ante la BBC, existe una distinción crucial entre textos académicos desconocidos que técnicamente son raros y ediciones antigüas que pueden ser «el único ejemplo superviviente conocido». Destruir una obra que ha sobrevivido siglos tiene consecuencias irreversibles.
¿Qué significa esto para tu startup de IA?
Este caso revela tres lecciones concretas que todo founder debería considerar:
1. La escasez de datos únicos es un cuello de botella real.
Si incluso Amazon, con su infraestructura y capital, corrió riesgo de quedarse sin material para escanear, imagina el desafío que enfrentan startups más pequeñas. La disponibilidad de datos originales y únicos se está agotando. Esto crea tanto un riesgo como una oportunidad: quienes desarrollen fuentes alternativas de datos estructurados o enfoques que requieran menos volumen tendrán ventaja competitiva.
2. La transparencia puede ser tu diferenciador.
Mientras Amazon evita responder directamente, Anthropic y xAI han sido claros sobre sus políticas de datos. Para una startup, comunicar abiertamente de dónde provienen tus datos de entrenamiento no es solo una decisión ética — es una estrategia de posicionamiento. Los usuarios finales, especialmente en mercados regulados como Europa, están cada vez más sensibles a estas prácticas.
3. Existen alternativas viables.
La propia cobertura de Ars Technica mencionó que hay métodos alternativos de digitalización que no destruyen los libros físicos. Escanizado no destructivo, colaboración con bibliotecas y archivos digitales existentes, o el uso de técnicas de OCR avanzadas sobre materiales ya disponibles legalmente son opciones que permiten acceder a contenido valioso sin generar daño irreversible.
Acciones concretas para implementar
- Audita tus fuentes de datos: Si tu modelo se entrena con contenido adquirido comercialmente, verifica cómo se obtiene y si existen impactos colaterales sobre patrimonio cultural o propiedad intelectual.
- Considera declarar tu política de datos: Publicar un documento claro sobre qué tipos de contenido usas y cuáles excluyes puede generar confianza con tu audiencia y diferenciar tu producto en un mercado saturado.
- Explora fuentes alternativas: Invierte en partnerships con instituciones culturales, bibliotecas digitales o proyectos de texto abierto que permitan acceso legal a contenido sin destruirlo.
Fuentes
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













