Una compra atípica que levanta ventas (y sospechas)
Desde agosto de 2026, las librerías de segunda mano en Japón registran pedidos masivos que multiplican sus ventas diarias hasta por cinco. La cobertura de NTV Japón, retomada por Tom's Hardware, documenta el patrón: una librería de Tokio que antes despachaba novelas y manga ahora ve cómo le vacían secciones de filosofía, historia política, medicina, derecho y "vida y cultura en el periodo Edo".
Aunque los libreros celebran el respiro financiero, muchos sospechan que esos volúmenes no van a parar a bibliotecas personales. La pista más concreta: todos los pedidos, colocados desde múltiples cuentas, acaban convergiendo en un mismo centro logístico en la prefectura de Okayama. Una librería del oeste de Japón, además, recibió un correo electrónico de una empresa extranjera preguntando si podía servir un pedido de decenas de miles de libros.
El rastro continúa al otro lado del Pacífico. Una investigación con datos de exportación analizados con la herramienta Sayari, recogida por note.com, identificó un envío de más de 50 toneladas de libros japoneses a Estados Unidos desde 2025, equivalente a unos 100.000 volúmenes si se asume un peso medio de 500 gramos por libro encuadernado. La hipótesis, sostenida por la investigación de 404 Media y por documentos judiciales en EE.UU., es que esos libros terminan siendo cortados, escaneados y destruidos para alimentar datasets de entrenamiento de modelos de IA.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadPor qué la IA ahora busca libros impresos: el problema del "model collapse"
La razón no es estética ni nostálgica. Es técnica. Desde que los grandes modelos de lenguaje se entrenan con texto generado por modelos anteriores, aparece un fenómeno conocido como model collapse (colapso del modelo): la calidad del output se degrada generación tras generación porque se alimenta de su propia estadística. Un estudio de Oxford, Cambridge, Imperial College London y la Universidad de Toronto publicado en Nature en julio de 2024 documentó este círculo vicioso, y un análisis de Ahrefs de aproximadamente 900.000 páginas web nuevas encontró que el 74,2% ya contenía contenido generado por IA en abril de 2025, según reporta TechTimes.
Un libro impreso antes de 2022 resuelve los dos problemas de un plumazo: garantiza autoría humana y precede a cualquier técnica de envenenamiento adversativo de datos, heredera del trabajo del SAND Lab de la Universidad de Chicago. En palabras del propio material de marketing —ya retirado— de ISBNdb, intermediaria que brokers pedidos de hasta un millón de libros: "los libros representan conocimiento humano curado, revisado por pares, estructurado de un modo que ningún web crawl puede replicar". Es texto limpio, y se está agotando. Epoch AI ha estimado que la demanda de texto humano público disponible podría superar la oferta en algún momento entre 2026 y 2032, según recoge Mashable.
Project Panama: el precedente que abrió la puerta
El caso que convirtió la sospecha en hecho documentado es el de Anthropic. Documentos internos desclasificados en enero de 2026 dentro del juicio Bartz v. Anthropic describen una operación bautizada "Project Panama", cuya definición era tan directa como perturbadora: "Project Panama es nuestro esfuerzo por escanear destructivamente todos los libros del mundo" (Mashable). Liderada por Tom Turvey, ex responsable de alianzas de Google Books, la operación contrató a proveedores con cutters hidráulicos para separar los lomos y escanear las páginas sueltas a alta velocidad. El papel se reciclaba; no quedaba copia física.
Las cifras que salieron a la luz, según la cobertura de IBTimes, Snopes y Ars Technica:
- Más de 7 millones de libros pirateados descargados por Anthropic de repositorios como LibGen y Books3, según la orden del juez William Alsup de junio de 2025.
- Acuerdo de US$1.500 millones con autores y editoriales, aprobado en julio de 2026, repartiendo aproximadamente US$3.000 por cada uno de los cerca de 482.000 títulos afectados.
En junio de 2025, el juez Alsup dictó que escanear libros comprados legalmente —aunque se destruya el original— constituía transformative fair use bajo derecho estadounidense. Esa decisión, aunque proviene de un tribunal de distrito y no crea precedente vinculante porque Anthropic llegó a un acuerdo sin apelar, funciona como cobertura legal provisional para otras empresas de IA que operan en EE.UU. Anthropic, xAI y otras compañías han declarado que sus programas de adquisición no compran ni destruyen libros raros o anticuarios. Amazon, en cambio, no ha emitido esa misma aclaración (Snopes).
La pista de Amazon: un AirTag dentro de un envío
La confirmación más visual llegó en agosto de 2026. Una investigación de 404 Media colocó un Apple AirTag de US$29 dentro de un pedido de aproximadamente 1.000 libros sospechosos de ir a entrenamiento de IA. El rastreador viajó de Milwaukee a Grand Junction y terminó en un complejo logístico de Amazon en Las Vegas (LAS8), concretamente en una unidad interna llamada VGT3 (TechTimes).
Empleados de Amazon describieron, en un foro interno, el flujo de trabajo: palés de libros que llegan, corte del lomo con cutters, páginas sueltas por escáneres industriales y descarte del papel. "Todo lo que hacemos aquí es escanear libros", escribió un trabajador, según recogió Tom's Hardware. La relevancia no es solo operativa: Amazon había negado previamente participar en escaneo destructivo. El AirTag desmintió esa afirmación de manera categórica. El reportaje detalla además que los trabajadores de VGT3 escanean primero el ISBN de cada libro antes de escanear sus páginas, lo que permite a la operación construir un registro sistemático de qué ha consumido y qué falta —una pista de que la adquisición apunta a cubrir huecos concretos del corpus de entrenamiento.
Japón, país de colección de libros y de un vacío legal concreto
Japón ocupa un lugar peculiar en este mapa. Su ley de propiedad intelectual (artículo 30-4) permite, en principio, el uso de obras con derechos para "análisis de información" —lo que incluye entrenamiento de IA— sin necesidad de pedir consentimiento al titular (note.com). Esto lo convierte en un terreno especialmente atractivo para operaciones que en Reino Unido o Alemania serían directamente ilegales: la especialista en propiedad intelectual de la Universidad de Oxford Emily Hudson explicó a la BBC que el derecho británico exige permiso tanto para crear el dataset como para entrenar con él, y la Publishers and Booksellers' Association de Alemania sostiene que escanear libros infringe sus leyes sin importar que la copia física se haya comprado legalmente.
En el otro extremo, 19 organizaciones del sector japonés —entre ellas Kodansha, KADOKAWA y la Japan Cartoonists Association— han firmado un comunicado conjunto reclamando consentimiento, transparencia y un sistema de opt-in. La práctica que se observa en Okayama esquiva por completo ambos lados del debate: no se solicita permiso y se mantiene la destrucción como mecanismo para evitar que la copia vuelva al mercado y se reutilice como dato en futuras iteraciones de entrenamiento.
Qué significa esto para tu startup
Para founders que construyen sobre IA, el caso japonés es relevante por tres vías concretas:
- Coste y disponibilidad de datos de entrenamiento. Si dependes de datasets abiertos o de scraping web para entrenar modelos propios, asume que la calidad del texto web está cayendo: el 74,2% de páginas nuevas ya contenía material generado por IA en abril de 2025 (Ahrefs, vía TechTimes). Quien necesite datos limpios tendrá que pagar más, buscar acuerdos de licenciamiento o construir datasets sintéticos propios con verificación humana.
- Riesgo legal asimétrico por geografía. Un mismo flujo —comprar libros, escanearlos y destruir el original— es legal bajo la doctrina del fair use en EE.UU. (ruling Alsup, 2025), discutible en Japón bajo el artículo 30-4, y explícitamente problemático en Reino Unido y Alemania. Si tu startup tiene operaciones o clientes en múltiples jurisdicciones, el diseño del pipeline de datos debe contemplar esa asimetría desde el principio.
- Riesgo reputacional y de cadena de suministro. Si tu producto depende de un socio que adquiere datos por canales opacos —como demostró el caso de ISBNdb, que retiró su oferta tras la presión mediática en julio de 2026 (Mashable)—, documentar la procedencia del dato pasa de buena práctica a necesidad de due diligence para inversores y clientes enterprise.
Conclusión
El fenómeno de las librerías japonesas no es una curiosidad periodística: es un termómetro del lado menos visible del entrenamiento de IA. La cadena completa —pedidos automatizados, consolidación logística, exportación transoceánica, escaneo destructivo, archivo privado— ya está funcionando en producción, y los tribunales empiezan a ponerle nombres y cifras. Para cualquier founder que construya sobre modelos de IA, la pregunta ya no es si este mercado existe, sino si tu producto va a depender de un dato que prefieres no explicar a tu próximo enterprise customer.
Fuentes
- Tom's Hardware — Japanese used bookstores see 5x sales surge (fuente original)
- note.com — Mysterious Bulk Orders for Books at Secondhand Bookstores Increasing
- IBTimes — Inside Project Panama, Anthropic's Secret Effort
- TechTimes — Amazon Destroys Rare Books for AI Training
- Mashable — AI companies are turning old books into training data
- Snopes/Yahoo — Fact Check: AI companies scanning and destroying millions of books
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














