Una investigación publicada en agosto de 2026 ha confirmado que Amazon compra grandes cantidades de libros impresos, corta sus encuadernaciones y digitaliza las páginas para utilizarlas como material destinado al entrenamiento de inteligencia artificial. La operación salió a la luz después de que periodistas de 404 Media colocaran un dispositivo de rastreo dentro de un envío adquirido mediante una cadena de compradores. El recorrido terminó en una instalación de Amazon situada en Las Vegas, dedicada específicamente al escaneo destructivo de libros.
Un libro rastreado terminó en una instalación de Amazon
La investigación comenzó después de que libreros especializados detectaran pedidos masivos de títulos antiguos que parecían responder a criterios poco habituales dentro del comercio bibliográfico. Algunos compradores solicitaban grandes cantidades de obras sin mostrar especial interés por el estado físico de cada ejemplar, circunstancia que despertó sospechas entre vendedores acostumbrados a operaciones mucho más selectivas.
404 Media siguió uno de esos envíos mediante un dispositivo de localización oculto dentro de un libro. El paquete terminó en VGT3, una instalación de Amazon situada en Las Vegas, donde trabajadores describieron posteriormente un proceso dedicado a recibir ejemplares impresos para convertirlos en datos digitales. La encuadernación se elimina antes del escaneo, porque las páginas separadas pueden introducirse con mayor rapidez en equipos automatizados. El procedimiento vuelve inutilizable el volumen original.
El hallazgo aporta una prueba concreta a una preocupación que llevaba meses circulando entre libreros de Estados Unidos y Europa. The Wall Street Journal documentó recientemente pedidos extraordinarios realizados a comerciantes especializados, algunos de ellos relacionados con títulos difíciles de encontrar mediante repositorios digitales convencionales. La demanda parece concentrarse precisamente en materiales que pueden ampliar los conjuntos de textos disponibles para desarrollar modelos generativos.
Los libros antiguos adquieren nuevo valor como materia prima para la IA
Los desarrolladores de grandes modelos lingüísticos necesitan enormes cantidades de texto para mejorar sus sistemas. Una parte considerable del contenido disponible públicamente en internet ya ha sido utilizada dentro de distintos procesos de recopilación, por lo que determinados libros impresos ofrecen materiales difíciles de obtener mediante rastreo automatizado de páginas web.
Esta situación ha transformado títulos de circulación limitada en recursos valiosos para empresas tecnológicas. Los pedidos detectados por libreros incluyen obras académicas antiguas y publicaciones especializadas que nunca fueron digitalizadas comercialmente. En algunos casos también aparecen ediciones cuya disponibilidad física resulta reducida, lo que introduce una preocupación distinta relacionada con la conservación del patrimonio bibliográfico.
La Rare Book School de la Universidad de Virginia respaldó en febrero un protocolo destinado a proteger colecciones culturales frente al uso indiscriminado por sistemas de inteligencia artificial. El documento defiende que las instituciones responsables de archivos y fondos especiales deben conservar capacidad efectiva para decidir cómo se utilizan sus colecciones. Esta posición adquiere nueva importancia cuando la digitalización implica la destrucción física de ejemplares que podrían resultar difíciles de reemplazar.
Existen métodos alternativos que permiten digitalizar libros sin desmontarlos. El Internet Archive utiliza desde hace años procedimientos en los que los operadores fotografían las páginas conservando intactas las encuadernaciones, especialmente cuando trabajan con materiales frágiles. El proceso resulta más lento que cortar el lomo y alimentar un escáner automático, pero evita perder el objeto después de obtener la copia digital.
El conflicto editorial supera la cuestión de los derechos de autor
La compra legal de un ejemplar físico no elimina todas las controversias relacionadas con el uso posterior del contenido. En Estados Unidos, autores y editoriales mantienen litigios contra empresas tecnológicas por la utilización de obras protegidas durante el desarrollo de modelos generativos. La Association of American Publishers informó en julio de 2026 sobre una demanda colectiva presentada por Hachette, Cengage y Elsevier contra Google por el supuesto uso ilícito de millones de textos para desarrollar Gemini.
El caso de los ejemplares destruidos añade otra dimensión porque el libro posee simultáneamente contenido intelectual y existencia material. Cuando se corta una edición corriente disponible en miles de copias, la pérdida física puede resultar limitada. La situación cambia cuando el mismo procedimiento alcanza libros escasos, ejemplares firmados o publicaciones cuya supervivencia depende de pocas unidades conservadas.
Algunos libreros han comenzado por ello a examinar con mayor atención los pedidos de gran volumen. El mercado descubre así una consecuencia inesperada del crecimiento de la inteligencia artificial: textos que habían quedado fuera de los grandes procesos de digitalización se convierten ahora en recursos buscados por compañías capaces de comprarlos masivamente. La discusión ya no afecta únicamente a quién puede utilizar las palabras de un libro, pues también alcanza una pregunta material sobre qué ocurre con el ejemplar después de transformarlo en datos.