In un'era dominata dall'intelligenza artificiale, emerge una pratica inquietante che minaccia il patrimonio culturale: la distruzione di milioni di libri. Grandi quantità di volumi vengono acquisiti, privati della loro rilegatura attraverso processi industriali, digitalizzati pagina per pagina e infine destinati al macero. Questa procedura, nota come "scansione distruttiva", non è una trama distopica, ma una realtà nel processo di acquisizione dati per l'addestramento dei modelli di intelligenza artificiale.
La rivelazione è emersa lo scorso gennaio, grazie a un'indagine del Washington Post, basata su documenti giudiziari relativi ad Anthropic, l'azienda sviluppatrice del modello linguistico Claude. I documenti hanno svelato il "Project Panama", un'iniziativa avviata nel 2024 con l'obiettivo di trasformare enormi quantità di libri in dati digitali. Successive indagini di 404 Media hanno evidenziato come i libri fisici, specialmente quelli antecedenti all'esplosione dell'IA generativa, siano diventati una risorsa preziosa per le aziende che cercano materiale di addestramento prodotto da esseri umani, privo dei cosiddetti "AI slop", ovvero i contenuti sintetici che ormai affollano il web. Questo paradosso sottolinea una dipendenza dell'IA dai testi umani, in un contesto dove il web è sempre più saturo di contenuti generati dall'intelligenza artificiale stessa.
La legalità di tale pratica ha generato un dibattito acceso, in particolare negli Stati Uniti. Nel caso Bartz vs Anthropic, un giudice federale ha stabilito nel giugno 2025 che l'uso delle opere per l'addestramento di Claude poteva rientrare nel "fair use", considerando la digitalizzazione dei libri legalmente acquistati un'attività trasformativa. Tuttavia, il giudice ha escluso la giustificazione del "fair use" per la creazione di biblioteche permanenti tramite copie piratate, portando a un accordo di 1,5 miliardi di dollari per oltre 480 mila opere acquisite illegalmente da "shadow libraries". In Europa, la direttiva sul copyright non prevede un equivalente generale del "fair use", ma consente l'estrazione automatizzata di informazioni (text and data mining) da opere legalmente accessibili, purché i titolari dei diritti non abbiano espresso il loro "opt-out". Dal 2 agosto 2025, l'AI Act impone ai fornitori di modelli di IA di rispettare il diritto d'autore dell'Unione e di pubblicare dettagli sui contenuti usati per l'addestramento. La questione fondamentale rimane come bilanciare le esigenze di addestramento dell'IA con la tutela dei diritti d'autore e la conservazione del patrimonio culturale. Mentre per secoli abbiamo costruito biblioteche per la lettura umana, ora sorgono biblioteche digitali invisibili, destinate primariamente alle macchine. Si pone quindi la domanda su quanto siamo disposti a sacrificare del nostro patrimonio culturale per la costruzione di future intelligenze artificiali.
La digitalizzazione distruttiva dei libri per alimentare l'intelligenza artificiale ci invita a riflettere profondamente sull'equilibrio tra innovazione tecnologica e conservazione del sapere. È essenziale che il progresso scientifico sia guidato da principi etici che salvaguardino il patrimonio culturale e i diritti degli autori, assicurando che la sete di dati dell'IA non porti alla cancellazione della storia e del lavoro umano. Solo così potremo costruire un futuro in cui la tecnologia sia al servizio dell'umanità e della cultura, e non a loro discapito, promuovendo un'innovazione responsabile e sostenibile.
