Per anni le aziende che sviluppano intelligenze artificiali hanno usato il web come fonte principale. Ora che questa gigantesca miniera di informazioni si sta esaurendo e che buona parte dei testi sono attualmente generati da iA generative le soluzioni sono due. La prima è ricorrere all’uso dei testi generati dagli utenti sui social, l’altra è usare libri scritti prima del 2022 (anno in cui comparve chat gpt). Ora, dunque, sempre più operatori del comprano enormi quantità di libri cartace, preferibilente fuori catalogo, talvolta anche rari o antichi, per trasformarli in dati destinati all’addestramento delle IA. Il problema però è che una volta acquisiti questi volumi vengono smembrati, scansionati e infine distrutti. La pratica è stata documentata da diverse inchieste giornalistiche, prima tra tutte quella del Washington Post, e confermata da aziende che operano nella digitalizzazione. In pratica Per addestrare l’IA stanno comprando e distruggendo milioni di libri come in una versione moderna di Fahrenheit 451.
Perché per addestrare l’IA stanno comprando e distruggendo milioni di libri?
Il motivo principale è che rappresentano una delle poche grandi fonti di testi certamente scritti da esseri umani. Da quando l’intelligenza artificiale generativa ha iniziato a produrre articoli, siti web, post e documenti in quantità sempre maggiore, Internet è diventato progressivamente “contaminato” da contenuti sintetici. E si rischia che i modelli comincino a incappare in quello che viene definito Addestrare nuovi modelli su testi già prodotti da altre IA potrebbe provocare il cosiddetto model collapse, cioè un progressivo peggioramento della qualità dei modelli stessi. Errori, semplificazioni e ripetizioni rischiano infatti di accumularsi a ogni nuova generazione. Per questo motivo, i libri cartacei precedenti all’esplosione dell’IA costituiscono un archivio linguistico “pulito”. Sono ricchi di sfumature stilistiche, lessicali e culturali ormai sempre più difficili da trovare online. Non a caso vengono ricercati soprattutto testi di storia locale, diritto, economia, linguistica, manualistica e saggistica pubblicati dagli anni Settanta in poi.
A tale proposito puoi leggere: L’IA domima Internet, i bot generano più traffico web dell’uomo
L’orrore chiamato Destructive scanning e il “fair use”: la scappatoia legale
A rendere tossica la vicenda è il modo in cui questi libri vengono utilizzati. La procedura è nota nel settore come destructive scanning (“scansione distruttiva”). Dopo l’acquisto, infatti, i dorsi dei volumi vengono tagliati, le pagine separate e fatte scorrere negli scanner ad alta velocità. Un procedimento essenziale per soddisfare la voracità delle macchine. Terminata la digitalizzazione, i libri smembrati vengono poi riciclati come carta da macero. Si tratta di una procedura che nasconde una precisa strategia legale. Negli Stati Uniti, infatti, il principio del fair use (“uso leale”) consente, in determinate circostanze, di utilizzare opere protette dal diritto d’autore senza autorizzazione quando l’impiego è considerato “trasformativo”.
C’è poi un’altra ragione, meno nota ma altrettanto importante
Negli ultimi anni alcuni ricercatori e autori hanno iniziato a sviluppare tecniche di data poisoning (“avvelenamento dei dati”). Si tratta di metodi per inserire nei testi elementi invisibili agli esseri umani, ma in grado di confondere i modelli di IA durante l’addestramento. L’obiettivo è impedire che le opere protette vengano utilizzate senza autorizzazione. Per chi vi scrive una tecnica più che legittima di sopravvivenza contro l’abuso delle intelligenze artificiali generative.
Secondo una ricerca interna citata dalla società ISBNdb, che oggi offre alle aziende di IA servizi di acquisizione all’ingrosso di libri cartacei, sarebbero sufficienti appena 250-500 documenti “avvelenati” all’interno di un archivio composto da migliaia di miliardi di token (le piccole unità di testo, come parole o parti di parole, con cui le IA elaborano il linguaggio) per introdurre una cosiddetta backdoor. Si tratta di una sorta di “porta nascosta” che induce il modello a comportarsi in modo anomalo alla ricezione di determinati input. La reale portata del fenomeno è ancora oggetto di studio, ma contribuisce a spiegare perché i grandi laboratori di IA stiano tornando sempre più spesso agli scaffali delle librerie antiquarie anziché ai server di Internet.
La guerra delle informazioni è appena cominciata
Ginevra Leone
Leggi anche
- Nasce il bollino “Scritto da un essere umano” contro i libri generati dall’AI
- Amazon inserirà nei Kindle una iA che ti spiega i libri che non hai capito
- Adolescenti, con 2 ore di social al giorno rischio sintomi depressivi e malessere
- L’IA domima Internet, i bot generano più traffico web dell’uomo
- La paura della tecnologia in musica: dall’avvento del microfono all’era dell’intelligenza artificiale

