Internet fylls alltmer av text skriven av AI, vilket har fått flera AI-utvecklare att leta efter en resurs som garanterat är fri från sådant innehåll: tryckta böcker utgivna innan språkmodeller började skriva åt oss. Enligt en rapport som Slashdot beskrev den 21 juli 2026 köper AI-bolag stora mängder äldre böcker, just för att de är strukturellt garanterade fria från AI-genererat material.
Anledningen är risken för så kallad modellkollaps, ett fenomen där språkmodeller som tränas på alltmer AI-genererad text gradvis blir sämre och mer felbenägna. Ju mer webben fylls med maskinskrivet innehåll, desto svårare blir det att hitta färsk, mänskligt skriven text att träna på. Böcker utgivna före ungefär 2022 blir därför en särskilt värdefull källa, eftersom de existerade innan AI-genererad text blev vanlig.
Ett exempel som lyfts fram i rapporten är ISBNdb, ett bolag som driver vad man kallar världens största bokdatabas och erbjuder storskalig bokinsamling specifikt för AI-träning. Bolaget marknadsför böcker som kurerad, granskad och ämnesspecifik mänsklig kunskap, strukturerad på ett sätt som ingen webbcrawl kan återskapa. Enligt samma rapport använder skanningsföretag som Datamation så kallad destruktiv skanning, där bokryggar skärs bort så att sidorna kan matas genom automatiska dokumentläsare. Metoden är snabbare och billigare än skonsam skanning, men förstör de fysiska böckerna i processen, vilket enligt rapporten är en anledning till att bolagen erbjuder sekretessavtal kring arbetet.
Trenden med gamla böcker ska dock hållas isär från ett annat, redan avgjort ärende: den miljardförlikning som Anthropic just tvingats betala. En amerikansk federal domare, Araceli Martinez-Olguin, godkände i veckan en förlikning på 1,5 miljarder dollar efter en grupptalan från författare och förlag som stämt bolaget för att ha tränat sin chatbot Claude på piratkopierade böcker, enligt Computer Sweden och Breakit. Ytterligare detaljer om domen finns hos Slashdot.
Domstolen slog fast att omkring 482 000 böcker omfattas av förlikningen, med en ersättning på ungefär 3 000 dollar per bok, och att 91 procent av rättighetshavarna redan hade gjort anspråk på sin del när domen godkändes. Enligt uppgifter i målet hade Anthropic lagrat över sju miljoner piratkopierade böcker i ett centralt bibliotek. Kärandens ombud, Justin Nelson, kallade uppgörelsen den största kända upphovsrättsersättningen någonsin. Domstolen gjorde samtidigt en viktig åtskillnad: att träna en AI-modell på upphovsrättsskyddade böcker är i sig lagligt, men att hämta materialet från piratkopierade skuggbibliotek är det inte.
De två händelserna hänger ihop. När rättsläget gör det allt dyrare och farligare att skrapa internet eller använda skuggbibliotek för träningsdata, växer intresset för lagliga vägar att komma åt högkvalitativt material, till exempel att helt enkelt köpa upp de fysiska böckerna direkt.
