Kategorier
Artiklar

AI-bolag jagar gamla böcker som ren träningsdata, medan Anthropic betalar miljardbelopp för piratkopior

Internet fylls alltmer av text skriven av AI, vilket har fått flera AI-utvecklare att leta efter en resurs som garanterat är fri från sådant innehåll: tryckta böcker utgivna innan språkmodeller började skriva åt oss. Enligt en rapport som Slashdot beskrev den 21 juli 2026 köper AI-bolag stora mängder äldre böcker, just för att de är strukturellt garanterade fria från AI-genererat material.

Anledningen är risken för så kallad modellkollaps, ett fenomen där språkmodeller som tränas på alltmer AI-genererad text gradvis blir sämre och mer felbenägna. Ju mer webben fylls med maskinskrivet innehåll, desto svårare blir det att hitta färsk, mänskligt skriven text att träna på. Böcker utgivna före ungefär 2022 blir därför en särskilt värdefull källa, eftersom de existerade innan AI-genererad text blev vanlig.

Ett exempel som lyfts fram i rapporten är ISBNdb, ett bolag som driver vad man kallar världens största bokdatabas och erbjuder storskalig bokinsamling specifikt för AI-träning. Bolaget marknadsför böcker som kurerad, granskad och ämnesspecifik mänsklig kunskap, strukturerad på ett sätt som ingen webbcrawl kan återskapa. Enligt samma rapport använder skanningsföretag som Datamation så kallad destruktiv skanning, där bokryggar skärs bort så att sidorna kan matas genom automatiska dokumentläsare. Metoden är snabbare och billigare än skonsam skanning, men förstör de fysiska böckerna i processen, vilket enligt rapporten är en anledning till att bolagen erbjuder sekretessavtal kring arbetet.

Trenden med gamla böcker ska dock hållas isär från ett annat, redan avgjort ärende: den miljardförlikning som Anthropic just tvingats betala. En amerikansk federal domare, Araceli Martinez-Olguin, godkände i veckan en förlikning på 1,5 miljarder dollar efter en grupptalan från författare och förlag som stämt bolaget för att ha tränat sin chatbot Claude på piratkopierade böcker, enligt Computer Sweden och Breakit. Ytterligare detaljer om domen finns hos Slashdot.

Domstolen slog fast att omkring 482 000 böcker omfattas av förlikningen, med en ersättning på ungefär 3 000 dollar per bok, och att 91 procent av rättighetshavarna redan hade gjort anspråk på sin del när domen godkändes. Enligt uppgifter i målet hade Anthropic lagrat över sju miljoner piratkopierade böcker i ett centralt bibliotek. Kärandens ombud, Justin Nelson, kallade uppgörelsen den största kända upphovsrättsersättningen någonsin. Domstolen gjorde samtidigt en viktig åtskillnad: att träna en AI-modell på upphovsrättsskyddade böcker är i sig lagligt, men att hämta materialet från piratkopierade skuggbibliotek är det inte.

De två händelserna hänger ihop. När rättsläget gör det allt dyrare och farligare att skrapa internet eller använda skuggbibliotek för träningsdata, växer intresset för lagliga vägar att komma åt högkvalitativt material, till exempel att helt enkelt köpa upp de fysiska böckerna direkt.

Kategorier
Bloggsvep

Kalifornien: självregleringen otillräcklig

En ny expertrapport beställd av Kaliforniens guvernör slår fast att de stora techbolagens egen granskning av sina AI-modeller är ”helt otillräcklig”. Författarna kräver att oberoende tredje parter får i uppdrag att säkerhetstesta tekniken för att identifiera och hantera de allvarliga risker som den medför.

En tung expertgrupp, ledd av forskare från Stanford och Berkeley, har på uppdrag av Kaliforniens guvernör Gavin Newsom utrett hur delstaten bör reglera de allt kraftfullare AI-modellerna. Resultatet är en 52-sidig rapport som publicerades på tisdagen och som manar till skärpt kontroll.

Rapporten kommer efter att Newsom förra året lade in sitt veto mot ett lagförslag som syftade till att reglera alla stora AI-modeller. Guvernören ansåg att lagen var för onyanserad och gav istället forskargruppen i uppdrag att ta fram ett alternativt förslag som balanserar innovation med nödvändiga skyddsåtgärder.

Enligt rapportförfattarna har AI-utvecklingen gått så snabbt att riskerna har ökat markant sedan vetot i höstas. De pekar särskilt på växande bevis för att modellerna kan bidra till utvecklingen av kemiska, biologiska och nukleära vapen.

Rapportens huvudkritik riktas mot den nuvarande ordningen där AI-företag som OpenAI, Google och Anthropic i hög grad ansvarar för sina egna säkerhetsutvärderingar. ”Utvecklarna är helt enkelt otillräckliga för att fullt ut förstå tekniken och, i synnerhet, dess risker och skadeverkningar”, skriver författarna.

Lösningen, enligt experterna, är ett system som kräver granskning av oberoende, externa utvärderare. De menar att tusentals individer utanför företagen har den mångfald och expertis som krävs för att upptäcka svagheter som utvecklarna själva missar.

Ett stort hinder är dock techbolagens ovilja att ge utomstående den djupa tillgång till modellerna som krävs för meningsfulla tester. Rapporten lyfter ett exempel där företaget Metr, som anlitats av OpenAI för säkerhetstester, uppgav att de inte fick tillräckligt med tid eller tillgång för att göra en robust bedömning av en ny AI-modell.

För att möjliggöra oberoende granskning föreslår rapporten ett rättsligt skydd, en så kallad ”säker hamn”, för forskare som upptäcker och rapporterar säkerhetsbrister. Detta för att förhindra att företag använder sina användarvillkor för att hota eller vidta rättsliga åtgärder mot oberoende granskare.

Rapporten publiceras i ett läge där det på federal nivå i USA diskuteras ett tioårigt stopp för delstater att stifta egna AI-lagar. Enligt en av rapportens författare, Scott Singer, kan Kalifornien nu i stället leda en harmonisering mellan delstaterna för att skapa en gemensam standard för AI-reglering, skriver The Verge.

Kategorier
Produktsläpp

Midjourney släpper V6 alpha

Nu är den här: 6 är Midjourneys populära AI-modell för bildgenerering. Eller, i alpha-version i alla fall. Den kommer med löftet om mer realistiska bilder, högre detaljrikedom samt förmågan att generera läsbar text. V6 har förbättrad förmåga att följa mer detaljerade instruktioner, vilket ska resultera i visuellt imponerande och kontextuellt rika bilder.

Släppet har fått blandade reaktioner: vissa användare rapporterar ökad detaljrikedom och fotorealism, medan andra finner skillnaderna mindre märkbara jämfört med tidigare versioner. Andra saknar funktioner som fanns i V5.2 (men dessa förväntas läggas till i framtida uppdateringar).

För att använda V6 måste användare manuellt välja denna version via Midjourney’s Discord-server.

För en mer detaljerad beskrivning, läs mer på Hayo​ och TechEBlog​.

Kategorier
Bloggsvep

År noll: sex trender inom Generativ AI

I blogginlägget ”Year One of Generative AI: Six Key Trends” presenterar Foundation Capital vad de anser vara de viktigaste trenderna inom generativ AI under 2023.

De sex trenderna omfattar bland annat framväxten av RAG-system (retrieval-augmented generation), utvecklingen av AI-agenter, och användning av ensemble models.

Inlägget belyser även skiftet från individuell produktivitet till skapande av kompletta arbetsprodukter, utmaningar med att bygga dataskydd, och betydelsen av vertikal mjukvara i kombination med generativ AI. Inlägget understryker generativ AIs potential i olika branscher och uppmanar startups att innovera inom området.

Exit mobile version