
© Unsplash
Waarom versnipperde Anthropic miljoenen boeken om Claude te trainen?
Anthropic, het bedrijf achter chatbot Claude, kocht in 2024 miljoenen papieren boeken op bij groothandelaren en retailers. Die boeken werden uit hun kaft gehaald, de pagina's werden op maat gesneden, de inhoud werd ingescand en het papier weggegooid. Elk boek werd een pdf. En dat mocht van de rechter gewoon.
Op 21 juli publiceerde de Amerikaanse techsite 404 Media een reportage over ISBNdb, een bedrijf dat een grote boekendatabase beheert en tegenwoordig ook bulkaankopen van fysieke boeken regelt voor AI-bedrijven. Een paar dagen later ging het verhaal viraal op X, het voormalige Twitter.
Een taalmodel trainen vergt enorme hoeveelheden tekst. Die kun je van het web schrapen, maar de kwaliteit is wisselend. Een reactie onder een YouTube-video is nu eenmaal minder bruikbaar dan een gedetailleerde blogpost van een wetenschapper. Erger nog: een steeds groter deel van de content op het web is inmiddels zelf door AI geschreven. Die data is waardeloos om een AI-model te trainen.
Boeken zijn het tegenovergestelde. Ze zijn geschreven door mensen die er jaren aan hebben gewerkt en ze zijn nagelezen en herschreven door eindredacteurs. Gedrukte boeken van voor 2022 kunnen onmogelijk met behulp van generatieve AI zijn gemaakt. Dat maakt oud papier ineens zeer waardevol.
Van piraterij naar bulkaankopen
Anthropic begon niet met kopen. Eerst downloadde het bedrijf meer dan zeven miljoen boeken van piratenwebsites. Toen dat juridisch te riskant begon te worden, huurde het in februari 2024 Tom Turvey in, die bij Google Books over de partnerschappen ging. Zijn opdracht, en dat staat letterlijk in de rechtbankstukken: bemachtig alle boeken ter wereld.