Het Amerikaanse ministerie van Justitie (DOJ) heeft een belangrijke juridische interventie uitgevoerd in de lopende auteursrechtstrijd tussen mediagiganten en AI-ontwikkelaars. Door te betogen dat het trainen van Large Language Models (LLM's) op auteursrechtelijk beschermde gegevens "fair use" vormt, heeft het DOJ een enorm juridisch schild geboden aan bedrijven als OpenAI en Microsoft.
Het argument van het DOJ: Training versus Output
In het hart van de gebundelde rechtszaak met The New York Times ligt een fundamenteel onderscheid tussen hoe een AI leert en wat het produceert. De New York Times stelt dat miljoenen van haar artikelen zonder toestemming zijn gebruikt om modellen zoals GPT-4 te trainen, wat schade van miljarden dollars heeft veroorzaakt en producten heeft gecreëerd die direct concurreren met de krant.
De recente indiening van het DOJ stelt echter dat inbreuk op het auteursrecht plaatsvindt op het moment van de output, niet op het moment van de ingestie. Het ministerie voert aan dat hoewel volledige werken worden gekopieerd tijdens de trainingsfase, deze kopieën nooit publiekelijk beschikbaar worden gemaakt. Bovendien stelt het DOJ dat de outputs van modellen zoals GPT-4 "vaak, zo niet altijd, een gebrek aan substantiële gelijkenis vertonen" met het oorspronkelijke bronmateriaal. Door het trainingsproces te scheiden van de gegenereerde inhoud, probeert het DOJ de handeling van machine learning los te koppelen van het juridische concept van marktvervanging.
De "Hemingway-analogie" en menselijke creativiteit
Om het concept van machine learning begrijpelijk te maken, riep het DOJ een literaire analogie aan met betrekking tot auteur Joan Didion. In de indiening werd opgemerkt dat Didion als tiener de verhalen van Ernest Hemingway kopieerde om zijn zinsstructuur te analyseren en zijn vak te leren. Het DOJ voert aan dat als de wet machine-training als inbreuk zou behandelen, een schrijver als Didion theoretisch aansprakelijk zou kunnen worden gesteld telkens wanneer zij nieuw werk publiceert, aangezien haar leerproces onlosmakelijk verbonden zou zijn met haar daaropvolgende schrijfwerk.
Het ministerie voert verder aan dat het opleggen van strikte aansprakelijkheid voor AI-training paradoxaal genoeg de creativiteit zou smoren die het auteursrecht juist beoogt te beschermen. Nu mensen steeds vaker LLM's gebruiken om originele werken op te stellen en
Het pleidooi splitst de AI-workflow in twee afzonderlijke fasen. Ten eerste neemt het model grote tekstcorpora op; ten tweede genereert het antwoorden op prompts van gebruikers. Het ministerie stelt dat inbreuk pas ontstaat wanneer een auteursrechtelijk beschermd werk wordt gereproduceerd op een manier waarop het publiek er toegang toe heeft. Omdat de trainingskopieën de servers van de ontwikkelaar nooit verlaten, voldoet de handeling van het opnemen van data niet aan die drempel.
Het DOJ leunt ook op de "substantial similarity"-test, een langdurige standaard binnen het auteursrecht. Het betoogt dat de tekst die wordt gegenereerd door modellen zoals GPT-4 "vaak, zo niet altijd" voldoende verschilt van elke individuele bron, zodat een eiser de vereiste gelijkenis niet kan bewijzen. Kortom, het pleidooi stelt dat de juridische focus moet liggen op de uiteindelijke output, en niet op het interne leerproces.
Een literaire analogie om het punt te illustreren
Om het technische argument toegankelijker te maken, roept het document een verhaal op over een tiener-schrijver die de verhalen van Ernest Hemingway kopieerde om zijn stijl te bestuderen. Het DOJ stelt dat als de wet die leeractiviteit als inbreuk zou behandelen, de schrijver elke keer aangeklaagd zou kunnen worden dat ze een nieuw stuk publiceert, ook al was haar werk origineel. Het ministerie waarschuwt dat het toepassen van dezelfde logica op AI "de creativiteit die het auteursrecht juist bedoeld is te beschermen, zou verlammen."
De belangen voor AI-ontwikkelaars en contentmakers
- Innovatierisico: Het vereisen van licenties voor elk stuk tekst dat voor training wordt gebruikt, zou de kosten zo hoog kunnen maken dat het bouwen van state-of-the-art modellen financieel onhaalbaar wordt.
- Creatieve workflow: Menselijke schrijvers vertrouwen steeds vaker op LLM's voor het opstellen, redigeren en brainstormen. Als het trainingsproces illegaal zou worden verklaard, zouden die tools kunnen verdwijnen, wat de manier waarop content in verschillende sectoren wordt geproduceerd, zou veranderen.
- Marktimpact: De krantenindustrie voert aan dat AI-modellen die vragen kunnen beantwoorden of nieuwsachtige teksten kunnen genereren, de waarde van originele verslaggeving uithollen, wat potentieel advertentie-inkomsten en abonnementen wegzuigt.
Het tegenargument van het Copyright Office
Een recent rapport van het Amerikaanse Copyright Office, geschreven onder voormalig Register Shira Perlmutter, verzette zich tegen een algemeen "fair use"-verweer. Het kantoor benadrukte drie factoren die AI onderscheiden van menselijk leren: de enorme hoeveelheid gekopieerd materiaal, de snelheid waarmee het wordt verwerkt, en het feit dat de resulterende modellen kunnen worden verpakt en verkocht als commerciële producten die direct concurreren met de oorspronkelijke makers.
Het DOJ weerlegt deze punten en merkt op dat het rapport geen bindende juridische autoriteit heeft en dat bestaande rechtspraak al een feitelijke analyse van "fair use" vereist. Het waarschuwt dat het opleggen van "brede aansprakelijkheid" de industrie effectief zou dwingen in een licentieregime dat "de ontwikkeling van geavanceerde AI-modellen juridisch en financieel onmogelijk zou maken."
Wat er nu zou kunnen gebeuren
De rechtbank die de Times-zaak behandelt, zal de positie van het DOJ met betrekking tot "fair use" moeten afwegen tegen de bevindingen van het Copyright Office. Een uitspraak in het voordeel van het DOJ zou een precedent scheppen dat trainingsdata kan worden geoogst zonder expliciete toestemming, mits de output van het model geen "substantial similarity" vertoont. Een besluit dat de krant steunt, zou een golf van licentieonderhandelingen kunnen ontketenen, wat de economie van AI-onderzoek mogelijk zou hervormen.
De kern
Het pleidooi van het DOJ verandert de vraag of AI-training "fair use" is in een juridische strijd met grote belangen. De uitkomst zal bepalen of ontwikkelaars krachtige taalmodellen kunnen blijven bouwen op bestaande teksten, of dat ze voor elk stuk materiaal dat ze opnemen, kostbare licenties moeten aanvragen. De beslissing zal doorwerken in de techsector, de media-industrie en de bredere creatieve economie.
