Waarom de zaak voor de rechter kwam

ANI spande een rechtszaak aan nadat zij merkte dat de antwoorden van ChatGPT op vragen over recent Indiaas nieuws leken op haar eigen artikelen die in augustus en september 2024 waren gepubliceerd. Het agentschap voerde aan dat het grote taalmodel haar auteursrechtelijk beschermde tekst reproduceerde, een bewering die, indien gegrond, OpenAI zou dwingen haar modellen in India stop te zetten of zwaar te beperken.

OpenAI reageerde dat de twee genoemde modellen — GPT-4 en de nieuwere GPT-4o — waren getraind op gegevens met een kennisstop van april 2022 en april 2024. De artikelen van ANI verschenen na die data, dus ze hadden niet in de oorspronkelijke trainingsset kunnen zitten. Rechter Amit Bansal zei dat de overlap waarschijnlijk voortkwam uit Retrieval-Augmented Generation (RAG), waarbij actuele webinhoud in realtime in het antwoord wordt opgehaald, en niet doordat het model de artikelen "onthoudt".

De juridische wending: training als "onderzoek"

De zaak is belangrijk omdat de rechtbank de Indiase auteursrechtelijke uitzondering voor "privé- of persoonlijk gebruik, inclusief onderzoek" breed interpreteerde. Beide partijen waren het erover eens dat OpenAI ANI-materiaal gebruikte tijdens de initiële trainingsfase, maar de rechter beschouwde dat gebruik als "transformatief". Met andere woorden: het model extraheerde alleen grammatica, syntaxis en statistische patronen, terwijl de expressieve inhoud onaangetast bleef.

De rechtbank stelde twee strikte voorwaarden:

  • Kopieën die voor training worden gebruikt, moeten afkomstig zijn van rechtmatige bronnen, niet van illegale archieven of betaalmuren waar de gebruiker geen toegang toe heeft.
  • Het materiaal moet binnen de eigen omgeving van de ontwikkelaar blijven; het mag niet worden gepubliceerd of verspreid.

Bij het toepassen van een drieledige billigheidstoets oordeelde de rechter dat het gebruik door OpenAI beperkt bleef tot training, zag hij geen bewijs dat het model letterlijke passages uit het hoofd had geleerd, en merkte hij op dat ANI geen direct economisch verlies leed omdat de twee bedrijven in verschillende marktsegmenten opereren.

Hoe dit past in een lappendeken van wereldwijde uitspraken

De houding van India weerspiegelt nu verschillende Amerikaanse zaken die een transformatieve visie op AI-outputs bevoordelen. In Kadrey v. Meta oordeelde een rechtbank dat gegenereerde tekst die niet de exacte bewoordingen kopieert, geen inbreuk maakt, terwijl de langdurige Google Books-uitspraak een beperkte "zoek-en-toon"-uitzondering erkende voor digitaliseringsprojecten. Andere Amerikaanse rechtszaken, zoals de Raw Story-zaak, werden afgewezen wegens een gebrek aan aantoonbare schade, maar de Anthropic-controverse herinnerde rechters eraan dat het gebruik van illegale gegevens nog steeds aansprakelijkheid kan veroorzaken.

In Europa lopen de meningen sterk uiteen. Rechtbanken in München hebben geoordeeld dat het reproduceren van songteksten die in modelgewichten zijn ingebed, neerkomt op inbreuk, terwijl een tribunaal in Londen onlangs een claim tegen Stability AI op vergelijkbare gronden afwees. De uitspraak van het Delhi High Court voegt een nieuw datapunt toe: als training beperkt blijft tot rechtmatige bronnen en de output geen letterlijke kopie is, kan de activiteit onder een onderzoeks-uitzondering vallen.

Waar ontwikkelaars op moeten letten

  • RAG vs. training – Het onderscheid dat de rechtbank maakt tussen "memoriseren" (training) en realtime ophalen (RAG) suggereert dat toekomstige geschillen zich zullen richten op de vraag of een antwoord afkomstig is uit een statische kennisbank of live van het web wordt opgehaald. Ontwikkelaars moeten deze grens mogelijk duidelijker maken in de productdocumentatie.
  • Herkomst van bronnen – De vereiste van "rechtmatige bronnen" zou bedrijven kunnen dwingen hun pipelines voor datacuratie aan te scherpen, door gebruik te maken van contracten of licenties die bewijzen dat elk tekstfragment legitiem is.
  • Alleen intern gebruik – Bedrijven die van plan zijn AI-outputs te commercialiseren, moeten trainingsgegevens strikt intern houden. Het delen van ruwe corpora met partners of het publiek zou de verdediging op basis van onderzoek kunnen ondermijnen.
  • Test op economische schade – Omdat de rechtbank de afwezigheid van directe financiële schade benadrukte, zullen eisers concrete verliezen moeten aantonen, en niet alleen een vermeende verwatering van het merk.
  • Wetgevende reactie – Indiase wetgevers houden de debatten over auteursrecht in relatie tot AI nauwlettend in de gaten. Elke wijziging die de onderzoeks-uitzondering inperkt, zou retroactief effect kunnen hebben op modellen die al zijn ingezet, wat een golf van compliance-audits kan veroorzaken.

Het tegenargument dat AI nog steeds achtervolgt

De klacht van ANI onderstreepte een reële zorg: naarmate LLM's beter worden in het herhalen van specifieke formuleringen, kan de grens tussen "transformatief" gebruik en een "kopie" vervagen. Critici stellen dat RAG, hoewel het technisch gezien een zoekfunctie is, nog steeds auteursrechtelijk beschermde inhoud naar boven brengt zonder toestemming, wat mogelijk in strijd is met het recht op "mededeling aan het publiek".

Een precedent met wereldwijde gevolgen

Door modeltraining te classificeren als een toegestane onderzoeksactiviteit, gaf het Delhise Hooggerechtshof aan dat India de ontwikkeling van large language models niet automatisch zal blokkeren op basis van het auteursrecht, mits ontwikkelaars de legaliteit van de bronnen respecteren en de training intern houden. Deze interpretatie kan bedrijven aanmoedigen om hun activiteiten in India uit te breiden, in de wetenschap dat een belangrijke juridische hindernis is versoepeld.

Voor toezichthouders elders biedt de uitspraak een model: definieer een nauwe, goed gedocumenteerde onderzoeksexceptie, stel duidelijke standaarden voor brongebruik vast en vereis dat trainingsdata uitsluitend intern wordt verwerkt. Landen die vergelijkbare bepalingen overnemen, zouden hun binnenlandse AI-ecosystemen de nodige zekerheid kunnen bieden om investeringen aan te trekken.

De kern: De beslissing van het Delhise Hooggerechtshof geeft geen carte blanche om willekeurige teksten te scrapen voor AI-training, maar stelt vast dat onder het Indiase recht gedisciplineerde, wetgetrouwe training kwalificeert als onderzoek. Die interpretatie zou een referentiepunt kunnen worden voor rechtbanken wereldwijd, terwijl zij worstelen met de vraag of het aanleren van taalbegrip aan machines een beschermde wetenschappelijke activiteit is of een inbreuk die op het punt staat te gebeuren.