Warum der Fall vor Gericht landete
ANI verklagte, nachdem festgestellt wurde, dass die Antworten von ChatGPT auf Anfragen zu aktuellen indischen Nachrichten ihren eigenen im August und September 2024 veröffentlichten Artikeln ähnelten. Die Agentur argumentierte, dass das Large Language Model (LLM) ihren urheberrechtlich geschützten Text reproduziere – eine Behauptung, die, falls sie bestätigt würde, OpenAI dazu zwingen könnte, seine Modelle in Indien einzustellen oder stark einzuschränken.
OpenAI entgegnete, dass die beiden genannten Modelle – GPT-4 und das neuere GPT-4o – mit Daten trainiert wurden, deren Wissensstand (Cut-off-Datum) im April 2022 bzw. April 2024 lag. Die Artikel von ANI erschienen erst nach diesen Daten und konnten daher nicht Teil des ursprünglichen Trainingsdatensatzes gewesen sein. Richter Amit Bansal erklärte, dass die Überschneidung höchstwahrscheinlich auf Retrieval-Augmented Generation (RAG) zurückzuführen sei, die aktuelle Webinhalte in Echtzeit in die Antwort einbezieht, und nicht darauf, dass das Modell sich an die Artikel „erinnert“.
Der rechtliche Wendepunkt: Training als „Forschung“
Der Fall ist von Bedeutung, weil das Gericht Indiens Urheberrechtsausnahme für die „private oder persönliche Nutzung, einschließlich Forschung“ weit auslegte. Beide Seiten stimmten zu, dass OpenAI ANI-Material während der anfänglichen Trainingsphase verwendete, doch der Richter wertete diese Nutzung als „transformativ“. Mit anderen Worten: Das Modell extrahierte lediglich Grammatik, Syntax und statistische Muster, während der expressive Inhalt unberührt blieb.
Das Gericht stellte zwei strenge Bedingungen auf:
- Kopien, die für das Training verwendet werden, müssen aus rechtmäßigen Quellen stammen und dürfen nicht aus Raubkopien-Archiven oder Paywalls bestehen, auf die der Nutzer keinen Zugriff hat.
- Das Material muss innerhalb der eigenen Umgebung des Entwicklers bleiben; es darf nicht veröffentlicht oder verbreitet werden.
Unter Anwendung eines dreiteiligen Fairness-Tests stellte der Richter fest, dass die Nutzung durch OpenAI auf das Training beschränkt war, sah keine Beweise dafür, dass das Modell Passagen wortwörtlich auswendig gelernt hatte, und merkte an, dass ANI kein direkter wirtschaftlicher Schaden entstanden war, da die beiden Unternehmen in unterschiedlichen Marktsegmenten tätig sind.
Einordnung in einen Flickenteppich globaler Urteile
Indiens Standpunkt spiegelt nun mehrere US-Fälle wider, die eine transformative Sichtweise auf KI-Outputs befürworten. Im Fall Kadrey v. Meta entschied ein Gericht, dass generierter Text, der nicht den exakten Wortlaut kopiert, keine Urheberrechtsverletzung darstellt, während die langjährige Google Books-Entscheidung eine begrenzte „Search-and-Display“-Ausnahme für Digitalisierungsprojekte anerkannte. Andere US-Klagen, wie der Fall Raw Story, wurden mangels nachweisbaren Schadens abgewiesen, doch die Anthropic-Kontroverse erinnerte die Richter daran, dass die Verwendung von Raubkopien dennoch eine Haftung auslösen kann.
In Europa gehen die Meinungen weit auseinander. Gerichte in München haben entschieden, dass die Reproduktion von Songtexten, die in den Modellgewichten (model weights) eingebettet sind, eine Urheberrechtsverletzung darstellt, während ein Londoner Schiedsgericht kürzlich eine Klage gegen Stability AI aus ähnlichen Gründen abwies. Das Urteil des Delhi High Court liefert einen weiteren Datenpunkt: Wenn das Training auf rechtmäßige Quellen beschränkt ist und der Output keine wortwörtliche Kopie ist, könnte die Tätigkeit unter eine Forschungs-Ausnahme fallen.
Worauf Entwickler achten sollten
- RAG vs. Training – Die Unterscheidung des Gerichts zwischen „Memorierung“ (Training) und Echtzeit-Abruf (RAG) deutet darauf hin, dass sich künftige Streitigkeiten darauf konzentrieren werden, ob eine Antwort aus einer statischen Wissensdatenbank stammt oder live aus dem Web abgerufen wird. Entwickler müssen diese Grenze möglicherweise in der Produktdokumentation klarer ziehen.
- Herkunft der Quellen (Source provenance) – Die Anforderung „rechtmäßiger Quellen“ könnte Unternehmen dazu veranlassen, ihre Datenkuratierungs-Pipelines zu verschärfen und Verträge oder Lizenzen zu nutzen, die belegen, dass jeder Textabschnitt legitim ist.
- Nur interne Nutzung – Unternehmen, die planen, Modell-Outputs zu kommerzialisieren, müssen Trainingsdaten streng intern halten. Das Teilen von Rohkorpora mit Partnern oder der Öffentlichkeit könnte die Verteidigung über die Forschungs-Ausnahme schwächen.
- Test auf wirtschaftlichen Schaden – Da das Gericht das Fehlen eines direkten finanziellen Schadens betonte, müssen Kläger konkrete Verluste nachweisen können und nicht nur eine wahrgenommene Markenverwässerung.
- Gesetzgeberische Reaktion – Indische Gesetzgeber beobachten die urheberrechtlichen Debatten im Bereich KI. Jede Änderung, die die Forschungs-Ausnahme einschränkt, könnte sich rückwirkend auf bereits eingesetzte Modelle auswirken und eine Welle von Compliance-Audits auslösen.
Das Gegenargument, das die KI weiterhin beschäftigt
Die Beschwerde von ANI verdeutlichte eine berechtigte Sorge: Da LLMs immer geschickter darin werden, spezifische Formulierungen zu imitieren, kann die Grenze zwischen „transformativer“ Nutzung und einer „Kopie“ verschwimmen. Kritiker argumentieren, dass RAG – obwohl es technisch gesehen eine Suchfunktion ist – dennoch urheberrechtlich geschützte Inhalte ohne Erlaubnis aufruft, was potenziell das Recht auf „öffentliche Wiedergabe“ verletzt.
Ein Präzedenzfall mit weltweiten Auswirkungen
Indem der Delhi High Court das Modelltraining als zulässige Forschungsaktivität einstuft, signalisierte er, dass Indien die Entwicklung großer Sprachmodelle nicht automatisch aus Urheberrechtsgründen blockieren wird, sofern die Entwickler die Rechtmäßigkeit der Quellen respektieren und das Training intern halten. Diese Auslegung könnte Unternehmen dazu ermutigen, ihre Geschäftstätigkeit in Indien auszuweiten, da sie wissen, dass eine wesentliche rechtliche Hürde abgemildert wurde.
Für Regulierungsbehörden an anderen Orten bietet das Urteil eine Vorlage: definieren Sie eine enge, gut dokumentierte Forschungsausnahme, legen Sie klare Standards für die Quellenbeschaffung fest und verlangen Sie eine rein interne Handhabung der Trainingsdaten. Nationen, die eine ähnliche Gesetzgebung verabschieden, könnten ihren heimischen KI-Ökosystemen die Sicherheit geben, die notwendig ist, um Investitionen anzuziehen.
Fazit: Die Entscheidung des Delhi High Court gewährt keinen Freibrief für das Scraping beliebiger Texte für das KI-Training, stellt aber fest, dass nach indischem Recht diszipliniertes, gesetzeskonformes Training als Forschung gilt. Diese Auslegung könnte als Referenzpunkt für Gerichte weltweit dienen, während diese damit ringen, ob das Beibringen von Sprachverständnis an Maschinen eine geschützte wissenschaftliche Tätigkeit oder eine drohende Urheberrechtsverletzung darstellt.
