Amerykański Departament Sprawiedliwości (DOJ) podjął znaczącą interwencję prawną w trwającej wojnie o prawa autorskie między gigantami medialnymi a twórcami AI. Argumentując, że trenowanie dużych modeli językowych (LLM) na chronionych prawem autorskim danych stanowi „dozwolony użytek” (fair use), DOJ zapewnił potężną tarczę prawną firmom takim jak OpenAI i Microsoft.
Argumentacja DOJ: Trening a wynik
W samym centrum skonsolidowanego pozwu dotyczącego The New York Times leży fundamentalne rozróżnienie między tym, jak uczy się AI, a tym, co produkuje. The New York Times twierdzi, że miliony jego artykułów zostały wykorzystane bez pozwolenia do trenowania modeli takich jak GPT-4, co spowodowało miliardy dolarów strat i doprowadziło do powstania produktów bezpośrednio konkurujących z gazetą.
Jednak w niedawnym piśmie procesowym DOJ argumentuje, że naruszenie praw autorskich następuje w momencie generowania wyniku, a nie w momencie pobierania danych (ingestion). Departament twierdzi, że choć podczas fazy treningu kopiowane są całe dzieła, kopie te nigdy nie są udostępniane publicznie. Co więcej, DOJ utrzymuje, że wyniki modeli takich jak GPT-4 „często, jeśli nie zawsze, nie wykazują istotnego podobieństwa” do oryginalnego materiału źródłowego. Oddzielając proces trenowania od generowanej treści, DOJ próbuje rozdzielić akt uczenia maszynowego od prawnego pojęcia substytucji rynkowej.
„Analogia Hemingwaya” a ludzka kreatywność
Aby uczynić koncepcję uczenia maszynowego bardziej przystępną, DOJ przywołało analogię literacką dotyczącą autorki Joan Didion. W piśmie zauważono, że jako nastolatka Didion przepisywała opowiadania Ernesta Hemingwaya, aby analizować jego strukturę zdań i uczyć się rzemiosła. DOJ argumentuje, że gdyby prawo traktowało trenowanie maszyn jako naruszenie, pisarka taka jak Didion mogłaby teoretycznie ponosić odpowiedzialność za każdym razem, gdy publikowałaby nową pracę, ponieważ jej proces nauki byłby nierozerwalnie związany z jej późniejszą twórczością.
Departament argumentuje dalej, że narzucenie ścisłej odpowiedzialności za trenowanie AI paradoksalnie zdusiłoby tę samą kreatywność, którą prawo autorskie ma chronić. W dobie coraz powszechniejszego wykorzystywania LLM przez ludzi do tworzenia szkiców i edycji oryginalnych dzieł, DOJ sugeruje, że uczynienie treningu niedozwolonym bez wprowadzenia masowych systemów licencyjnych sparaliżowałoby innowacje napędzane przez AI.
Wyzwanie rzucone US Copyright Office
Stanowisko DOJ stoi w bezpośredniej sprzeczności z niedawnymi ustaleniami US Copyright Office. Była rejestratorka Shira Perlmutter argumentowała wcześniej przeciwko stosowaniu ogólnej obrony opartej na „dozwolonym użytku”, zauważając, że AI działa w skali i tempie znacznie wykraczającym poza ludzkie możliwości i często tworzy produkty komercyjne, które bezpośrednio konkurują z oryginalnymi twórcami treści.
DOJ przeszło do ofensywy przeciwko tej ocenie, stwierdzając, że raport Perlmutter nie ma wiążącej mocy prawnej i nie uwzględnia ustalonego orzecznictwa dotyczącego analizy przypadków (case-by-case analysis). Departament ostrzega, że narzucenie szerokiej odpowiedzialności w praktyce wymusiłoby reżim licencyjny, który uczyniłby rozwój zaawansowanych modeli AI prawnie i finansowo niemożliwym.
Kluczowe wnioski
- Oddzielenie treningu od wyniku: DOJ argumentuje, że kopiowanie tekstu do celów treningowych nie stanowi naruszenia, jeśli wyniki końcowe modelu nie wykazują „istotnego podobieństwa” do oryginalnych dzieł.
- Ochrona innowacji: Departament ostrzega, że wymóg posiadania licencji na wszystkie dane treningowe zdusiłby kreatywność i uniemożliwił rozwój modeli LLM, które wspomagają ludzi w tworzeniu treści.
- Prawniczy wyznacznik: Ta interwencja tworzy konflikt o wysoką stawkę między DOJ a US Copyright Office, torując drogę do ostatecznego wyroku sądowego, który określi przyszłość generatywnej sztucznej inteligencji.
ARTICLE: Amerykański Departament Sprawiedliwości złożył opinię amicus curiae w pozwie New York Times o prawa autorskie, argumentując, że kopiowanie chronionych tekstów w celu trenowania dużych modeli językowych (LLM) kwalifikuje się jako dozwolony użytek. Pismo to daje firmom takim jak OpenAI i Microsoft tarczę prawną, która może uchronić je przed koniecznością wypłaty odszkodowań, których wartość gazeta szacuje na miliardy dolarów.
Dlaczego ta sprawa jest teraz ważna
Pozew konsoliduje kilka roszczeń, według których deweloperzy AI wprowadzali miliony artykułów prasowych do swoich modeli bez pozwolenia, a następnie wypuszczali produkty konkurujące bezpośrednio z własnym dziennikarstwem Timesów. Jeśli sąd odrzuci argumentację DOJ dotyczącą dozwolonego użytku, firmy AI mogą stanąć w obliczu ogromnych rachunków licencyjnych lub zostać zmuszone do wstrzymania prac nad kolejną generacją agentów konwersacyjnych.
Główny argument DOJ
Pismo procesowe dzieli proces pracy AI na dwa odrębne etapy. Po pierwsze, model pobiera i przetwarza ogromne korpusy tekstów; po drugie, generuje odpowiedzi na zapytania użytkowników. Departament Sprawiedliwości (DOJ) twierdzi, że naruszenie ma miejsce tylko wtedy, gdy utwór objęty prawem autorskim jest reprodukowany w sposób umożliwiający publiczny dostęp. Ponieważ kopiowane podczas trenowania dane nigdy nie opuszczają serwerów dewelopera, sam proces pobierania danych nie przekracza tego progu.
DOJ opiera się również na teście „istotnego podobieństwa” (substantial similarity), który jest długoletnim standardem prawa autorskiego. Departament argumentuje, że tekst generowany przez modele takie jak GPT-4 „często, jeśli nie zawsze, różni się na tyle od jakiegokolwiek pojedynczego źródła, że powód nie może udowodnić wymaganego podobieństwa”. Krótko mówiąc, pismo procesowe sugeruje, że punkt ciężkości prawnego powinna być końcowa odpowiedź, a nie wewnętrzny proces uczenia się.
Literacka analogia ilustrująca ten punkt
Aby uczynić argumentację techniczną bardziej przystępną, w dokumencie przywołano historię nastoletniej pisarki, która kopiowała opowiadania Ernesta Hemingwaya, aby studiować jego styl. DOJ twierdzi, że gdyby prawo traktowało taką naukę jako naruszenie, pisarka mogłaby zostać pozwana za każdym razem, gdy opublikowałaby nowy utwór, mimo że jej praca byłaby oryginalna. Departament ostrzega, że rozszerzenie tej samej logiki na AI mogłoby „sparaliżować samą kreatywność, którą prawo autorskie miało chronić”.
Stawka dla deweloperów AI i twórców treści
- Ryzyko innowacji: Wymóg uzyskiwania licencji na każdy fragment tekstu użyty do trenowania mógłby spowodować tak wysokie koszty, że budowanie najnowocześniejszych modeli stałoby się finansowo nieopłacalne.
- Przebieg pracy twórczej: Ludzie piszący coraz częściej polegają na modelach LLM w procesach szkicowania, edycji i burzy mózgów. Gdyby proces trenowania uznano za nielegalny, narzędzia te mogłyby zniknąć, co zmieniłoby sposób produkcji treści w wielu branżach.
- Wpływ na rynek: Branża prasowa argumentuje, że modele AI, które potrafią odpowiadać na pytania lub generować teksty przypominające wiadomości, podważają wartość oryginalnego dziennikarstwa, co potencjalnie może prowadzić do odpływu przychodów z reklam i subskrypcji.
Kontrargument Urzędu ds. Praw Autorskich
Niedawny raport amerykańskiego Urzędu ds. Praw Autorskich (U.S. Copyright Office), sporządzony za czasów byłej Rejestrator Shiry Perlmutter, odrzucił argumentację opartą na blankietowej obronie zasadą dozwolonego użytku. Urząd wskazał trzy czynniki, które odróżniają AI od ludzkiej nauki: ogromną objętość kopiowanego materiału, szybkość, z jaką jest on przetwarzany, oraz fakt, że powstałe modele mogą być pakietowane i sprzedawane jako produkty komercyjne, które bezpośrednio konkurują z pierwotnymi twórcami.
DOJ odpiera te argumenty, zauważając, że raport nie ma wiążącej mocy prawnej i że istniejące orzecznictwo wymaga już analizy każdego przypadku dozwolonego użytku z osobna (fact-by-fact analysis). Departament ostrzega, że narzucenie „szerokiej odpowiedzialności” de facto zmusiłoby branżę do przejścia na system licencyjny, który „uczyniłby rozwój zaawansowanych modeli AI prawnie i finansowo niemożliwym”.
Co może nastąpić dalej
Sąd okręgowy rozpatrujący sprawę Times będzie musiał zestawić stanowisko DOJ dotyczące dozwolonego użytku z ustaleniami Urzędu ds. Praw Autorskich. Wyrok na korzyść DOJ ustanowiłby precedens, zgodnie z którym dane treningowe mogą być pozyskiwane bez wyraźnej zgody, pod warunkiem, że wyniki działania modelu nie wykazują istotnego podobieństwa do oryginałów. Decyzja po stronie gazety mogłaby wywołać falę negocjacji licencyjnych, co potencjalnie zmieniłoby ekonomię badań nad AI.
Podsumowanie
Pismo procesowe DOJ zmienia pytanie o to, czy trenowanie AI mieści się w ramach dozwolonego użytku, w bitwę sądową o wysoką stawkę. Wynik tego sporu określi, czy deweloperzy będą mogli nadal budować potężne modele językowe w oparciu o istniejące teksty, czy też będą musieli ubiegać się o kosztowne licencje na każdy pobierany materiał. Decyzja ta odbije się echem w sektorze technologicznym, branży mediowej i całej gospodarce kreatywnej.
