OpenAI ha ottenuto un raro sostegno dal Dipartimento di Giustizia degli Stati Uniti, quando l'agenzia ha presentato un amicus brief di 20 pagine a sostegno della difesa del fair use dell'azienda nella causa sul copyright intentata dal New York Times. L'atto, depositato presso il Tribunale distrettuale degli Stati Uniti per il distretto sud di New York, segnala che il governo federale considera le pratiche di addestramento dell'IA come una questione di interesse nazionale, e non solo una disputa legale privata.
Perché il governo si sta inserendo
L'atto inquadra il caso in termini geopolitici. Sostiene che gli Stati Uniti abbiano un "forte interesse" nel mantenere competitiva la propria industria dell'IA, collegando la leadership nell'IA sia alla prosperità economica che alla sicurezza nazionale. Sostenendo OpenAI, l'amministrazione suggerisce che un'interpretazione restrittiva della legge sul copyright potrebbe rallentare il ciclo di ricerca e sviluppo che permette alle aziende americane di restare in vantaggio rispetto ai rivali esteri. Questa posizione riecheggia precedenti ordini esecutivi che richiedono un approccio "U.S.-first" agli standard e alla governance dell'IA.
La questione legale centrale: uso trasformativo o violazione?
Ciò che è in gioco è se l'immissione di massicci corpora protetti da copyright in un modello linguistico di grandi dimensioni (LLM) possa essere considerata "fair use". Il fair use protegge gli utilizzi "trasformativi", ovvero utilizzi che aggiungono qualcosa di nuovo, con uno scopo diverso, piuttosto che limitarsi a riprodurre l'opera originale. La difesa di OpenAI, riecheggiata dall'atto del governo, sostiene che gli LLM apprendano schemi e generino testi nuovi, un processo più simile all'assorbimento di informazioni da parte di un lettore umano che a un'operazione di copia e incolla.
L'atto avverte che "limitare lo sviluppo degli LLM a causa di un malinteso della dottrina del fair use" danneggerebbe la mobilità economica americana. Queste parole riflettono un commento proveniente da un caso separato, in cui un giudice ha paragonato l'addestramento degli LLM a un lettore che impara dai libri per creare nuove idee, piuttosto che a uno strumento progettato per sostituire il creatore originale.
Come i casi precedenti influenzano il dibattito
L'atto non ha la forza di una sentenza giudiziaria, ma punta a recenti contenziosi che aiutano a definire il confine tra addestramento consentito e acquisizione illegale di dati. In un caso che ha coinvolto Anthropic, l'azienda ha dovuto affrontare un accordo transattivo da 1,5 miliardi di dollari non perché il suo modello avesse appreso da opere protette da copyright, ma perché aveva ottenuto quel materiale da "illegal shadow libraries" (biblioteche ombra illegali), ovvero database piratati. L'accordo sottolinea che il metodo di ottenimento dei dati può far scattare una responsabilità enorme, anche se il processo di addestramento in sé potrebbe essere considerato trasformativo.
Le precedenti osservazioni del giudice William Alsup forniscono un contesto aggiuntivo. Egli ha sottolineato che l'addestramento di un LLM somiglia più a un processo di apprendimento umano che a una copia diretta, suggerendo che i tribunali potrebbero essere aperti a un'interpretazione più ampia del fair use. Tuttavia, l'esito del caso Anthropic dimostra che i tribunali tracciano una linea netta in caso di approvvigionamento illegale, indipendentemente dall'uso a valle.
Chi ne trae vantaggio e chi corre dei rischi
Gli sviluppatori di IA trarrebbero vantaggio da un ambiente legale che considera l'acquisizione di dati su larga scala come fair use. Una sentenza favorevole potrebbe ridurre i costi di costruzione di modelli di prossima generazione come Claude, Gemini o un futuro GPT-5, poiché le aziende non dovrebbero più negoziare licenze per ogni singolo testo acquisito. Ciò potrebbe accelerare l'innovazione e mantenere le aziende statunitensi in prima linea nella corsa globale all'IA.
I creatori di contenuti e gli editori rimangono gli oppositori più accesi. Sostengono che lo scraping senza restrizioni eroda il valore del loro lavoro e li privi di entrate. La causa del New York Times riflette questa preoccupazione: il quotidiano sostiene che l'uso dei suoi articoli da parte di OpenAI senza autorizzazione violi il suo copyright. Se i tribunali dovessero dare ragione al giornale, i laboratori di IA potrebbero affrontare ingiunzioni, risarcimenti danni o la necessità di ottenere licenze retroattive per miliardi di parole: un onere finanziario e logistico che potrebbe soffocare i player più piccoli.
Il governo ha interesse a bilanciare queste forze. Sebbene l'atto sostenga la crescita dell'IA, riconosce anche implicitamente la necessità di un quadro legale chiaro. Sentenze eccessivamente permissive potrebbero provocare reazioni avverse dal settore creativo, portando potenzialmente a nuove legislazioni che potrebbero essere più restrittive della disputa attuale.
La controargomentazione: proteggere i diritti creativi
I critici della posizione del governo sottolineano che la dottrina del fair use non è mai stata concepita per coprire indiscriminatamente le pratiche di gestione dei dati di un intero settore. Avvertono che trattare ogni ingestione di testo su larga scala come trasformativa potrebbe creare un precedente che mina la struttura degli incentivi del sistema del copyright. Inoltre, l'accordo con Anthropic dimostra che, anche se il processo di addestramento è consentito, i mezzi di acquisizione dei dati possono comunque essere illegali. Questa dualità significa che gli sviluppatori di IA non possono semplicemente fare affidamento sulla difesa del fair use; devono anche garantire che le loro pipeline di dati siano pulite.
Cosa osservare in seguito
- Sentenze giudiziarie: Il Tribunale distrettuale degli Stati Uniti per il distretto sud di New York emetterà infine una decisione sulla causa del New York Times. Quel giudizio diventerà probabilmente un punto di riferimento per i futuri casi di copyright legati all'IA.
- Mosse legislative: I legislatori potrebbero rispondere alla direzione della corte elaborando leggi che chiariscano le pratiche consentite di utilizzo dei dati per l'IA, potenzialmente restringendo o ampliando l'attuale zona grigia.
- Risposta del settore: Le aziende di IA potrebbero modificare le loro strategie di raccolta dati, cercando accordi di licenza più ampi o costruendo dataset interni che evitino del tutto i materiali protetti da copyright.
In sintesi
L'amicus brief del Dipartimento di Giustizia trasforma la battaglia sul copyright di Open AI in una battaglia per procura sul futuro dell'IA americana. Inquadrando l'addestramento degli LLM come un'attività di fair use essenziale per la competitività nazionale, il governo segnala che interpretazioni restrittive del copyright potrebbero rappresentare uno svantaggio strategico. Tuttavia, la tensione in corso tra i diritti dei creatori e le necessità degli sviluppatori significa che i tribunali, e possibilmente il Congresso, dovranno tracciare una linea che bilanci l'innovazione con la protezione del lavoro creativo.
