OpenAI a bénéficié d'un rare coup de pouce du département de la Justice des États-Unis lorsque l'agence a déposé un mémoire d'amicus curiae de 20 pages soutenant la défense de l'entreprise basée sur l'usage équitable (fair use) dans le cadre du procès pour violation de droits d'auteur intenté par le New York Times. Le document, déposé dans le district sud de New York, signale que le gouvernement fédéral considère les pratiques d'entraînement de l'IA comme une question d'intérêt national, et non comme un simple litige juridique privé.
Pourquoi le gouvernement s'implique
Le mémoire présente l'affaire sous un angle géopolitique. Il soutient que les États-Unis ont un « intérêt marqué » à maintenir la compétitivité de leur industrie de l'IA, liant le leadership en matière d'IA tant à la prospérité économique qu'à la sécurité nationale. En soutenant OpenAI, l'administration suggère qu'une interprétation étroite du droit d'auteur pourrait ralentir le cycle de recherche et développement qui permet aux entreprises américaines de garder une longueur d'avance sur leurs rivaux étrangers. Cette position fait écho à des ordres exécutifs antérieurs qui appellent à une approche privilégiant les États-Unis pour les normes et la gouvernance de l'IA.
La question juridique centrale : usage transformatif ou contrefaçon ?
L'enjeu est de savoir si l'alimentation de modèles de langage de grande taille (LLM) avec des corpus massifs protégés par le droit d'auteur constitue un « usage équitable ». Le fair use protège les utilisations qui sont « transformatives » — c'est-à-dire des utilisations qui ajoutent quelque chose de nouveau, avec un objectif différent, plutôt que de simplement reproduire l'œuvre originale. La défense d'OpenAI, relayée par le mémoire du gouvernement, soutient que les LLM apprennent des modèles et génèrent du texte inédit, un processus qui s'apparente davantage à un lecteur humain absorbant des informations qu'à une opération de copier-coller.
Le mémoire avertit que « restreindre le développement des LLM en raison d'une mauvaise compréhension de la doctrine du fair use » nuirait à la mobilité économique américaine. Ces termes font écho à un commentaire issu d'une affaire distincte dans laquelle un juge a comparé l'entraînement des LLM à un lecteur apprenant à partir de livres pour créer de nouvelles idées, plutôt qu'à un outil conçu pour remplacer le créateur original.
Comment les affaires précédentes façonnent le débat
Le mémoire n'a pas la force d'une décision de justice, mais il pointe du doigt des litiges récents qui aident à définir la limite entre l'entraînement autorisé et l'acquisition illégale de données. Dans une affaire impliquant Anthropic, l'entreprise a dû conclure un règlement de 1,5 milliard de dollars, non pas parce que son modèle apprenait à partir d'œuvres protégées, mais parce qu'elle avait puisé ce matériel dans des « bibliothèques fantômes illégales » — essentiellement des bases de données piratées. Ce règlement souligne que la méthode d'obtention des données peut entraîner une responsabilité massive, même si le processus d'entraînement lui-même pourrait être jugé transformatif.
Les observations antérieures du juge William Alsup apportent un contexte supplémentaire. Il a souligné que l'entraînement d'un LLM ressemble davantage à un processus d'apprentissage humain qu'à une copie directe, suggérant que les tribunaux pourraient être ouverts à une interprétation plus large du fair use. Pourtant, l'issue du dossier Anthropic montre que les tribunaux tracent une ligne rouge stricte en cas d'acquisition illégale, quel que soit l'usage en aval.
Qui en profite et qui prend des risques
Les développeurs d'IA ont tout à gagner d'un environnement juridique qui traite l'ingestion de données à grande échelle comme un usage équitable. Une décision favorable pourrait réduire le coût de construction de modèles de nouvelle génération tels que Claude, Gemini, ou un futur GPT-5, car les entreprises n'auraient plus besoin de négocier des licences pour chaque fragment de texte ingéré. Cela pourrait accélérer l'innovation et maintenir les entreprises américaines à l'avant-garde de la course mondiale à l'IA.
Les créateurs de contenu et les éditeurs restent les opposants les plus virulents. Ils soutiennent que le scraping sans restriction érode la valeur de leur travail et les prive de revenus. Le procès du New York Times reflète cette préoccupation : le journal affirme que l'utilisation de ses articles par OpenAI sans autorisation viole ses droits d'auteur. Si les tribunaux donnent raison au journal, les laboratoires d'IA pourraient faire face à des injonctions, des dommages et intérêts, ou à la nécessité d'octroyer des licences rétroactives pour des milliards de mots — un fardeau financier et logistique qui pourrait étouffer les acteurs les plus modestes.
Le gouvernement a tout intérêt à équilibrer ces forces. Bien que le mémoire défende la croissance de l'IA, il reconnaît aussi implicitement la nécessité d'un cadre juridique clair. Des décisions trop permissives pourraient provoquer un retour de bâton du secteur créatif, incitant potentiellement à de nouvelles législations qui pourraient s'avérer plus restrictives que le litige actuel.
L'argument opposé : protéger les droits de création
Les critiques de la position du gouvernement soulignent que la doctrine de l'usage équitable (fair-use) n'a jamais été conçue pour couvrir l'ensemble des pratiques de données d'une industrie entière. Ils avertissent que traiter toute l'ingestion de texte à grande échelle comme étant transformative pourrait créer un précédent qui affaiblirait la structure d'incitation du système de droit d'auteur. De plus, le règlement avec Anthropic démontre que même si le processus d'entraînement est admissible, les moyens d'acquisition des données peuvent tout de même être illégaux. Cette dualité signifie que les développeurs d'IA ne peuvent pas simplement s'appuyer sur une défense fondée sur l'usage équitable ; ils doivent également s'assurer que leurs pipelines de données sont irréprochables.
À surveiller ensuite
- Décisions de justice : Le tribunal de district du sud de New York rendra éventuellement une décision concernant la plainte du New York Times. Ce jugement deviendra probablement un point de référence pour les futurs litiges de droit d'auteur liés à l'IA.
- Évolutions législatives : Les législateurs pourraient répondre à l'orientation de la cour en rédigeant des lois qui clarifient les pratiques d'utilisation des données autorisées pour l'IA, ce qui pourrait restreindre ou assouplir la zone grise actuelle.
- Réaction de l'industrie : Les entreprises d'IA pourraient ajuster leurs stratégies de collecte de données, soit en recherchant des accords de licence plus larges, soit en construisant des ensembles de données internes qui évitent totalement le contenu protégé par le droit d'auteur.
L'essentiel
Le mémoire d'amicus curiae du ministère de la Justice transforme la bataille sur le droit d'auteur d'Open AI en un combat par procuration pour l'avenir de l'IA américaine. En présentant l'entraînement des LLM comme une activité relevant de l'usage équitable et essentielle à la compétitivité nationale, le gouvernement signale que des interprétations restrictives du droit d'auteur pourraient constituer un handicap stratégique. Pourtant, la tension persistante entre les droits des créateurs et les besoins des développeurs signifie que les tribunaux, et éventuellement le Congrès, devront tracer une ligne qui équilibre l'innovation et la protection des œuvres créatives.
