米国司法省(DOJ)は、メディア大手とAI開発者の間で続いている著作権争いにおいて、重大な法的介入を行いました。大規模言語モデル(LLM)の学習に著作権で保護されたデータを使用することは「フェアユース(公正利用)」に該当すると主張することで、DOJはOpenAIやMicrosoftといった企業に対して巨大な法的盾を提供したことになります。
DOJの主張:学習 vs 出力
The New York Timesが関与する統合訴訟の核心にあるのは、AIがどのように学習するかと、何を生み出すかという間の根本的な違いです。New York Timesは、同紙の数百万もの記事がGPT-4などのモデルを学習させるために許可なく使用され、数十億ドルの損害を与え、同紙と直接競合する製品を生み出していると主張しています。
しかし、DOJの最近の申し立てでは、著作権侵害は「取り込み(ingestion)」の時点ではなく、「出力(output)」の時点で発生すると論じています。同省は、学習フェーズにおいて著作物全体がコピーされるものの、それらのコピーが公に利用されることはないと主張しています。さらに、DOJはGPT-4のようなモデルの出力は、「常にではないにせよ、多くの場合、元の素材との実質的な類似性を欠いている」と断言しています。学習プロセスを出力コンテンツから切り離すことで、DOJは機械学習という行為を、市場代替という法的概念から切り離そうとしています。
「ヘミングウェイの比喩」と人間の創造性
機械学習の概念を分かりやすくするために、DOJは作家ジョーン・ディディオンにまつわる文学的な比喩を用いました。申し立て書の中で、ディディオンは10代の頃、アーネスト・ヘミングウェイの文章構造を分析し、その技術を学ぶために彼の物語を書き写していたと指摘しています。DOJは、もし法律が機械の学習を侵害として扱うならば、ディディオンのような作家は、学習プロセスがその後の執筆と不可分に結びついているため、新しい作品を発表するたびに理論上、法的責任を問われる可能性があると主張しています。
さらに同省は、AIの学習に対して厳格な責任を課すことは、逆説的に、著作権法が保護しようとしている創造性そのものを阻害することになると論じています。人間がオリジナルの作品の起草や編集にLLMをますます活用するようになっている現状において、大規模なライセンス制度なしに学習を認めないことは、AI主導のイノベーションを麻痺させることになるとDOJは示唆しています。
米国著作権局への挑戦
DOJの立場は、米国著作権局による最近の調査結果と真っ向から対立しています。前登録官(Register)のシラ・パールメッターは、AIは人間の能力をはるかに超える規模とスピードで動作し、元のコンテンツクリエイターと直接競合する商業製品をしばしば生み出すことから、包括的な「フェアユース」の抗弁には反対する主張を以前に行っていました。
DOJはこの評価に対し攻勢に転じており、パールメッターの報告書には拘束力のある法的権限はなく、個別の事案ごとの分析に関する確立された判例を考慮に入れていないと述べています。同省は、広範な責任を課すことは、実質的にライセンス制度を義務付けることになり、高度なAIモデルの開発を法的および財務的に不可能にすると警告しています。
主なポイント
- 学習と出力の分離: DOJは、学習のためにテキストをコピーしても、その結果として得られるモデルの出力が元の著作物と「実質的な類似性」を示さないのであれば、侵害には当たらないと主張しています。
- イノベーションの保護: 同省は、すべての学習データにライセンスを要求することは、創造性を阻害し、人間のコンテンツ制作を支援するLLMの開発を妨げることになると警告しています。
- 法的な試金石: この介入は、DOJと米国著作権局の間に利害関係の大きい対立を生み出し、生成AIの未来に関する決定的な裁判所の判決に向けた舞台を整えることになります。
記事: 米国司法省は、New York Timesの著作権訴訟においてアミカス・ブリーフ(法廷助言者意見書)を提出し、大規模言語モデル(LLM)を学習させるために保護されたテキストをコピーすることはフェアユースに該当すると主張しました。この申し立ては、OpenAIやMicrosoftなどの企業に対し、同紙が数十億ドル規模と見積もる損害賠償の対象から逃れるための法的盾を与える可能性があります。
なぜ今、この訴訟が重要なのか
この訴訟は、AI開発者が許可なく数百万もの新聞記事をモデルに投入し、その後、Times自身の報道と直接競合する製品をリリースしたという複数の主張を統合したものです。もし裁判所がDOJのフェアユースの主張を退けた場合、AI企業は巨額のライセンス料の支払いに直面するか、次世代の対話型エージェントの開発停止を余儀なくされる可能性があります。
DOJの核心的な主張
この書面は、AIのワークフローを2つの明確な段階に分けています。第一に、モデルが膨大なテキストコーパスを取り込む段階。第二に、ユーザーのプロンプトに対して回答を生成する段階です。司法省(DOJ)は、著作権侵害は、著作物が公衆がアクセス可能な形で複製された場合にのみ発生すると述べています。学習用のコピーは開発者のサーバーから外に出ることはないため、取り込み行為はその基準を満たさないとしています。
また、DOJは長年の著作権基準である「実質的類似性」テストにも依拠しています。GPT-4などのモデルによって出力されるテキストは、「常にではないにせよ、多くの場合」単一のソースとは十分に異なっており、原告が要求される類似性を証明することはできないと主張しています。要するに、この書面は、法的な焦点は内部の学習プロセスではなく、最終的な出力に置かれるべきであると論じています。
ポイントを説明するための文学的な比喩
技術的な議論をより分かりやすくするために、この訴状は、アーネスト・ヘミングウェイの文体を研究するために彼の物語を模写したある10代の作家の物語を引き合いに出しています。DOJは、もし法律がそのような学習行為を侵害とみなすならば、その作家の作品が独創的なものであったとしても、新しい作品を発表するたびに訴えられる可能性があると述べています。同省は、同じ論理をAIに適用することは、「著作権法が保護するために設計された創造性そのものを麻痺させる」ことになると警告しています。
AI開発者とコンテンツクリエイターにとっての利害
- イノベーションのリスク: 学習に使用されるすべてのテキストに対してライセンスを要求すると、コストが非常に高くなり、最先端のモデルを構築することが経済的に不可能になる可能性があります。
- クリエイティブなワークフロー: 人間のライターは、下書き、編集、ブレインストーミングにおいて、ますますLLMに依存するようになっています。もし学習プロセスが違法と判断されれば、それらのツールが姿を消し、あらゆる業界におけるコンテンツ制作のあり方が再編される可能性があります。
- 市場への影響: 新聞業界は、質問に答えたりニュースのようなテキストを生成したりできるAIモデルが、独自の報道の価値を損ない、広告収入や購読料を奪い去る可能性があると主張しています。
著作権局の反論
前登録官シラ・パーラムッターの下で作成された米国著作権局の最近の報告書は、包括的なフェアユース(公正利用)の抗弁に反対しています。同局は、AIを人間の学習から区別する3つの要因を強調しました。それは、複製される資料の膨大な量、処理されるスピード、そして、結果として得られるモデルが、元のクリエイターと直接競合する商業製品としてパッケージ化され、販売され得るという事実です。
DOJはこれらの点に反論し、報告書には拘束力のある法的権限はなく、既存の判例においてすでにフェアユースの事実に基づく分析が求められていると指摘しています。また、「広範な責任」を課すことは、実質的に業界をライセンス制度へと強制することになり、「高度なAIモデルの開発を法的および経済的に不可能にする」ことになると警告しています。
今後の展開
Times社の訴訟を扱う地方裁判所は、DOJのフェアユースの立場と著作権局の調査結果を比較検討しなければなりません。DOJに有利な判決が出れば、モデルの出力が実質的類似性を回避している限り、学習データを明示的な許可なしに収集できるという先例となります。新聞社側に有利な決定が下されれば、ライセンス交渉の波を引き起こし、AI研究の経済構造を塗り替える可能性があります。
結論
DOJの訴状は、AIの学習がフェアユースにあたるかという問いを、重大な局面を迎えた法廷闘争へと変貌させました。その結果は、開発者が既存のテキストに基づいて強力な言語モデルを構築し続けられるのか、それとも取り込むすべての資料に対して高額なライセンスを取得しなければならないのかを決定することになります。この決定は、テック部門、メディア業界、そしてより広範なクリエイティブ経済全体に波及していくでしょう。
