なぜこの訴訟が裁判に持ち込まれたのか
ANIは、最近のインドのニュースに関するChatGPTの回答が、2024年8月および9月に同社が公開した記事と酷似していることに気づき、提訴した。同通信社は、大規模言語モデルが著作権で保護されたテキストを複製していると主張した。もしこの主張が認められれば、OpenAIはインドにおけるモデルの運用を停止するか、大幅に制限することを余儀なくされることになる。
OpenAIは、引用された2つのモデル(GPT-4および最新のGPT-4o)は、それぞれ2022年4月と2024年4月をデータカットオフ日として学習されていると回答した。ANIの記事はそれらの日付以降に公開されたものであるため、元の学習セットに含まれているはずがないという主張だ。アミット・バンサル判事は、この重複はモデルが記事を「記憶」しているのではなく、リアルタイムで最新のウェブコンテンツを回答に取り込むRetrieval-Augmented Generation(RAG)によるものである可能性が高いと述べた。
法的な転換点:「研究」としての学習
この訴訟が重要である理由は、裁判所がインドの著作権法における「研究を含む私的使用または個人的な使用」という例外規定を広く解釈したことにある。双方は、OpenAIが初期の学習段階でANIの資料を使用したことには同意したが、判事はその使用を「変容的(transformative)」であると判断した。言い換えれば、モデルは文法、構文、統計的パターンのみを抽出し、表現内容には手を加えていないということだ。
裁判所は、以下の2つの厳格な条件を課した:
- 学習に使用される複製物は、海賊版アーカイブやユーザーがアクセスできないペイウォールからではなく、合法的なソースに由来しなければならない。
- 資料は開発者自身の環境内に留めなければならず、公開や配布を行ってはならない。
3段階の公平性テストを適用した結果、判事はOpenAIの使用は学習に限定されており、モデルが文章を逐語的に記憶している証拠は見当たらないと判断した。また、両社は異なる市場セグメントで事業を展開しているため、ANIに直接的な経済的損失は発生していないと指摘した。
世界的な判決の断片化の中にどう位置づけられるか
インドの立場は現在、AIの出力に対して変容的な見解を支持するいくつかの米国の判例と一致している。Kadrey v. Meta 事件では、正確な言い回しをコピーしていない生成テキストは権利侵害に当たらないとの判断が下された。また、長年の判例である Google Books 決定では、デジタル化プロジェクトに対する限定的な「検索および表示」の例外が認められている。Raw Story 事件のような他の米国の訴訟は、実証可能な損害がないとして棄却されたが、Anthropic を巡る論争は、海賊版データを使用することが依然として法的責任を招き得ることを裁判官たちに再認識させた。
欧州では意見が鋭く分かれている。ミュンヘンの裁判所は、モデルの重みに組み込まれた歌詞を複製することは権利侵害に当たると判決を下したが、一方でロンドンの審判所は最近、同様の根拠で Stability AI に対する請求を棄却した。デリー高等裁判所の判決は、新たなデータポイントを加えるものである。すなわち、学習が合法的なソースに限定されており、出力が逐語的なコピーでない場合、その活動は研究の例外に該当する可能性があるということだ。
開発者が注視すべき点
- RAG vs. training – 「記憶」(学習)とリアルタイムの検索(RAG)を区別した裁判所の判断は、今後の紛争が、回答が静的な知識ベースから得られたものか、それともウェブからライブで取得されたものかに焦点を当てることを示唆している。開発者は、製品ドキュメントにおいてその境界線をより明確にする必要があるかもしれない。
- Source provenance – 「合法的なソース」という要件により、企業はデータキュレーションのパイプラインを強化し、各テキストの断片が正当であることを証明する契約やライセンスを使用するようになる可能性がある。
- Internal-only use – モデルの出力を商用化しようと考えている企業は、学習データを厳格に内部に留めなければならない。生のコーパスをパートナーや公衆と共有することは、「研究」としての防御策を弱める可能性がある。
- Economic-harm test – 裁判所が直接的な金銭的被害の欠如を強調したため、原告は単なるブランド価値の低下の認識ではなく、具体的な損失を示す必要がある。
- Legislative response – インドの立法者たちはAI関連の著作権論争を注視している。研究の例外規定を狭めるような改正が行われれば、すでに展開されているモデルに遡及的に影響を与える可能性があり、コンプライアンス監査の波を引き起こす可能性がある。
AIに依然としてつきまとう反論
ANIの訴えは、切実な懸念を浮き彫りにした。LLMが特定の言い回しを模倣することに長けてくるにつれ、「変容的」な利用と「コピー」の境界線は曖昧になり得る。批判的な人々は、RAGは技術的には検索機能であるものの、依然として許可なく著作権で保護されたコンテンツを表面化させており、潜在的に「公衆への伝達権」を侵害していると主張している。
世界中に波及効果をもたらす先例
デリー高等裁判所は、モデルのトレーニングを許容される研究活動と分類することで、開発者がソースの適法性を遵守し、トレーニングを内部に留める限り、インドは著作権を理由に大規模言語モデルの開発を自動的に阻止することはないという姿勢を示しました。この解釈により、主要な法的障壁が緩和されたことを受け、企業がインドでの事業を拡大することを後押しする可能性があります。
他国の規制当局にとって、この判決は一つの雛形を提示しています。それは、限定的で十分に文書化された研究例外を定義し、明確なソース取得基準を課し、トレーニングデータの取り扱いを内部限定に義務付けるというものです。同様の表現を採用する国々は、国内のAIエコシステムに対し、投資を呼び込むために必要な予見可能性を与えることができるでしょう。
結論: デリー高等裁判所の決定は、AIトレーニングのためにあらゆるテキストをスクレイピングする自由裁量を与えるものではありません。しかし、インドの法律の下では、規律があり法令を遵守したトレーニングは研究として認められることを確立しました。機械に言語を理解させることは、保護されるべき学術活動なのか、それとも侵害行為となるのかという問題に世界中の裁判所が取り組む中で、この解釈は一つの参照点となる可能性があります。
