OpenAI 在《纽约时报》版权诉讼案中获得了来自美国司法部的罕见助力,该机构提交了一份长达 20 页的法庭之友陈述书(amicus brief),支持该公司的“合理使用”(fair-use)辩护。这份提交至纽约南区法院的文件表明,联邦政府已将 AI 训练实践视为国家利益问题,而不仅仅是私人法律纠纷。

政府为何介入

该陈述书从地缘政治的角度界定了此案。它认为,美国在保持其 AI 行业竞争力方面拥有“强烈利益”,并将 AI 领导地位与经济繁荣及国家安全联系在一起。通过支持 OpenAI,政府暗示,对版权法进行狭隘的解读可能会减缓研发周期,从而影响美国公司在海外竞争对手面前的领先地位。这一立场呼应了早前的行政命令,即要求在 AI 标准和治理方面采取“美国优先”的方法。

核心法律问题:转换性使用还是侵权?

此案的关键在于,将海量的受版权保护的语料库输入到大语言模型(LLM)中是否属于“合理使用”。合理使用保护具有“转换性”(transformative)的行为——即通过不同的目的增加新内容,而非仅仅是复制原著。OpenAI 的辩护观点(政府陈述书也对此表示赞同)认为,LLM 学习的是模式并生成新颖的文本,这一过程更类似于人类读者吸收信息,而非简单的“复制粘贴”操作。

该陈述书警告称,“在对合理使用原则的误解下限制 LLM 的发展”将损害美国的经济活力。这种措辞呼应了另一宗案件中的评论,在该案中,一位法官将 LLM 训练比作读者通过阅读书籍来产生新想法,而不是将其视为旨在取代原作者的工具。

先前案例如何影响辩论

该陈述书并不具备法院判决的效力,但它指出了近期的一些诉讼,这些诉讼有助于界定许可训练与非法数据获取之间的界限。在涉及 Anthropic 的案件中,该公司面临 15 亿美元的和解,并非因为其模型从受版权保护的作品中学习,而是因为它从“非法影子图书馆”(essentially pirated databases,本质上是盗版数据库)获取材料。该和解强调,即使训练过程本身可能被视为具有转换性,获取数据的方式仍可能引发巨额责任。

William Alsup 法官早前的观察提供了额外的背景。他强调,训练 LLM 更像是一个人类的学习过程,而非直接复制,这表明法院可能对更广泛的合理使用解释持开放态度。然而,Anthropic 的结果表明,无论下游用途如何,法院在非法获取数据方面划定了一条明确的红线。

谁获益,谁面临风险

AI 开发商将从将大规模数据摄取视为“合理使用”的法律环境中获益。有利的裁决可能会降低构建下一代模型(如 Claude、Gemini 或未来的 GPT-5)的成本,因为公司将不再需要为摄取的每一段文本进行授权谈判。这可能会加速创新,并使美国公司保持在全球 AI 竞赛的前沿。

内容创作者和出版商仍然是最强烈的反对者。他们认为,不受限制的抓取侵蚀了其作品的价值,并剥夺了他们的收入。《纽约时报》的诉讼反映了这种担忧:该报声称 OpenAI 在未经许可的情况下使用其文章违反了其版权。如果法院站在报社一边,AI 实验室可能会面临禁令、损害赔偿,或者需要追溯授权数十亿词汇——这种财务和物流负担可能会令规模较小的参与者难以生存。

政府在平衡这些力量方面利益攸关。虽然该陈述书支持 AI 的增长,但它也含蓄地承认了建立清晰法律框架的必要性。过于宽松的裁决可能会引发创意部门的反弹,从而可能促使出台比当前争议更具限制性的新立法。

反方观点:保护创意权利

政府立场的批评者指出,合理使用原则从未旨在笼统地涵盖整个行业的数据实践。他们警告说,将所有大规模文本摄取都视为“转换性使用”可能会开创一个先例,从而破坏版权制度的激励机制。此外,Anthropic 的和解表明,即使训练过程是允许的,获取数据的方式仍可能违法。这种双重性意味着 AI 开发商不能仅仅依赖合理使用辩护;他们还必须确保其数据流水线是合规的。

后续关注重点

  • 法院裁决:纽约南区联邦法院最终将对《纽约时报》的诉求作出裁决。该判决可能会成为未来 AI 相关版权案件的参考基准。
  • 立法动向:立法者可能会响应法院的导向,通过起草法规来明确 AI 可允许的数据使用实践,从而可能收紧或放宽目前的灰色地带。
  • 行业反应:AI 公司可能会调整其数据收集策略,要么寻求更广泛的许可协议,要么构建完全避开版权材料的内部数据集。

总结

美国司法部的“法庭之友”简报将 OpenAI 的版权之争转变为一场关乎美国 AI 未来的代理战争。通过将 LLM 训练界定为对国家竞争力至关重要的合理使用活动,政府释放了一个信号:限制性的版权解释可能会成为一种战略负担。然而,创作者权利与开发者需求之间持续存在的紧张关系意味着,法院(甚至可能是国会)必须划定一条界线,以平衡创新与对创意作品的保护。