案件为何进入司法程序
ANI 在发现 ChatGPT 对近期印度新闻查询的回答与其在 2024 年 8 月和 9 月发表的文章高度相似后提起诉讼。该机构辩称,大型语言模型正在复制其受版权保护的文本;如果这一主张成立,将迫使 OpenAI 在印度停止使用或严重限制其模型。
OpenAI 回应称,所提到的两种模型——GPT-4 和较新的 GPT-4o——所使用的训练数据截止日期分别为 2022 年 4 月和 2024 年 4 月。ANI 的文章发表于这些日期之后,因此不可能出现在原始训练集中。法官 Amit Bansal 表示,内容重叠极有可能源于检索增强生成(RAG),即实时将当前的网页内容拉取到回答中,而非模型“记住”了这些文章。
法律转折点:将训练视为“研究”
此案之所以重要,是因为法院对印度版权法中关于“私人或个人用途(包括研究)”的例外条款进行了宽泛的解读。双方均同意 OpenAI 在初始训练阶段使用了 ANI 的材料,但法官将这种使用视为“转换性使用”(transformative)。换句话说,模型仅提取了语法、句法和统计模式,而未触及表达性内容。
法院设定了两个严格条件:
- 用于训练的副本必须来自合法来源,而非盗版存档或用户无法访问的付费墙内容。
- 材料必须保留在开发者自己的环境中;不得进行发布或分发。
通过应用三部分公平性测试,法官认定 OpenAI 的使用仅限于训练,未发现模型逐字记忆段落的证据,并指出由于两家公司在不同的细分市场运营,ANI 并未遭受直接经济损失。
这如何融入全球裁决的碎片化格局中
印度的立场现在与美国的一些案例相呼应,这些案例倾向于对 AI 输出采取“转换性”观点。在 Kadrey v. Meta 一案中,法院裁定,只要生成的文本没有复制精确措辞,就不构成侵权;而长期的 Google Books 裁决则承认了数字化项目受限的“搜索与展示”例外。其他美国诉讼(如 Raw Story 案)因缺乏可证明的损害而被驳回,但 Anthropic 争议提醒了法官,使用盗版数据仍可能引发法律责任。
在欧洲,观点存在严重分歧。慕尼黑的法院已裁定,在模型权重中复制歌词构成侵权,而伦敦的一个法庭最近则基于类似理由驳回了针对 Stability AI 的指控。德里高等法院的裁决增加了另一个参考点:如果训练仅限于合法来源,且输出内容不是逐字复制,则该活动可能属于研究例外范畴。
开发者应关注的事项
- RAG 与训练 – 法院对“记忆”(训练)与实时检索(RAG)的区分表明,未来的争议将集中在回答是来自静态知识库,还是从网络实时获取。开发者可能需要在产品文档中更清晰地界定这一界限。
- 来源溯源 – “合法来源”的要求可能会促使公司加强数据策展流程,通过合同或许可证明每一段文本片段的合法性。
- 仅限内部使用 – 计划将模型输出商业化的公司必须严格将训练数据保留在内部。与合作伙伴或公众共享原始语料库可能会削弱“研究”这一辩护理由。
- 经济损害测试 – 由于法院强调了不存在直接经济损失,原告需要证明具体的损失,而不仅仅是感知到的品牌稀释。
- 立法响应 – 印度立法者正在关注与 AI 相关的版权辩论。任何缩小研究例外范围的修正案都可能追溯影响已部署的模型,从而引发一波合规审计。
依然困扰 AI 的反方观点
ANI 的投诉凸显了一个真实存在的担忧:随着 LLM 越来越擅长模仿特定的措辞,“转换性”使用与“复制”之间的界限可能会变得模糊。批评者认为,RAG 虽然在技术上是一种搜索功能,但它仍然在未经许可的情况下呈现受版权保护的内容,这可能违反了“向公众传播”的权利。
具有全球连锁反应的先例
通过将模型训练归类为允许的研究活动,德里高等法院释放了一个信号:只要开发者遵守来源合法性并保持训练过程在内部进行,印度不会仅基于版权理由就自动阻碍大语言模型的发展。这一解读可能会鼓励企业扩大在印度的业务,因为他们意识到一个关键的法律障碍已经有所缓解。
对于其他地区的监管机构而言,该裁决提供了一个模板:定义一个范围狭窄、记录详尽的研究例外条款,实施明确的溯源标准,并要求训练数据仅限内部处理。采用类似表述的国家可以为其国内的 AI 生态系统提供吸引投资所需的确定性。
核心结论: 德里高等法院的裁决并未授予可以为 AI 训练抓取任何文本的“通行证”,但它确立了在印度法律下,守纪律、合规的训练属于研究活动。随着全球法院在“教机器理解语言究竟是受保护的学术活动,还是随时可能发生的侵权行为”这一问题上苦苦挣扎,这一解读可能会成为一个参考点。
