从租用智能到模型工厂
多年来,Thomson Reuters 通过对第三方实验室的商业模型进行微调,来提供 AI 增强型产品。微调是利用较小的数据集对预训练模型的权重进行调整,但这会削弱模型的广泛推理能力,并将公司束缚在供应商的价格体系和 API 使用限制中。
现在,该公司将 AI 视为一条生产线。在过去的两年里,它聘请了工程师、数据科学家和计算专家,并在云端 GPU 时间和本地硬件上投入了 4000 万美元,以基于开源的 Qwen 系列(阿里巴巴的 Qwen 架构)训练模型。开源意味着代码和权重是公开的,因此 Thomson Reuters 无需支付许可费用即可从强大的基础上开始。
与 Imperial College 的合作催生了一个名为 “Snowdon” 的中间模型,该模型首先针对安全性、伦理和政治中立性进行了重新训练——这是任何 LLM 在面向客户之前都必须满足的要求。在 Snowdon 之后,团队向模型输入了来自 Westlaw、Practical Law、Checkpoint 和 Reuters 新闻档案的专有内容。到目前为止,这些内容中只有不到 10% 被使用,随着更多数据的摄入,仍有巨大的扩展空间。最后一步加入了智能体强化学习(agentic reinforcement learning):模型与 Thomson Reuters 自身的工具环境进行交互,接收反馈,并更新其策略以提高任务执行性能。在这种语境下,强化学习通过试错而非静态示例来教导模型实现目标(例如找到正确的引用)。
模型表现如何
在法律推理测试集 Stanford LegalBench 上,该自研模型的得分为 0.823,在 Harvey Legal Agent Benchmark 测试中落后于 Gemini 3.1 Pro、GPT-5.5 和 Opus 4.8。它在通用编程和推理问题上也表现稍逊,这表明其原始推理能力仍弱于那些投入数十亿美元开发大规模通用 LLM 的前沿实验室。
当模型利用 Thomson Reuters 的独家数据时,优势便显现出来。在衡量事实准确性的 Deep Research 基准测试中,该模型仅通过网络访问时的得分为 0.53,低于 GPT-5.4 的 0.65。加入其内部法律库后,准确率提升至 0.83,超越了商业竞争对手。这一结果凸显了一个熟悉的模式:一个规模适中的模型,在喂入特定领域知识后,可以击败那些缺乏此类特权信息的庞大系统。
为什么“拥有”优于“租用”
CTO Joel Hron 和研究主管 Jonathan Schwartz 指出了这项投资的三大支柱:
- 成本与能力 – 在商业 API 上运行文档审查等高吞吐量任务会产生按 token 计费的费用,且累积速度极快。一个专门的、规模较小的模型可以用极低的价格处理相同的任务量,同时保持法律领域的专业性能。
- 数据主权 – Thomson Reuters 最宝贵的资产是其精选的法律内容。将这些数据交给外部 AI 提供商会带来安全和保密风险,并赋予供应商竞争优势。将数据保留在内部可确保改进过程保持私密。
- 知识资产的复利效应 – 律师每次审查模型的输出,这种交互都可以记录为训练数据,从而逐渐优化模型。随着时间的推移,公司将建立起一种自我强化的资产,其价值会不断增长,就像拥有房产而不是支付租金一样。
首批应用场景与对开源的致敬
该模型正在 Thomson Reuters 的 CoCounsel Legal 套件中推出,用于处理需要高吞吐量和低成本的任务,例如从合同中提取结构化数据的 Tabular Analysis 功能。它还负责引用检查,这是法律起草过程中一个重复性高但对准确性要求极高的步骤。
为了培育开发者生态系统,一个精简版将以非商业许可的形式出现在 Hugging Face 上。这让研究人员和合作伙伴能够进行实验,而无需暴露驱动公司盈利产品的完整专有模型。
