빌려 쓰는 지능에서 모델 공장으로
수년간 Thomson Reuters는 제3자 연구소의 상용 모델을 파인튜닝(fine-tuning)하여 AI 기능이 강화된 제품을 제공해 왔습니다. 파인튜닝은 사전 학습된 모델을 가져 더 작은 데이터셋으로 가중치를 미세 조정하는 방식이지만, 이 과정에서 모델의 광범위한 추론 능력이 저하될 수 있으며 회사가 제공업체의 가격 정책과 API 사용 제한에 종속된다는 단점이 있습니다.
이제 이 회사는 AI를 생산 라인처럼 다룹니다. 지난 2년 동안 Thomson Reuters는 엔지니어, 데이터 과학자, 컴퓨팅 전문가를 채용했으며, 오픈 소스인 Alibaba의 Qwen 아키텍처 기반 Qwen 시리즈 모델을 학습시키기 위해 클라우드 GPU 사용료와 온프레미스 하드웨어에 4,000만 달러를 투자했습니다. 오픈 소스란 코드와 가중치가 공개되어 있음을 의미하므로, Thomson Reuters는 라이선스 비용 없이 강력한 토대 위에서 시작할 수 있었습니다.
Imperial College와의 파트너십을 통해 중간 단계인 “Snowdon” 모델이 탄생했습니다. 이 모델은 고객에게 도달하기 전 모든 LLM이 충족해야 하는 요구 사항인 안전성, 윤리성, 정치적 중립성을 위해 우선적으로 재학습되었습니다. Snowdon 이후, 팀은 Westlaw, Practical Law, Checkpoint 및 Reuters 뉴스 아카이브의 자체 보유 콘텐츠를 모델에 학습시켰습니다. 현재까지 해당 콘텐츠의 10% 미만이 사용되었으며, 이는 향후 더 많은 데이터가 유입됨에 따라 확장할 수 있는 여지가 충분함을 의미합니다. 마지막 단계에서는 에이전트형 강화 학습(agentic reinforcement learning)이 추가되었습니다. 모델은 Thomson Reuters 자체의 도구 환경과 상호작용하며 피드백을 받고, 작업 성능을 향상시키기 위해 정책을 업데이트합니다. 이러한 맥락에서 강화 학습은 모델이 정적인 예시가 아닌 시행착오를 통해 목표(예: 올바른 인용구 찾기)를 달성하도록 가르칩니다.
모델의 성능 비교
법률 추론 테스트 세트인 Stanford LegalBench에서 이 자체 개발 모델은 0.823점을 기록했으며, 이는 Harvey Legal Agent Benchmark에서 Gemini 3.1 Pro, GPT-5.5, Opus 4.8에 뒤처지는 성적입니다. 또한 일반적인 코딩 및 추론 문제에서도 뒤처지는 모습을 보였는데, 이는 모델의 순수 추론 능력이 거대 범용 LLM에 수십억 달러를 쏟아붓는 프런티어 연구소들에 비해 여전히 약하다는 것을 보여줍니다.
하지만 모델이 Thomson Reuters의 독점 데이터에 접근할 때 강점이 나타납니다. 사실 정확도를 측정하는 Deep Research 벤치마크에서 이 모델은 웹 접속만으로는 0.53을 기록하여 GPT-5.4의 0.65보다 낮았습니다. 그러나 내부 법률 라이브러리를 추가하자 정확도가 0.83으로 뛰어올라 상용 경쟁 모델을 앞질렀습니다. 이 결과는 익숙한 패턴을 확인시켜 줍니다. 즉, 적당한 규모의 모델이라도 도메인 특화 지식이 주어지면, 해당 특화 정보를 갖지 못한 훨씬 더 큰 시스템을 이길 수 있다는 것입니다.
왜 '소유'가 '임대'보다 나은가
CTO Joel Hron과 연구 책임자 Jonathan Schwartz는 이번 투자의 세 가지 핵심 축을 다음과 같이 꼽았습니다.
- 비용 및 역량 – 문서 검토와 같이 대량의 작업을 상용 API로 실행하면 토큰당 비용이 빠르게 누적됩니다. 전용 소형 모델은 법률 특화 성능을 유지하면서도 훨씬 저렴한 비용으로 동일한 작업량을 처리할 수 있습니다.
- 데이터 주권 – Thomson Reuters의 가장 가치 있는 자산은 큐레이션된 법률 콘텐츠입니다. 이 데이터를 외부 AI 제공업체에 넘기는 것은 보안 및 기밀 유지 리스크를 초래하며, 제공업체에 경쟁 우위를 안겨주는 꼴이 됩니다. 데이터를 사내에 유지함으로써 성능 개선 사항을 비공개로 관리할 수 있습니다.
- 지적 자산의 복리 효과 – 변호사가 모델의 결과물을 검토할 때마다 그 상호작용은 학습 데이터로 기록되어 모델을 점진적으로 정교하게 만들 수 있습니다. 시간이 흐를수록 회사는 임대료를 내는 대신 부동산을 소유하는 것처럼, 가치가 계속 커지는 자기 강화적 자산을 구축하게 됩니다.
첫 번째 사용 사례와 오픈 소스 활용
이 모델은 계약서에서 구조화된 데이터를 추출하는 Tabular Analysis 기능과 같이 높은 처리량과 낮은 비용이 요구되는 작업을 위해 Thomson Reuters의 CoCounsel Legal 제품군에 도입되고 있습니다. 또한 법률 초안 작성 시 반복적이지만 정확도가 매우 중요한 단계인 인용 확인(citation-checking) 작업도 수행합니다.
개발자 생태계를 육성하기 위해, 성능을 일부 제한한 버전이 비상업적 라이선스로 Hugging Face에 공개될 예정입니다. 이를 통해 연구자와 파트너들은 회사의 수익 창출 제품을 구동하는 전체 독점 모델을 노출하지 않고도 실험을 진행할 수 있습니다.
