Từ trí tuệ đi thuê đến một nhà máy mô hình
Trong nhiều năm, Thomson Reuters đã cung cấp các sản phẩm tăng cường AI bằng cách tinh chỉnh (fine-tuning) các mô hình thương mại từ các phòng thí nghiệm bên thứ ba. Việc tinh chỉnh lấy một mô hình đã được huấn luyện trước và điều chỉnh các trọng số của nó trên một tập dữ liệu nhỏ hơn, nhưng điều này làm giảm khả năng suy luận rộng của mô hình và khiến công ty bị ràng buộc vào mức giá cũng như giới hạn API của nhà cung cấp.
Giờ đây, công ty coi AI như một dây chuyền sản xuất. Trong hai năm qua, họ đã thuê các kỹ sư, nhà khoa học dữ liệu và chuyên gia tính toán, đồng thời chi 40 triệu USD cho thời gian sử dụng GPU đám mây và phần cứng tại chỗ (on-prem) để huấn luyện một mô hình từ dòng Qwen mã nguồn mở—kiến trúc Qwen của Alibaba. Mã nguồn mở có nghĩa là mã và trọng số được công khai, vì vậy Thomson Reuters có thể bắt đầu từ một nền tảng vững chắc mà không phải trả phí bản quyền.
Một sự hợp tác với Imperial College đã tạo ra mô hình trung gian "Snowdon", trước tiên được huấn luyện lại để đảm bảo tính an toàn, đạo đức và trung lập về chính trị—những yêu cầu mà bất kỳ LLM nào cũng phải đáp ứng trước khi đến tay khách hàng. Sau Snowdon, nhóm nghiên cứu đã cung cấp cho mô hình các nội dung độc quyền từ Westlaw, Practical Law, Checkpoint và kho lưu trữ tin tức của Reuters. Cho đến nay, chưa đến 10% nội dung đó được sử dụng, để lại nhiều không gian để mở rộng khi có thêm nhiều dữ liệu được nạp vào. Bước cuối cùng là bổ sung học tăng cường dạng tác nhân (agentic reinforcement learning): mô hình tương tác với các môi trường công cụ riêng của Thomson Reuters, nhận phản hồi và cập nhật chính sách của mình để cải thiện hiệu suất thực hiện nhiệm vụ. Trong bối cảnh này, học tăng cường dạy mô hình đạt được các mục tiêu (như tìm đúng trích dẫn) thông qua quá trình thử và sai thay vì các ví dụ tĩnh.
Hiệu năng của mô hình
Trên Stanford LegalBench—một bộ các bài kiểm tra suy luận pháp lý—mô hình nội bộ đạt 0,823, đứng sau Gemini 3.1 Pro, GPT-5.5 và Opus 4.8 trên Harvey Legal Agent Benchmark. Nó cũng tụt hậu trong các vấn đề lập trình và suy luận chung, cho thấy khả năng suy luận thô của nó vẫn yếu hơn so với các phòng thí nghiệm tiên phong, nơi đang đổ hàng tỷ USD vào các LLM đa năng, khổng lồ.
Lợi thế xuất hiện khi mô hình khai thác dữ liệu độc quyền của Thomson Reuters. Trong một bản kiểm thử Deep Research đo lường độ chính xác thực tế, mô hình đạt 0,53 khi chỉ có quyền truy cập web—thấp hơn mức 0,65 của GPT-5.4. Khi bổ sung các thư viện pháp lý nội bộ, độ chính xác đã tăng lên 0,83, vượt qua đối thủ thương mại. Kết quả này nhấn mạnh một mô hình quen thuộc: một mô hình có kích thước khiêm tốn, khi được cung cấp kiến thức chuyên ngành, có thể đánh bại các hệ thống lớn hơn nhiều nhưng thiếu thông tin đặc quyền đó.
Tại sao "tự sở hữu" lại tốt hơn "đi thuê"
CTO Joel Hron và Trưởng bộ phận Nghiên cứu Jonathan Schwartz chỉ ra ba trụ cột cho khoản đầu tư này:
- Chi phí và năng lực – Chạy các tác vụ khối lượng lớn như soát xét tài liệu trên một API thương mại sẽ phát sinh phí trên mỗi token, con số này tăng lên rất nhanh. Một mô hình chuyên dụng, nhỏ hơn có thể xử lý cùng một khối lượng công việc với một phần nhỏ chi phí trong khi vẫn duy trì hiệu suất đặc thù cho ngành luật.
- Chủ quyền dữ liệu – Tài sản quý giá nhất của Thomson Reuters là nội dung pháp lý được biên soạn kỹ lưỡng. Việc giao dữ liệu đó cho một nhà cung cấp AI bên ngoài sẽ tạo ra các rủi ro về bảo mật và tính bảo mật, đồng thời trao cho nhà cung cấp một lợi thế cạnh tranh. Việc giữ dữ liệu nội bộ đảm bảo các cải tiến luôn được giữ kín.
- Tích lũy giá trị trí tuệ theo cấp số nhân – Mỗi khi một luật sư xem xét kết quả đầu ra của mô hình, tương tác đó có thể được ghi lại làm dữ liệu huấn luyện, giúp tinh chỉnh mô hình dần dần. Theo thời gian, công ty xây dựng một tài sản tự củng cố và ngày càng trở nên giá trị hơn, giống như việc sở hữu bất động sản thay vì phải trả tiền thuê nhà.
Các trường hợp sử dụng đầu tiên và sự ủng hộ mã nguồn mở
Mô hình đang được triển khai trong bộ CoCounsel Legal của Thomson Reuters cho các tác vụ đòi hỏi năng suất cao và chi phí thấp, chẳng hạn như tính năng Tabular Analysis giúp trích xuất dữ liệu có cấu trúc từ các hợp đồng. Nó cũng xử lý việc kiểm tra trích dẫn, một bước lặp đi lặp lại nhưng cực kỳ quan trọng về độ chính xác trong soạn thảo văn bản pháp lý.
Để nuôi dưỡng hệ sinh thái nhà phát triển, một phiên bản rút gọn sẽ xuất hiện trên Hugging Face dưới giấy phép phi thương mại. Điều này cho phép các nhà nghiên cứu và đối tác thử nghiệm mà không làm lộ mô hình độc quyền đầy đủ vốn đang vận hành các sản phẩm tạo ra doanh thu của công ty.
