از هوش اجارهای تا کارخانهی تولید مدل
سالها بود که Thomson Reuters با تنظیم دقیق (fine-tuning) مدلهای تجاریِ آزمایشگاههای شخص ثالث، محصولات ارتقایافته با هوش مصنوعی ارائه میکرد. تنظیم دقیق، یک مدل پیشآموزشدیده را میگیرد و وزنهای آن را روی یک مجموعه داده کوچکتر تغییر میدهد، اما این کار قدرت استدلال گستردهی مدل را کاهش داده و شرکت را به قیمتگذاری و محدودیتهای API ارائهدهنده وابسته میکند.
اکنون این شرکت با هوش مصنوعی مانند یک خط تولید برخورد میکند. در دو سال گذشته، این شرکت مهندسان، دانشمندان داده و متخصصان محاسباتی را استخدام کرده و ۴۰ میلیون دلار صرف زمان پردازش GPU ابری و سختافزارهای در محل (on-prem) کرده است تا مدلی را بر پایه سری متنباز Qwen — معماری Qwen متعلق به Alibaba — آموزش دهد. متنباز بودن به این معناست که کد و وزنها عمومی هستند، بنابراین Thomson Reuters توانست بدون پرداخت هزینهی لایسنس، از یک زیربنای قدرتمند شروع کند.
مشارکت با Imperial College منجر به تولید یک مدل میانی به نام «Snowdon» شد که ابتدا برای ایمنی، اخلاق و بیطرفی سیاسی بازآموزی شد؛ یعنی الزاماتی که هر LLM باید پیش از رسیدن به مشتریان رعایت کند. پس از Snowdon، تیم تحقیق، محتوای اختصاصی Westlaw، Practical Law، Checkpoint و آرشیوهای خبری Reuters را به مدل تزریق کرد. تاکنون کمتر از ۱۰ درصد از آن محتوا استفاده شده است که فضای زیادی را برای مقیاسپذیری با ورود دادههای بیشتر باقی میگذارد. گام نهایی، افزودن یادگیری تقویتی عاملمحور (agentic reinforcement learning) بود: مدل با محیطهای ابزاری خودِ Thomson Reuters تعامل میکند، بازخورد دریافت میکند و سیاستهای خود را برای بهبود عملکرد در انجام وظایف بهروزرسانی میکند. در این زمینه، یادگیری تقویتی به مدل میآموزد که به جای استفاده از مثالهای ایستا، از طریق آزمون و خطا به اهداف (مانند یافتن استناد صحیح) دست یابد.
مقایسه عملکرد مدل
در Stanford LegalBench — مجموعهای از آزمونهای استدلال حقوقی — مدل داخلی شرکت امتیاز ۰.۸۲۳ را کسب کرد که در معیار Harvey Legal Agent Benchmark، پس از Gemini 3.1 Pro، GPT-5.5 و Opus 4.8 قرار میگیرد. این مدل همچنین در مسائل عمومی کدنویسی و استدلال عقبتر است، که نشان میدهد قدرت استدلال خام آن همچنان ضعیفتر از آزمایشگاههای پیشرو است که میلیاردها دلار برای توسعه LLMهای عظیم و چندمنظوره هزینه میکنند.
مزیت اصلی زمانی آشکار میشود که مدل از دادههای انحصاری Thomson Reuters استفاده میکند. در یک معیار Deep Research که دقت واقعگرایانه را میسنجد، مدل تنها با دسترسی به وب به امتیاز ۰.۵۳ رسید که کمتر از امتیاز ۰.۶۵ در GPT-5.4 است. افزودن کتابخانههای حقوقی داخلی، دقت را به ۰.۸۳ رساند و از رقیب تجاری پیشی گرفت. این نتیجه یک الگوی آشنا را تأیید میکند: یک مدل با اندازه متوسط، زمانی که با دانش تخصصی حوزه تغذیه شود، میتواند سیستمهای بسیار بزرگتری را که فاقد آن اطلاعات متمایز هستند، شکست دهد.
چرا «مالکیت» بر «اجاره» برتری دارد
Joel Hron، مدیر ارشد فناوری (CTO) و Jonathan Schwartz، مدیر بخش تحقیق، به سه رکن اصلی برای این سرمایهگذاری اشاره میکنند:
- هزینه و قابلیت – اجرای وظایف با حجم بالا مانند بررسی اسناد روی یک API تجاری، هزینههای مربوط به هر توکن (per-token) را تحمیل میکند که به سرعت انباشته میشوند. یک مدل اختصاصی و کوچکتر، همان حجم کار را با کسری از آن قیمت پردازش میکند و در عین حال عملکرد تخصصی حقوقی را نیز حفظ مینماید.
- حاکمیت دادهها – ارزشمندترین دارایی Thomson Reuters، محتوای حقوقی دستچین شدهی آن است. سپردن این دادهها به یک ارائهدهنده هوش مصنوعی خارجی، ریسکهای امنیتی و محرمانگی ایجاد کرده و به ارائهدهنده یک مزیت رقابتی میدهد. نگه داشتن دادهها در داخل شرکت تضمین میکند که بهبودها خصوصی باقی بمانند.
- انباشت سرمایهی فکری – هر بار که یک وکیل خروجی مدل را بررسی میکند، آن تعامل میتواند به عنوان دادهی آموزشی ثبت شده و به تدریج مدل را اصلاح کند. با گذشت زمان، شرکت یک دارایی خود-تقویتکننده میسازد که ارزشمندتر میشود؛ درست مانند مالکیت یک ملک به جای پرداخت اجارهبها.
اولین موارد استفاده و اشارهای به متنباز بودن
این مدل در مجموعهی CoCounsel Legal متعلق به Thomson Reuters برای وظایفی که نیازمند توان عملیاتی بالا و هزینه کم هستند، در حال عرضه است؛ مانند ویژگی Tabular Analysis که دادههای ساختاریافته را از قراردادها استخراج میکند. این مدل همچنین وظیفهی بررسی استنادها (citation-checking) را بر عهده دارد که مرحلهای تکراری اما حیاتی برای دقت در تنظیم اسناد حقوقی است.
برای پرورش یک اکوسیستم توسعهدهنده، نسخهی سبکشدهای از این مدل تحت یک لایسنس غیرتجاری در Hugging Face منتشر خواهد شد. این کار به پژوهشگران و شرکا اجازه میدهد بدون در معرض قرار دادن مدل کامل و اختصاصی که محصولات درآمدزای شرکت را تغذیه میکند، به آزمایش و تجربه بپردازند.
