از هوش اجاره‌ای تا کارخانه‌ی تولید مدل

سال‌ها بود که Thomson Reuters با تنظیم دقیق (fine-tuning) مدل‌های تجاریِ آزمایشگاه‌های شخص ثالث، محصولات ارتقایافته با هوش مصنوعی ارائه می‌کرد. تنظیم دقیق، یک مدل پیش‌آموزش‌دیده را می‌گیرد و وزن‌های آن را روی یک مجموعه داده کوچک‌تر تغییر می‌دهد، اما این کار قدرت استدلال گسترده‌ی مدل را کاهش داده و شرکت را به قیمت‌گذاری و محدودیت‌های API ارائه‌دهنده وابسته می‌کند.

اکنون این شرکت با هوش مصنوعی مانند یک خط تولید برخورد می‌کند. در دو سال گذشته، این شرکت مهندسان، دانشمندان داده و متخصصان محاسباتی را استخدام کرده و ۴۰ میلیون دلار صرف زمان پردازش GPU ابری و سخت‌افزارهای در محل (on-prem) کرده است تا مدلی را بر پایه سری متن‌باز Qwen — معماری Qwen متعلق به Alibaba — آموزش دهد. متن‌باز بودن به این معناست که کد و وزن‌ها عمومی هستند، بنابراین Thomson Reuters توانست بدون پرداخت هزینه‌ی لایسنس، از یک زیربنای قدرتمند شروع کند.

مشارکت با Imperial College منجر به تولید یک مدل میانی به نام «Snowdon» شد که ابتدا برای ایمنی، اخلاق و بی‌طرفی سیاسی بازآموزی شد؛ یعنی الزاماتی که هر LLM باید پیش از رسیدن به مشتریان رعایت کند. پس از Snowdon، تیم تحقیق، محتوای اختصاصی Westlaw، Practical Law، Checkpoint و آرشیوهای خبری Reuters را به مدل تزریق کرد. تاکنون کمتر از ۱۰ درصد از آن محتوا استفاده شده است که فضای زیادی را برای مقیاس‌پذیری با ورود داده‌های بیشتر باقی می‌گذارد. گام نهایی، افزودن یادگیری تقویتی عامل‌محور (agentic reinforcement learning) بود: مدل با محیط‌های ابزاری خودِ Thomson Reuters تعامل می‌کند، بازخورد دریافت می‌کند و سیاست‌های خود را برای بهبود عملکرد در انجام وظایف به‌روزرسانی می‌کند. در این زمینه، یادگیری تقویتی به مدل می‌آموزد که به جای استفاده از مثال‌های ایستا، از طریق آزمون و خطا به اهداف (مانند یافتن استناد صحیح) دست یابد.

مقایسه عملکرد مدل

در Stanford LegalBench — مجموعه‌ای از آزمون‌های استدلال حقوقی — مدل داخلی شرکت امتیاز ۰.۸۲۳ را کسب کرد که در معیار Harvey Legal Agent Benchmark، پس از Gemini 3.1 Pro، GPT-5.5 و Opus 4.8 قرار می‌گیرد. این مدل همچنین در مسائل عمومی کدنویسی و استدلال عقب‌تر است، که نشان می‌دهد قدرت استدلال خام آن همچنان ضعیف‌تر از آزمایشگاه‌های پیشرو است که میلیاردها دلار برای توسعه LLMهای عظیم و چندمنظوره هزینه می‌کنند.

مزیت اصلی زمانی آشکار می‌شود که مدل از داده‌های انحصاری Thomson Reuters استفاده می‌کند. در یک معیار Deep Research که دقت واقع‌گرایانه را می‌سنجد، مدل تنها با دسترسی به وب به امتیاز ۰.۵۳ رسید که کمتر از امتیاز ۰.۶۵ در GPT-5.4 است. افزودن کتابخانه‌های حقوقی داخلی، دقت را به ۰.۸۳ رساند و از رقیب تجاری پیشی گرفت. این نتیجه یک الگوی آشنا را تأیید می‌کند: یک مدل با اندازه متوسط، زمانی که با دانش تخصصی حوزه تغذیه شود، می‌تواند سیستم‌های بسیار بزرگتری را که فاقد آن اطلاعات متمایز هستند، شکست دهد.

چرا «مالکیت» بر «اجاره» برتری دارد

Joel Hron، مدیر ارشد فناوری (CTO) و Jonathan Schwartz، مدیر بخش تحقیق، به سه رکن اصلی برای این سرمایه‌گذاری اشاره می‌کنند:

  1. هزینه و قابلیت – اجرای وظایف با حجم بالا مانند بررسی اسناد روی یک API تجاری، هزینه‌های مربوط به هر توکن (per-token) را تحمیل می‌کند که به سرعت انباشته می‌شوند. یک مدل اختصاصی و کوچک‌تر، همان حجم کار را با کسری از آن قیمت پردازش می‌کند و در عین حال عملکرد تخصصی حقوقی را نیز حفظ می‌نماید.
  2. حاکمیت داده‌ها – ارزشمندترین دارایی Thomson Reuters، محتوای حقوقی دست‌چین شده‌ی آن است. سپردن این داده‌ها به یک ارائه‌دهنده هوش مصنوعی خارجی، ریسک‌های امنیتی و محرمانگی ایجاد کرده و به ارائه‌دهنده یک مزیت رقابتی می‌دهد. نگه داشتن داده‌ها در داخل شرکت تضمین می‌کند که بهبودها خصوصی باقی بمانند.
  3. انباشت سرمایه‌ی فکری – هر بار که یک وکیل خروجی مدل را بررسی می‌کند، آن تعامل می‌تواند به عنوان داده‌ی آموزشی ثبت شده و به تدریج مدل را اصلاح کند. با گذشت زمان، شرکت یک دارایی خود-تقویت‌کننده می‌سازد که ارزشمندتر می‌شود؛ درست مانند مالکیت یک ملک به جای پرداخت اجاره‌بها.

اولین موارد استفاده و اشاره‌ای به متن‌باز بودن

این مدل در مجموعه‌ی CoCounsel Legal متعلق به Thomson Reuters برای وظایفی که نیازمند توان عملیاتی بالا و هزینه کم هستند، در حال عرضه است؛ مانند ویژگی Tabular Analysis که داده‌های ساختاریافته را از قراردادها استخراج می‌کند. این مدل همچنین وظیفه‌ی بررسی استنادها (citation-checking) را بر عهده دارد که مرحله‌ای تکراری اما حیاتی برای دقت در تنظیم اسناد حقوقی است.

برای پرورش یک اکوسیستم توسعه‌دهنده، نسخه‌ی سبک‌شده‌ای از این مدل تحت یک لایسنس غیرتجاری در Hugging Face منتشر خواهد شد. این کار به پژوهشگران و شرکا اجازه می‌دهد بدون در معرض قرار دادن مدل کامل و اختصاصی که محصولات درآمدزای شرکت را تغذیه می‌کند، به آزمایش و تجربه بپردازند.