کرائے کی ذہانت سے ماڈل فیکٹری تک

برسوں تک Thomson Reuters نے تیسری پارٹی کی لیبارٹریز کے تجارتی ماڈلز کی فائن ٹیوننگ کے ذریعے AI سے افزودہ مصنوعات پیش کیں۔ فائن ٹیوننگ ایک پہلے سے تربیت یافتہ ماڈل کو لیتی ہے اور اسے ایک چھوٹے ڈیٹا سیٹ پر ایڈجسٹ کرتی ہے، لیکن یہ ماڈل کی وسیع پیمانے پر استدلال کرنے کی صلاحیت کو کم کر دیتی ہے اور کمپنی کو فراہم کنندہ کی قیمتوں اور API کی حدود کا پابند بنا دیتی ہے۔

اب کمپنی AI کو ایک پروڈکشن لائن کی طرح دیکھتی ہے۔ گزشتہ دو سالوں میں اس نے انجینئرز، ڈیٹا سائنسدانوں اور کمپیوٹ ماہرین کو ملازمت پر رکھا، اور اوپن سورس Qwen سیریز—Alibaba کے Qwen آرکیٹیکچر—سے ایک ماڈل تربیت دینے کے لیے کلاؤڈ GPU وقت اور آن پریم ہارڈ ویئر پر 40 ملین ڈالر خرچ کیے۔ اوپن سورس کا مطلب ہے کہ کوڈ اور ویٹس عوامی طور پر دستیاب ہیں، اس لیے Thomson Reuters بغیر کسی لائسنسنگ فیس کے ایک مضبوط بنیاد سے آغاز کر سکا۔

Imperial College کے ساتھ شراکت داری سے ایک درمیانی "Snowdon" ماڈل تیار ہوا، جسے پہلے حفاظت، اخلاقیات اور سیاسی غیر جانبداری کے لیے دوبارہ تربیت دی گئی—یہ وہ ضروریات ہیں جنہیں کسی بھی LLM کو صارفین تک پہنچنے سے پہلے پورا کرنا ہوتا ہے۔ Snowdon کے بعد، ٹیم نے ماڈل کو Westlaw، Practical Law، Checkpoint اور Reuters کے نیوز آرکائیوز سے حاصل کردہ ملکیتی مواد فراہم کیا۔ اب تک اس مواد کا 10 فیصد سے بھی کم استعمال کیا گیا ہے، جس کا مطلب ہے کہ مزید ڈیٹا شامل ہونے کے ساتھ اس میں وسعت دینے کی کافی گنجائش موجود ہے۔ آخری مرحلے میں ایجنٹک ری انفورسمنٹ لرننگ (agentic reinforcement learning) شامل کی گئی: ماڈل Thomson Reuters کے اپنے ٹول انوائرمنٹس کے ساتھ بات چیت کرتا ہے، فیڈ بیک حاصل کرتا ہے، اور کام کی کارکردگی کو بہتر بنانے کے لیے اپنی پالیسی کو اپ ڈیٹ کرتا ہے۔ اس تناظر میں، ری انفورسمنٹ لرننگ ماڈل کو جامد مثالوں کے بجائے کوشش اور غلطی (trial and error) کے ذریعے اہداف حاصل کرنا سکھاتی ہے (جیسے کہ درست حوالہ تلاش کرنا)۔

ماڈل کی کارکردگی کا موازنہ

Stanford LegalBench—جو کہ قانونی استدلال کے ٹیسٹوں کا ایک مجموعہ ہے—پر، ان ہاؤس ماڈل نے 0.823 اسکور کیا، جو Harvey Legal Agent Benchmark پر Gemini 3.1 Pro، GPT-5.5 اور Opus 4.8 سے پیچھے ہے۔ یہ عام کوڈنگ اور استدلال کے مسائل میں بھی پیچھے ہے، جو یہ ظاہر کرتا ہے کہ اس کی بنیادی استدلال کی طاقت ان فرنٹیر لیبارٹریز سے کم ہے جو بڑے پیمانے پر، عام مقصد کے لیے استعمال ہونے والے LLMs پر اربوں ڈالر خرچ کرتی ہیں۔

فائدہ اس وقت نظر آتا ہے جب ماڈل Thomson Reuters کے خصوصی ڈیٹا کا استعمال کرتا ہے۔ حقائق کی درستگی کی پیمائش کرنے والے Deep Research بینچ مارک میں، ماڈل نے صرف ویب تک رسائی کے ساتھ 0.53 اسکور کیا—جو GPT-5.4 کے 0.65 سے کم ہے۔ اس کی اپنی اندرونی قانونی لائبریریاں شامل کرنے سے درستگی 0.83 تک پہنچ گئی، جس نے تجارتی حریف کو پیچھے چھوڑ دیا۔ یہ نتیجہ ایک مانوس پیٹرن کی نشاندہی کرتا ہے: ایک درمیانے سائز کا ماڈل، جب اسے مخصوص شعبے کا علم فراہم کیا جائے، تو وہ ان بہت بڑے سسٹمز کو شکست دے سکتا ہے جن کے پاس وہ خصوصی معلومات نہیں ہوتیں۔

"ملکیت" کیوں "کرایے" سے بہتر ہے

CTO Joel Hron اور ریسرچ چیف Jonathan Schwartz اس سرمایہ کاری کے لیے تین ستونوں کی نشاندہی کرتے ہیں:

  1. لاگت اور صلاحیت – تجارتی API پر دستاویزات کے جائزے جیسے زیادہ حجم والے کام چلانے سے فی ٹوکن فیس لگتی ہے جو تیزی سے بڑھتی جاتی ہے۔ ایک مخصوص، چھوٹا ماڈل قانونی کارکردگی کو برقرار رکھتے ہوئے بہت کم قیمت پر وہی کام مکمل کر سکتا ہے۔
  2. ڈیٹا کی خودمختاری – Thomson Reuters کا سب سے قیمتی اثاثہ اس کا ترتیب دیا گیا قانونی مواد ہے۔ اس ڈیٹا کو کسی بیرونی AI فراہم کنندہ کے حوالے کرنے سے سیکیورٹی اور رازداری کے خطرات پیدا ہوتے ہیں اور فراہم کنندہ کو مسابقتی برتری مل جاتی ہے۔ ڈیٹا کو ان ہاؤس رکھنے سے یہ یقینی بنتا ہے کہ بہتری کے اقدامات نجی رہیں۔
  3. علمی اثاثے میں اضافہ – ہر بار جب کوئی وکیل ماڈل کے آؤٹ پٹ کا جائزہ لیتا ہے، تو اس عمل کو ٹریننگ ڈیٹا کے طور پر ریکارڈ کیا جا سکتا ہے، جس سے ماڈل رفتہ رفتہ بہتر ہوتا جاتا ہے۔ وقت کے ساتھ ساتھ کمپنی ایک ایسا خود کار اثاثہ تیار کرتی ہے جو مزید قیمتی ہوتا جاتا ہے، بالکل ویسے ہی جیسے کرایہ دینے کے بجائے جائیداد کی ملکیت رکھنا۔

پہلے استعمال کے کیسز اور اوپن سورس کی طرف اشارہ

یہ ماڈل Thomson Reuters کے CoCounsel Legal سوٹ میں ان کاموں کے لیے متعارف کرایا جا رہا ہے جن میں زیادہ تھرو پٹ اور کم لاگت کی ضرورت ہوتی ہے، جیسے کہ Tabular Analysis فیچر جو معاہدوں سے ساخت شدہ ڈیٹا نکالتا ہے۔ یہ حوالہ جات کی جانچ (citation-checking) بھی کرتا ہے، جو کہ قانونی ڈرافٹنگ میں ایک بار بار ہونے والا لیکن درستگی کے لحاظ سے اہم مرحلہ ہے۔

ڈیولپر ایکو سسٹم کو فروغ دینے کے لیے، اس کا ایک مختصر ورژن غیر تجارتی لائسنس کے تحت Hugging Face پر دستیاب ہوگا۔ اس سے محققین اور شراکت دار اس مکمل ملکیتی ماڈل کو ظاہر کیے بغیر تجربات کر سکیں گے جو کمپنی کی آمدنی پیدا کرنے والی مصنوعات کو طاقت فراہم کرتا ہے۔