வாடகைக்கு எடுத்த நுண்ணறிவிலிருந்து ஒரு மாதிரித் தொழிற்சாலைக்கு

பல ஆண்டுகளாக, Thomson Reuters மூன்றாம் தரப்பு ஆய்வகங்களின் வணிக மாதிரிகளை (commercial models) fine-tuning செய்வதன் மூலம் AI-மேம்படுத்தப்பட்ட தயாரிப்புகளை வழங்கி வந்தது. Fine-tuning என்பது ஏற்கனவே பயிற்சியளிக்கப்பட்ட ஒரு மாதிரியை எடுத்து, ஒரு சிறிய தரவுத்தொகுப்பைக் கொண்டு அதன் எடைகளை (weights) மாற்றியமைப்பதாகும்; ஆனால் இது மாதிரியின் பரந்த பகுத்தறியும் திறனைக் குறைப்பதோடு, நிறுவனத்தை அந்த வழங்குநரின் விலை நிர்ணயம் மற்றும் API வரம்புகளுக்குக் கட்டுப்படுத்துகிறது.

இப்போது நிறுவனம் AI-யை ஒரு உற்பத்தி வரிசையைப் போலக் கையாள்கிறது. கடந்த இரண்டு ஆண்டுகளில், பொறியாளர்கள், தரவு விஞ்ஞானிகள் மற்றும் கணினி நிபுணர்களை (compute specialists) பணியமர்த்தியதுடன், Alibaba-வின் Qwen கட்டமைப்பிலான திறந்த மூல (open-source) Qwen தொடரை அடிப்படையாகக் கொண்ட ஒரு மாதிரியைப் பயிற்றுவிக்க, கிளவுட் GPU நேரம் மற்றும் ஆன்-பிரமிஸ் (on-prem) வன்பொருளுக்காக $40 மில்லியன் செலவிட்டது. திறந்த மூலம் (Open-source) என்பது அதன் குறியீடு மற்றும் எடைகள் பொதுவானவை என்பதால், Thomson Reuters உரிமக் கட்டணங்கள் இன்றி ஒரு வலுவான அடித்தளத்திலிருந்து தொடங்க முடிந்தது.

Imperial College உடனான கூட்டாண்மை மூலம் ஒரு இடைநிலை “Snowdon” மாதிரி உருவாக்கப்பட்டது; இது முதலில் பாதுகாப்பு, அறநெறி மற்றும் அரசியல் நடுநிலைமை ஆகியவற்றிற்காக மறுபயிற்சி அளிக்கப்பட்டது—வாடிக்கையாளர்களைச் சென்றடைவதற்கு முன் எந்தவொரு LLM-ம் பூர்த்தி செய்ய வேண்டிய தேவைகள் இவை. Snowdon-க்கு பிறகு, அந்தத் குழு Westlaw, Practical Law, Checkpoint மற்றும் Reuters செய்தி ஆவணங்களிலிருந்து நிறுவனத்திற்குச் சொந்தமான உள்ளடக்கத்தை மாதிரியில் சேர்த்தது. இதுவரை அந்த உள்ளடக்கத்தில் 10%-க்கும் குறைவான அளவே பயன்படுத்தப்பட்டுள்ளது, எனவே அதிக தரவுகள் உள்ளீடு செய்யப்படும்போது விரிவாக்கம் செய்ய போதுமான இடமிருக்கிறது. இறுதிப் படியாக, agentic reinforcement learning சேர்க்கப்பட்டது: இந்த மாதிரி Thomson Reuters-இன் சொந்தக் கருவி சூழல்களுடன் (tool environments) தொடர்பு கொண்டு, பின்னூட்டங்களைப் பெற்று, பணிச் செயல்பாட்டை மேம்படுத்த அதன் கொள்கையைத் தானாகவே புதுப்பித்துக் கொள்கிறது. இந்தச் சூழலில், reinforcement learning என்பது ஒரு மாதிரி நிலையான உதாரணங்கள் மூலம் கற்றுக் கொள்வதற்குப் பதிலாக, முயற்சி மற்றும் தவறு (trial and error) மூலம் இலக்குகளை (சரியான மேற்கோளைக் கண்டறிவது போன்றவற்றை) அடையக் கற்பிக்கிறது.

இந்த மாதிரி எவ்வாறு செயல்படுகிறது

Stanford LegalBench—சட்ட ரீதியான பகுத்தறியும் சோதனைகளின் தொகுப்பு—இல், இந்த உள்நாட்டு மாதிரி 0.823 மதிப்பெண்களைப் பெற்றது; இது Harvey Legal Agent Benchmark-இல் Gemini 3.1 Pro, GPT-5.5 மற்றும் Opus 4.8 ஆகியவற்றிற்குப் பின் தங்கியுள்ளது. பொதுவான கோடிங் (coding) மற்றும் பகுத்தறியும் சிக்கல்களிலும் இது பின்தங்கியுள்ளது, இது பிரம்மாண்டமான, பொது நோக்கத்திற்கான LLM-களுக்காக பில்லியன் கணக்கான டாலர்களைச் செலவிடும் முன்னணி ஆய்வகங்களை விட இதன் அடிப்படை பகுத்தறியும் திறன் பலவீனமாக இருப்பதை உணர்த்துகிறது.

Thomson Reuters-இன் பிரத்யேகத் தரவுகளை இந்த மாதிரி பயன்படுத்தும்போது அதன் சாதகமான அம்சம் வெளிப்படுகிறது. உண்மையான துல்லியத்தை அளவிடும் ஒரு Deep Research பெஞ்ச்மார்க்கில், இணைய அணுகலை மட்டுமே கொண்டு இந்த மாதிரி 0.53 மதிப்பெண்களைப் பெற்றது—இது GPT-5.4-இன் 0.65-ஐ விடக் குறைவு. அதன் உள்நாட்டு சட்ட நூலகங்களைச் சேர்த்தபோது, துல்லியம் 0.83 ஆக உயர்ந்து, வணிகப் போட்டியாளரை முந்தியது. இந்த முடிவு ஒரு தெரிந்த முறையை அடிக்கோடிட்டுக் காட்டுகிறது: ஒரு மிதமான அளவுள்ள மாதிரி, குறிப்பிட்ட துறை சார்ந்த அறிவை (domain-specific knowledge) பெற்றால், அந்தத் தனிப்பட்ட தகவல்கள் இல்லாத மிகப் பெரிய அமைப்புகளைத் தோற்கடிக்க முடியும்.

ஏன் “சொந்தமாக வைத்திருப்பது” “வாடகைக்கு எடுப்பதை விட” சிறந்தது

CTO Joel Hron மற்றும் ஆராய்ச்சித் தலைவர் Jonathan Schwartz இந்த முதலீட்டிற்கான மூன்று தூண்களைக் குறிப்பிடுகின்றனர்:

  1. செலவு மற்றும் திறன் – ஆவண ஆய்வு போன்ற அதிக அளவிலான பணிகளை ஒரு வணிக API மூலம் இயக்குவது, ஒவ்வொரு டோக்கனுக்கும் (per-token) கட்டணம் வசூலிக்கும், இது மிக விரைவாக அதிகரிக்கும். ஒரு பிரத்யேகமான, சிறிய மாதிரி, சட்டத் துறை சார்ந்த செயல்திறனைப் பேணிக்கொண்டு அதே வேலையை மிகக் குறைந்த விலையில் செய்கிறது.
  2. தரவு இறையாண்மை (Data sovereignty) – Thomson Reuters-இன் மிகவும் மதிப்புமிக்க சொத்து அதன் தொகுக்கப்பட்ட சட்ட உள்ளடக்கமாகும். அந்தத் தரவை ஒரு வெளிப்புற AI வழங்குநரிடம் ஒப்படைப்பது பாதுகாப்பு மற்றும் ரகசியத்தன்மை அபாயங்களை உருவாக்குவதோடு, அந்த வழங்குநருக்கு ஒரு போட்டிச் சாதகத்தையும் அளிக்கிறது. தரவை நிறுவனத்திற்குள்ளேயே வைத்திருப்பது, முன்னேற்றங்கள் தனிப்பயனாக்கப்படுவதை உறுதி செய்கிறது.
  3. கூட்டு அறிவுசார் சொத்து மதிப்பு (Compounding intellectual equity) – ஒவ்வொரு முறையும் ஒரு வழக்கறிஞர் மாதிரியின் வெளியீட்டை ஆய்வு செய்யும்போதும், அந்தத் தொடர்பு பயிற்சியளிக்கும் தரவாகப் பதிவு செய்யப்பட்டு, படிப்படியாக மாதிரியை மேம்படுத்தும். காலப்போக்கில், நிறுவனம் வாடகை செலுத்துவதற்குப் பதிலாக ஒரு சொத்தை வைத்திருப்பதைப் போல, மதிப்புமிக்க மற்றும் தன்னைத்தானே வலுவூட்டிக் கொள்ளும் ஒரு சொத்தை உருவாக்குகிறது.

முதல் பயன்பாட்டு வழக்குகள் மற்றும் திறந்த மூல மென்பொருள் அங்கீகாரம்

ஒப்பந்தங்களிலிருந்து கட்டமைக்கப்பட்ட தரவை (structured data) பிரித்தெடுக்கும் Tabular Analysis போன்ற அதிக உற்பத்தித் திறன் மற்றும் குறைந்த செலவு தேவைப்படும் பணிகளுக்காக, Thomson Reuters-இன் CoCounsel Legal தொகுப்பில் இந்த மாதிரி அறிமுகப்படுத்தப்படுகிறது. இது சட்ட வரைவுகளில் (legal drafting) மீண்டும் மீண்டும் செய்யப்படும் ஆனால் துல்லியம் மிக முக்கியமான ஒரு படியான மேற்கோள் சரிபார்ப்பையும் (citation-checking) கையாள்கிறது.

ஒரு டெவலப்பர் சூழலை வளர்ப்பதற்காக, இதன் சுருக்கப்பட்ட பதிப்பு Hugging Face தளத்தில் வணிக நோக்கமற்ற உரிமத்தின் கீழ் (non-commercial license) வெளியாகும். இது ஆராய்ச்சியாளர்களும் கூட்டாளர்களும் நிறுவனத்தின் வருவாய் ஈட்டும் தயாரிப்புகளுக்குப் பயன்படும் முழுமையான, தனியுரிமை மாதிரியை வெளிப்படுத்தாமல் பரிசோதனை செய்ய அனுமதிக்கிறது.