అద్దె మేధస్సు నుండి మోడల్ ఫ్యాక్టరీ వరకు

సంవత్సరాల తరబడి Thomson Reuters థర్డ్-పార్టీ ల్యాబ్స్ నుండి వచ్చిన కమర్షియల్ మోడల్స్‌ను ఫైన్-ట్యూనింగ్ చేయడం ద్వారా AI-మెరుగుపరచబడిన ఉత్పత్తులను అందించింది. ఫైన్-ట్యూనింగ్ అనేది ఒక ప్రీ-ట్రైన్డ్ మోడల్‌ను తీసుకుని, చిన్న డేటాసెట్‌పై దాని వెయిట్స్‌ను (weights) మార్చడం ద్వారా జరుగుతుంది, కానీ ఇది మోడల్ యొక్క విస్తృతమైన తార్కికతను (reasoning) తగ్గిస్తుంది మరియు కంపెనీని ప్రొవైడర్ యొక్క ధరలు మరియు API పరిమితులకు కట్టుబడి ఉండేలా చేస్తుంది.

ఇప్పుడు ఈ కంపెనీ AIని ఒక ప్రొడక్షన్ లైన్‌లా పరిగణిస్తోంది. గత రెండేళ్లలో, ఇది ఇంజనీర్లు, డేటా సైంటిస్టులు మరియు కంప్యూట్ స్పెషలిస్టులను నియమించుకుంది, మరియు ఓపెన్-సోర్స్ Qwen సిరీస్—Alibaba యొక్క Qwen ఆర్కిటెక్చర్—ను ఉపయోగించి ఒక మోడల్‌ను శిక్షణ ఇవ్వడానికి క్లౌడ్ GPU సమయం మరియు ఆన్-ప్రెమ్ హార్డ్‌వేర్ కోసం $40 మిలియన్లను ఖర్చు చేసింది. ఓపెన్-సోర్స్ అంటే కోడ్ మరియు వెయిట్స్ బహిరంగంగా అందుబాటులో ఉంటాయి, కాబట్టి Thomson Reuters ఎటువంటి లైసెన్సింగ్ ఫీజులు లేకుండా బలమైన పునాది నుండి ప్రారంభించగలిగింది.

Imperial Collegeతో భాగస్వామ్యం ద్వారా ఒక మధ్యంతర “Snowdon” మోడల్ రూపొందించబడింది, ఇది మొదట భద్రత, నైతికత మరియు రాజకీయ తటస్థత కోసం రీట్రైన్ చేయబడింది—కస్టమర్లకు చేరువయ్యే ముందు ఏ LLM అయినా ఈ అవసరాలను తీర్చాలి. Snowdon తర్వాత, బృందం Westlaw, Practical Law, Checkpoint మరియు Reuters వార్తా ఆర్కైవ్స్ నుండి వచ్చిన ప్రొప్రైటరీ కంటెంట్‌ను మోడల్‌కు అందించింది. ఇప్పటివరకు ఆ కంటెంట్‌లో 10% కంటే తక్కువ మాత్రమే ఉపయోగించబడింది, అంటే మరిన్ని డేటాను చేర్చుతున్న కొద్దీ విస్తరించడానికి ఇంకా చాలా అవకాశం ఉంది. చివరి దశలో ఏజెంటిక్ రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ (agentic reinforcement learning) జోడించబడింది: మోడల్ Thomson Reuters యొక్క స్వంత టూల్ ఎన్విరాన్‌మెంట్లతో సంభాషిస్తుంది, ఫీడ్‌బ్యాక్ అందుకుంటుంది మరియు టాస్క్ పనితీరును మెరుగుపరచడానికి దాని పాలసీని అప్‌డేట్ చేస్తుంది. ఈ సందర్భంలో, రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ అనేది మోడల్‌కు స్టాటిక్ ఉదాహరణల ద్వారా కాకుండా, ట్రయల్ అండ్ ఎర్రర్ (trial and error) ద్వారా లక్ష్యాలను (సరైన సైటేషన్‌ను కనుగొనడం వంటివి) సాధించడం నేర్పిస్తుంది.

మోడల్ పనితీరు ఎలా ఉంది

లీగల్-రీజనింగ్ పరీక్షల సమియైన Stanford LegalBenchలో, ఈ ఇన్-హౌస్ మోడల్ 0.823 స్కోరు సాధించింది, ఇది Harvey Legal Agent Benchmarkలో Gemini 3.1 Pro, GPT-5.5 మరియు Opus 4.8 కంటే వెనుకబడి ఉంది. ఇది జనరిక్ కోడింగ్ మరియు రీజనింగ్ సమస్యలలో కూడా వెనుకబడి ఉంది, దీనివల్ల భారీ, జనరల్-పర్పస్ LLMల కోసం బిలియన్ల కొద్దీ ఖర్చు చేసే ఫ్రంటియర్ ల్యాబ్స్ కంటే దీని ప్రాథమిక తార్కిక శక్తి (raw reasoning power) బలహీనంగా ఉందని తెలుస్తోంది.

మోడల్ Thomson Reuters యొక్క ప్రత్యేకమైన డేటాను ఉపయోగించినప్పుడు దీని ప్రయోజనం కనిపిస్తుంది. వాస్తవిక ఖచ్చితత్వాన్ని కొలిచే Deep Research బెంచ్‌మార్క్‌లో, వెబ్ యాక్సెస్ ద్వారా మాత్రమే మోడల్ 0.53 సాధించింది—ఇది GPT-5.4 యొక్క 0.65 కంటే తక్కువ. దీనికి అంతర్గత లీగల్ లైబ్రరీలను జోడించడంతో ఖచ్చితత్వం 0.83కి పెరిగింది, తద్వారా వాణిజ్య పోటీదారుని అధిగమించింది. ఈ ఫలితం ఒక తెలిసిన నమూనాను నొక్కి చెబుతుంది: ఒక మోడరేట్ పరిమాణం ఉన్న మోడల్‌కు డొమైన్-స్పెసిఫిక్ నాలెడ్జ్ అందించినప్పుడు, ఆ ప్రత్యేక సమాచారం లేని చాలా పెద్ద వ్యవస్థలను కూడా అది ఓడించగలదు.

"సొంతంగా కలిగి ఉండటం" ఎందుకు "అద్దెకు తీసుకోవడం" కంటే మెరుగైనది

CTO Joel Hron మరియు రీసెర్చ్ చీఫ్ Jonathan Schwartz ఈ పెట్టుబడికి మూడు ప్రధాన కారణాలను పేర్కొన్నారు:

  1. ఖర్చు మరియు సామర్థ్యం – డాక్యుమెంట్ రివ్యూ వంటి అధిక పరిమాణపు పనులను కమర్షియల్ APIపై నిర్వహించడం వల్ల పెర్-టోకెన్ (per-token) ఫీజులు వేగంగా పెరుగుతాయి. ఒక ప్రత్యేకమైన, చిన్న మోడల్ చట్టపరమైన పనితీరును (legal-specific performance) కాపాడుతూనే, చాలా తక్కువ ధరకే అదే పనిభారాన్ని పూర్తి చేస్తుంది.
  2. డేటా సార్వభౌమాధికారం (Data sovereignty) – Thomson Reuters యొక్క అత్యంత విలువైన ఆస్తి దాని క్యూరేటెడ్ లీగల్ కంటెంట్. ఆ డేటాను బాహ్య AI ప్రొవైడర్‌కు అందించడం వల్ల భద్రత మరియు గోప్యత పరమైన రిస్క్‌లు ఏర్పడతాయి మరియు అది ప్రొవైడర్‌కు పోటీతత్వాన్ని ఇస్తుంది. డేటాను ఇన్-హౌస్‌లోనే ఉంచుకోవడం వల్ల మెరుగుదలలు గోప్యంగా ఉంటాయని నిర్ధారించుకోవచ్చు.
  3. పెరుగుతున్న మేధో సంపత్తి (Compounding intellectual equity) – ప్రతిసారి ఒక లాయర్ మోడల్ అవుట్‌పుట్‌ను సమీక్షించినప్పుడు, ఆ ఇంటరాక్షన్‌ను శిక్షణ డేటాగా (training data) నమోదు చేయవచ్చు, ఇది క్రమంగా మోడల్‌ను మెరుగుపరుస్తుంది. కాలక్రమేణా, కంపెనీ అద్దె చెల్లించడం కంటే ఆస్తిని కలిగి ఉన్నట్లుగా, విలువైన స్వయం-బలపరిచే ఆస్తిని (self-reinforcing asset) నిర్మించుకుంటుంది.

మొదటి వినియోగ సందర్భాలు మరియు ఓపెన్-సోర్స్ గుర్తింపు

కాంట్రాక్టుల నుండి స్ట్రక్చర్డ్ డేటాను సంగ్రహించే Tabular Analysis ఫీచర్ వంటి అధిక త్రూపుట్ మరియు తక్కువ ఖర్చు అవసరమయ్యే పనుల కోసం Thomson Reuters యొక్క CoCounsel Legal సూట్‌లో ఈ మోడల్ అందుబాటులోకి వస్తోంది. ఇది సైటేషన్-చెకింగ్‌ను కూడా నిర్వహిస్తుంది, ఇది లీగల్ డ్రాఫ్టింగ్‌లో పునరావృతమయ్యే కానీ ఖచ్చితత్వం చాలా ముఖ్యమైన దశ.

డెవలపర్ ఎకోసిస్టమ్‌ను పెంపొందించడానికి, దీని యొక్క చిన్న వెర్షన్ Hugging Faceలో నాన్-కమర్షియల్ లైసెన్స్ కింద అందుబాటులో ఉంటుంది. ఇది కంపెనీ యొక్క రెవెన్యూ-జనరేటింగ్ ఉత్పత్తులకు శక్తినిచ్చే పూర్తి ప్రొప్రైటరీ మోడల్‌ను బహిర్గతం చేయకుండానే పరిశోధకులు మరియు భాగస్వాములు ప్రయోగాలు చేయడానికి అనుమతిస్తుంది.