OpenAI தனது GPT-5.6 Sol மாடல் ARC-AGI-3 தர்க்கரீதியான சிந்தனை (logical-reasoning) அளவுகோலில் 38.3% வெற்றி விகிதத்தை எட்டியுள்ளதாகக் கூறியுள்ளது, இது Anthropic-ன் Claude Opus 5 (30.2%) ஐ விட outperforms செய்கிறது. இந்த முன்னிலை, OpenAI-ன் பிரத்யேக Responses API மூலம் மாடல் இயங்கும்போது மட்டுமே காணப்படுகிறது; இந்த API, அதிகாரப்பூர்வ சோதனை கட்டமைப்பில் (test harness) அனுமதிக்கப்படாத இரண்டு inference-time நுட்பங்களைச் சேர்க்கிறது.
முன்னுரை: ஒரு அளவுகோல் ஆயுதப் போட்டி (benchmark arms race)
ARC-AGI-3 என்பது மனப்பாடம் செய்யப்பட்ட உண்மைகளைச் சார்ந்திருக்காமல், புதிய, பல படிநிலைகளைக் கொண்ட சிக்கல்களைத் தீர்க்கும் ஒரு மாடலின் திறனைச் சோதிக்கிறது. இந்த ஆண்டின் தொடக்கத்தில், Anthropic இந்த அளவுகோலில் நான்கு மடங்கு முன்னேற்றத்தை அறிவித்தது, இது Opus 5 ஐ பொதுப் பட்டியலில் (public leaderboard) முதலிடத்திற்கு கொண்டு வந்தது. அதிகாரப்பூர்வ கட்டமைப்பு ஒவ்வொரு படிநிலைக்குப் பிறகும் இடைநிலைத் தர்க்கங்களை (intermediate reasoning) நீக்கிவிடுவதால், மாடல் ஒவ்வொரு முறையும் புதிதாகத் தொடங்க வேண்டிய கட்டாயத்திற்குத் தள்ளப்படுகிறது. எனவே, அந்த முடிவு "மூல" (raw) மாடல் திறனுக்கான ஒரு புதிய அளவுகோலை அமைத்தது.
OpenAI-ன் இந்தத் दावा அதே போட்டிச் சூழலில் வருகிறது. அதிக மதிப்பெண்ணைப் வெளியிடுவதன் மூலம், அதன் சமீபத்திய தலைமுறை மாடல் தனது முக்கியப் போட்டியாளரின் தர்க்கரீதியான செயல்திறனுக்கு இணையாக இருப்பது மட்டுமல்லாமல், அதைவிடவும் exceeds செய்ய முடியும் என்பதை நிறுவனம் உணர்த்துகிறது. இருப்பினும், இந்தச் செய்தித் தலைப்பு, சமூகத்தினர் அளவுகோல் அட்டவணைகளைப் பார்க்கும் விதத்தை மாற்றி அமைத்துக் கொண்டிருக்கும் ஒரு தொழில்நுட்ப நுணுக்கத்தை மறைக்கிறது.
எண்கள் உண்மையில் எதைக் குறிக்கின்றன
Opus 5-க்கு 30.2% முடிவைத் தந்த அதே அதிகாரப்பூர்வ ARC-AGI-3 கட்டமைப்பின் கீழ் GPT-5.6 Sol மதிப்பீடு செய்யப்படும்போது, அதன் வெற்றி விகிதம் 7.8% ஆகக் குறைகிறது. இந்த மாற்றம் ஒரு பிழை (glitch) அல்ல; இது OpenAI தனது மாடலுடன் இணைத்துள்ள இரண்டு பொறியியல் அம்சங்களின் (engineered features) விளைவாகும்:
- Retained Reasoning – ஒவ்வொரு துணைப் பணிக்குப் பிறகும் chain-of-thought-ஐ அழிப்பதற்குப் பதிலாக, இந்த அமைப்பு இடைநிலை உரையை (intermediate text) அப்படியே வைத்திருக்கிறது, இது மாடல் முந்தைய முடிவுகளை மீண்டும் பார்க்கவும், ஒரு திரட்டப்பட்ட வாதத்தை (cumulative argument) உருவாக்கவும் அனுமதிக்கிறது.
- Compaction – token வரம்பிற்குள் இருக்க பழைய சூழலை (context) நீக்குவதற்குப் பதிலாக, இந்த wrapper முந்தைய படிநிலைகளை ஒரு சிறிய சுருக்கமாகச் சுருக்குகிறது, இதன் மூலம் prompt அளவைச் சமாளிக்கக்கூடியதாக வைத்திருக்கும் அதே வேளையில் தர்க்கரீதியான தொடர்பையும் (logical thread) பாதுகாக்கிறது.
இந்த இரண்டு வழிமுறைகளும் பிரத்யேக Responses API-இல் உள்ளன. மாடலுக்கு அதிகப்படியான, தொடர்ச்சியான சூழலை (continuous context) வழங்குவதன் மூலம், OpenAI மாடலின் "நினைவகத்தை" (memory) திறம்பட மேம்படுத்துகிறது மற்றும் அதன் சொந்தத் தர்க்கத்தை மீண்டும் பயன்படுத்த அனுமதிக்கிறது. இதற்கு நேர்மாறாக, அதிகாரப்பூர்வ கட்டமைப்பு, அந்த நன்மைகளை நீக்கும் ஒரு கடுமையான "stateless" முறையை நடைமுறைப்படுத்துகிறது.
இந்த முறையியல் ஏன் முக்கியமானது
இந்த நிகழ்வு AI மதிப்பீட்டில் வளர்ந்து வரும் ஒரு பிரிவினையைச் சுட்டிக்காட்டுகிறது: மூல மாடல் மதிப்பெண்கள் (raw model scores) மற்றும் அமைப்பு நிலை செயல்திறன் (system-level performance). டெவலப்பர்கள் உண்மையில் பயன்படுத்தும் முழுத் தொகுப்பையும் (whole stack) – அதாவது மாடல், inference pipeline மற்றும் memory management – ஒரு அளவுகோல் பிரதிபலிக்க வேண்டும் என்று OpenAI வாதிடுகிறது. அந்தப் பார்வையில், 38.3% மதிப்பெண் என்பது, தனித்து மதிப்பீடு செய்யப்பட்ட ஒரு மாடலை விட, ஒருங்கிணைக்கப்பட்ட இந்தத் தொகுப்பு அதிக நிஜ உலகப் பணிகளைத் தீர்க்கும் என்று ஒரு தயாரிப்புக் குழுவிற்குத் தெரிவிக்கிறது.
இது அறிவியல் முன்னேற்றத்தைக் குழப்பமடையச் செய்கிறது என்று விமர்சகர்கள் கூறுகின்றனர். ஒவ்வொரு ஆய்வகமும் தங்களுக்குத் தேவையான பிரத்யேக wrappers-களைச் சேர்த்தால், அந்தப் பட்டியல் மாடல் நுண்ணறிவின் தெளிவான ஒப்பீடாக இல்லாமல், பொறியியல் தந்திரங்களின் தொகுப்பாக மாறிவிடும். அதிகாரப்பூர்வ ARC-AGI-3 கட்டமைப்பு என்பது அனைவருக்கும் சமமான வாய்ப்பை (level the playing field) வழங்குவதற்காகவே உள்ளது; இது அதிக மதிப்பெண் என்பது ஒரு புத்திசாலித்தனமான wrapper-ஐக் குறிக்காமல், உண்மையாகவே வலிமையான ஒரு அடிப்படை மாடலைக் குறிப்பதை உறுதி செய்கிறது.
டெவலப்பர்கள் மற்றும் முதலீட்டாளர்களுக்கான முக்கியத்துவம்
AI சார்ந்த தயாரிப்புகளை உருவாக்கும் ஸ்டார்ட்அப்களுக்கு, இந்த வேறுபாடு நடைமுறை ரீதியானது. தர்க்கத்தை தக்கவைத்துக் கொள்ளவும் (retain reasoning) மற்றும் சூழலைச் சுருக்கவும் (compact context) கூடிய ஒரு மாடலுக்கு, தீர்வை அடையக் குறைவான prompt engineering, குறைந்த inference latency மற்றும் குறைவான API அழைப்புகள் தேவைப்படலாம். இது குறைந்த கணினிச் செலவு (compute bills) மற்றும் மென்மையான பயனர் அனுபவத்திற்கு வழிவகுக்கிறது. மாடல் மற்றும் மேம்படுத்தப்பட்ட inference layer ஆகியவற்றை உள்ளடக்கிய ஒரு முழுமையான அமைப்பை (turnkey system) வழங்கும் நிறுவனங்கள், வேகம் மற்றும் செலவு முக்கியத்துவம் வாய்ந்த இடங்களில் போட்டித் திறனைப் பெறுகின்றன.
முதலீட்டாளர்கள் எதிர்கால வருவாய்க்கான குறிகாட்டிகளாக அளவுகோல் முன்னேற்றங்களைக் கவனிக்கிறார்கள். அடிப்படை மாடலின் மூலத் திறன் போட்டியாளர்களுக்கு இணையாக இருந்தாலும், செய்திகளில் இடம்பெறும் ஒரு முன்னிலை ஒரு நிறுவனத்தின் மதிப்பீட்டை (valuation) உயர்த்தக்கூடும். எனவே, எண்கள் எதைக் குறிக்கின்றன என்பது குறித்த விவாதம், AI துறையில் மூலதனம் எவ்வாறு பாய்கிறது என்பதைப் பாதிக்கிறது.
அடுத்து கவனிக்க வேண்டியவை
- Standard-setter பதில்கள் – அளவுகோல் அமைப்பாளர்கள் "வெளிப்புற" inference தந்திரங்கள் குறித்த விதிகளைக் கடுமையாக்கலாம் அல்லது அவற்றை வெளிப்படையாக அனுமதிக்கும் ஒரு தனி "system" பிரிவைச் சேர்க்கலாம். அவர்களின் பதில் அடுத்த கட்ட பொதுப் பட்டியல்களை வடிவமைக்கும்.
- Open-source wrappers – சமூகம் (community) retained reasoning மற்றும் compaction ஆகியவற்றிற்கான சொந்தச் செயலாக்கங்களை வெளியிட்டால், இந்தச் சாதகம் ஒரு பிரத்யேகத் திறனாக இல்லாமல் ஒரு அடிப்படை அம்சமாக மாறிவிடும்.
- நிஜ உலக சோதனைத் தளங்கள் (Real-world testbeds) – நிறுவனங்கள் பெருகிய முறையில் தங்களின் சொந்தப் பிரச்சனைத் தொகுப்புகளில் (உதாரணமாக, உள்முறை code-generation தொகுப்புகள்) செயல்திறனைப் பதிவிடுகின்றன. அந்த முடிவுகள், ஒப்பிடுவதற்குச் சவாலாக இருந்தாலும், ஒரு பொதுவான அளவுகோலை விட அதிக முக்கியத்துவம் பெறத் தொடங்கும்.
எதிர் வாதம்: இது அளவுகோலை "gaming" செய்வதா?
சில ஆராய்ச்சியாளர்கள் தனிப்பயனாக்கப்பட்ட API-களைப் பயன்படுத்துவதை “benchmark gaming” என்று அழைக்கிறார்கள்; இது மாதிரியின் (model) அடிப்படைப் புரிதலை மேம்படுத்தாமல் மதிப்பெண்களை மட்டும் உயர்த்துகிறது என்று அவர்கள் வாதிடுகின்றனர். கடுமையான கட்டுப்பாடுகளின் கீழ் ஒரு மாதிரி ஒற்றை இலக்கச் செயல்திறனாக (single-digit performance) வீழ்ச்சியடைவது, AGI இலக்கத்திலிருந்து இன்னும் வெகு தொலைவில் உள்ளது என்பதை அவர்கள் சுட்டிக்காட்டுகின்றனர். பகுத்தறியும் திறனில் (reasoning ability) ஏற்படும் உண்மையான முன்னேற்றங்களை விட, பொறியியல் குறுக்குவழிகளுக்கு (engineering shortcuts) இந்தத் துறை வெகுமதி அளிக்கத் தொடங்கக்கூடும் என்பதே கவலையாக உள்ளது.
மாதிரிக்கும் (model) அமைப்புக்கும் (system) இடையிலான வேறுபாடு பெருகிய முறையில் செயற்கையானது என்று OpenAI தரப்பு வலியுறுத்துகிறது. நவீன AI பயன்பாடுகள் ஒரு மாதிரியைத் தனித்து இயக்குவது அரிது; அவை எப்போதும் caching, context stitching மற்றும் output post-processing ஆகியவற்றை கையாளும் ஒரு serving layer-க்கு பின்னால் அமைகின்றன. அந்தப் பார்வையில், முழுமையான pipeline-ஐ அளவிடுவது பயனர்கள் உண்மையில் அனுபவிப்பதைப் பற்றிய மிகவும் நேர்மையான மதிப்பீடாகும்.
முக்கியக் கருத்து
இன்றைய benchmark வெற்றிகள் மாதிரியின் அளவைப் போலவே inference engineering-ஐயும் சார்ந்துள்ளன என்பதை GPT-5.6 Sol கதை காட்டுகிறது. சமூகம் அமைப்பு-நிலை மதிப்பெண்களை (system-level scores) ஏற்றுக்கொள்கிறதா அல்லது தனிப்பயனாக்கப்பட்ட wrappers-களைக் கட்டுப்படுத்துகிறதா என்பது அடுத்த “leaderboard” செய்தியை நாம் எவ்வாறு வாசிக்கிறோம் என்பதைத் தீர்மானிக்கும். AI தயாரிப்புகளை உருவாக்கும் அல்லது நிதி வழங்கும் எவருக்கும் பாடம் தெளிவானது: வெறும் எண்கள் முக்கியம் தான், ஆனால் அதைச் சுற்றியுள்ள மென்பொருள் (software) நிஜ உலகச் செயல்திறனில் தீர்மானிக்கும் காரணியாக இருக்கலாம்.
