OpenAI-യുടെ GPT-5.6 Sol മോഡൽ ARC-AGI-3 ലോജിക്കൽ-റീസണിംഗ് ബെഞ്ച്മാർക്കിൽ 38.3% വിജയശതമാനം കൈവരിച്ചതായി അറിയിച്ചു, ഇത് Anthropic-ന്റെ Claude Opus 5 (30.2%) നേട്ടത്തേക്കാൾ കൂടുതലാണ്. ഔദ്യോഗിക ടെസ്റ്റ് ഹാർനെസ്സ് അനുവദിക്കാത്ത രണ്ട് ഇൻഫറൻസ്-ടൈം ട്രിക്കുകൾ (inference-time tricks) ചേർക്കുന്ന OpenAI-യുടെ കസ്റ്റം Responses API ഉപയോഗിച്ച് പ്രവർത്തിപ്പിക്കുമ്പോൾ മാത്രമാണ് ഈ മുന്നേറ്റം കാണുന്നത്.

മുന്നോടിയായി: ഒരു ബെഞ്ച്മാർക്ക് ആംസ് റേസ് (arms race)

മനഃപാഠമാക്കിയ വസ്തുതകളെ ആശ്രയിക്കാതെ, പുതിയതും ബഹുഘട്ടങ്ങളുള്ളതുമായ പ്രശ്നങ്ങൾ പരിഹരിക്കാനുള്ള ഒരു മോഡലിന്റെ കഴിവിനെയാണ് ARC-AGI-3 പരിശോധിക്കുന്നത്. ഈ വർഷം ആദ്യം Anthropic ഈ ബെഞ്ച്മാർക്കിൽ നാല് മടങ്ങ് മുന്നേറ്റം പ്രഖ്യാപിക്കുകയും Opus 5-നെ പബ്ലിക് ലീഡർബോർഡിന്റെ শীর্ষে എത്തിക്കുകയും ചെയ്തു. ഔദ്യോഗിക ഹാർനെസ്സ് ഓരോ ഘട്ടത്തിന് ശേഷവും ഇടക്കാല യുക്തികൾ (intermediate reasoning) ഒഴിവാക്കുന്നതിനാൽ, ഓരോ തവണയും മോഡൽ പുതുതായി തുടങ്ങേണ്ടി വരുന്നു. അതിനാൽ ആ ഫലം "റോ" (raw) മോഡൽ കഴിവിന്റെ ഒരു പുതിയ റഫറൻസ് പോയിന്റായി മാറി.

ഇതേ മത്സരസാഹചര്യത്തിലാണ് OpenAI-യുടെ ഈ അവകാശവാദം വരുന്നത്. ഉയർന്ന സ്കോർ പ്രസിദ്ധീകരിക്കുന്നതിലൂടെ, തങ്ങളുടെ ഏറ്റവും പുതിയ തലമുറയ്ക്ക് പ്രധാന എതിരാളിയുടെ ലോജിക്കൽ പ്രകടനത്തോട് പൊരുത്തപ്പെടുക മാത്രമല്ല, അതിനെ മറികടക്കാനും കഴിയുമെന്ന് കമ്പനി സൂചിപ്പിക്കുന്നു. എന്നിരുന്നാലും, ഈ വാർത്തയ്ക്ക് പിന്നിൽ ബെഞ്ച്മാർക്ക് പട്ടികകൾ വായിക്കുന്ന രീതിയെ മാറ്റിമറിക്കുന്ന ഒരു സാങ്കേതിക സൂക്ഷ്മതയുണ്ട്.

ഈ അക്കങ്ങൾ യഥാർത്ഥത്തിൽ എന്താണ് അർത്ഥമാക്കുന്നത്?

Opus 5-ന് 30.2% ഫലം നൽകിയ അതേ ഔദ്യോഗിക ARC-AGI-3 ഹാർനെസ്സ് ഉപയോഗിച്ച് GPT-5.6 Sol വിലയിരുത്തുമ്പോൾ, മോഡലിന്റെ വിജയശതമാനം 7.8% ആയി താഴുന്നു. ഈ വ്യത്യാസം ഒരു പിഴവല്ല; മറിച്ച് OpenAI മോഡലിനൊപ്പം നൽകുന്ന രണ്ട് എഞ്ചിനീയർ ചെയ്ത ഫീച്ചറുകളുടെ ഫലമാണ്:

  • Retained Reasoning – ഓരോ സബ്-ടാസ്കിന് ശേഷവും chain-of-thought ഒഴിവാക്കുന്നതിന് പകരം, സിസ്റ്റം ഇടക്കാല ടെക്സ്റ്റ് നിലനിർത്തുന്നു. ഇത് മോഡലിന് മുൻപത്തെ നിഗമനങ്ങളെ വീണ്ടും പരിശോധിക്കാനും ഒരു ക്യുമുലേറ്റീവ് വാദം (cumulative argument) കെട്ടിപ്പടുക്കാനും അനുവദിക്കുന്നു.
  • Compaction – ടോക്കൺ പരിധിക്കുള്ളിൽ നിൽക്കാൻ പഴയ കോൺടെക്സ്റ്റ് മുറിച്ചുമാറ്റുന്നതിന് പകരം, ഈ റാപ്പർ മുൻപത്തെ ഘട്ടങ്ങളെ ഒരു ചെറിയ സംഗ്രഹമാക്കി മാറ്റുന്നു. ഇത് പ്രോംപ്റ്റ് സൈസ് നിയന്ത്രിക്കുമ്പോൾ തന്നെ ലോജിക്കൽ സ്ട്രെഡ് നിലനിർത്തുന്നു.

ഈ രണ്ട് സംവിധാനങ്ങളും പ്രൊപ്രൈറ്ററി Responses API-യിലാണ് പ്രവർത്തിക്കുന്നത്. മോഡലിന് കൂടുതൽ സമ്പന്നവും തുടർച്ചയായതുമായ കോൺടെക്സ്റ്റ് നൽകുന്നതിലൂടെ, OpenAI ഫലപ്രദമായി മോഡലിന്റെ "മെമ്മറി" വർദ്ധിപ്പിക്കുകയും അതിന് സ്വന്തം യുക്തി വീണ്ടും ഉപയോഗിക്കാൻ അനുവദിക്കുകയും ചെയ്യുന്നു. നേരെമറിച്ച്, ഔദ്യോഗിക ഹാർനെസ്സ് ഈ ഗുണങ്ങൾ ഇല്ലാതാക്കുന്ന കർശനമായ "stateless" മോഡ് നടപ്പിലാക്കുന്നു.

എന്തുകൊണ്ടാണ് ഈ രീതിശാസ്ത്രം (methodology) പ്രധാനമാകുന്നത്?

AI മൂല്യനിർണ്ണയത്തിൽ വളർന്നുവരുന്ന ഒരു വിഭജനത്തെ ഈ സംഭവം എടുത്തുകാണിക്കുന്നു: റോ മോഡൽ സ്കോറുകളും സിസ്റ്റം-ലെവൽ പ്രകടനവും തമ്മിലുള്ള വ്യത്യാസം. ഡെവലപ്പർമാർ യഥാർത്ഥത്തിൽ ഉപയോഗിക്കുന്ന മുഴുവൻ സ്റ്റാക്കും (മോഡൽ, ഇൻഫറൻസ് പൈപ്പ്‌ലൈൻ, മെമ്മറി മാനേജ്‌മെന്റ് എന്നിവ) ഒരു ബെഞ്ച്മാർക്ക് പ്രതിഫലിപ്പിക്കണമെന്ന് OpenAI വാദിക്കുന്നു. ആ കാഴ്ചപ്പാടിൽ, 38.3% സ്കോർ എന്നത് ഒരു പ്രോഡക്റ്റ് ടീമിന് നൽകുന്ന സന്ദേശം, ഒറ്റപ്പെട്ട രീതിയിൽ വിലയിരുത്തുന്ന ഒരു മോഡലിനേക്കാൾ കൂടുതൽ യഥാർത്ഥ ലോകത്തിലെ ജോലികൾ ചെയ്യാൻ ഈ സംയോജിത സംവിധാനത്തിന് കഴിയുമെന്നാണ്.

ഇത് ശാസ്ത്രീയ പുരോഗതിയെ തടസ്സപ്പെടുത്തുന്നു എന്നാണ് വിമർശകർ പറയുന്നത്. ഓരോ ലാബും സ്വന്തം രീതിയിലുള്ള റാപ്പറുകൾ (wrappers) ചേർക്കുകയാണെങ്കിൽ, ലീഡർബോർഡ് എന്നത് മോഡലിന്റെ ബുദ്ധിശക്തിയുടെ വ്യക്തമായ താരതമ്യത്തിന് പകരം എഞ്ചിനീയറിംഗ് ട്രിക്കുകളുടെ ഒരു കൂട്ടമായി മാറും. എല്ലാവർക്കും തുല്യമായ അവസരം ഉറപ്പാക്കാനാണ് ഔദ്യോഗിക ARC-AGI-3 ഹാർനെസ്സ് നിലവിലുള്ളത്; ഉയർന്ന സ്കോർ എന്നത് ഒരു സ്മാർട്ട് റാപ്പറിനെ അല്ല, മറിച്ച് യഥാർത്ഥത്തിൽ ശക്തമായ ഒരു മോഡലിനെയാണ് സൂചിപ്പിക്കേണ്ടത്.

ഡെവലപ്പർമാർക്കും നിക്ഷേപകർക്കും ഉള്ള പ്രത്യാഘാതങ്ങൾ

AI അധിഷ്ഠിത ഉൽപ്പന്നങ്ങൾ നിർമ്മിക്കുന്ന സ്റ്റാർട്ടപ്പുകളെ സംബന്ധിച്ചിടത്തോളം ഈ വ്യത്യാസം പ്രായോഗികമാണ്. യുക്തി നിലനിർത്താനും കോൺടെക്സ്റ്റ് സംഗ്രഹിക്കാനും കഴിയുന്ന ഒരു മോഡലിന് കുറഞ്ഞ പ്രോംപ്റ്റ് എഞ്ചിനീയറിംഗും, കുറഞ്ഞ ഇൻഫറൻസ് ലേറ്റൻസിയും (inference latency), പരിഹാരത്തിലെത്താൻ കുറഞ്ഞ API കോളുകളും മതിയാകും. ഇത് കുറഞ്ഞ കമ്പ്യൂട്ട് ബില്ലുകൾക്കും മികച്ച ഉപഭോക്തൃ അനുഭവങ്ങൾക്കും കാരണമാകുന്നു. മോഡലും ഒപ്റ്റിമൈസ് ചെയ്ത ഇൻഫറൻസ് ലെയറും ചേർന്ന ഒരു ടേൺകീ സിസ്റ്റം (turnkey system) വിപണിയിലെത്തിക്കുന്ന കമ്പനികൾക്ക് വേഗതയും ചിലവും പ്രധാനമാകുന്ന ഇടങ്ങളിൽ മത്സരനേട്ടം ലഭിക്കുന്നു.

ഭാവിയിലെ വരുമാനത്തിന്റെ സൂചകമായി നിക്ഷേപകർ ബെഞ്ച്മാർക്ക് മുന്നേറ്റങ്ങളെ കാണുന്നു. അടിസ്ഥാന മോഡലിന്റെ റോ കപ്പാസിറ്റി എതിരാളികൾക്ക് തുല്യമാണെങ്കിൽ പോലും, വാർത്തകളിൽ ഇടംപിടിക്കുന്ന മുന്നേറ്റം ഒരു കമ്പനിയുടെ വാല്യൂവേഷൻ വർദ്ധിപ്പിക്കും. അതിനാൽ, ഈ അക്കങ്ങൾ എന്തിനെയാണ് പ്രതിനിധീകരിക്കുന്നത് എന്നതിനെക്കുറിച്ചുള്ള തർക്കം AI മേഖലയിലെ മൂലധന പ്രവാഹത്തെ സ്വാധീനിക്കുന്നു.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

  • മാനദണ്ഡങ്ങൾ നിശ്ചയിക്കുന്നവരുടെ പ്രതികരണങ്ങൾ – ബെഞ്ച്മാർക്ക് സംഘാടകർ "എക്സ്റ്റേണൽ" ഇൻഫറൻസ് ട്രിക്കുകൾ സംബന്ധിച്ച നിയമങ്ങൾ കർശനമാക്കിയേക്കാം അല്ലെങ്കിൽ അവയെ വ്യക്തമായി അനുവദിക്കുന്ന ഒരു പ്രത്യേക "സിസ്റ്റം" ട്രാക്ക് ഉൾപ്പെടുത്തിയേക്കാം. അവരുടെ പ്രതികരണം അടുത്ത പബ്ലിക് ലീഡർബോർഡുകളെ രൂപപ്പെടുത്തും.
  • ഓപ്പൺ സോഴ്സ് റാപ്പറുകൾ – കമ്മ്യൂണിറ്റി retained reasoning, compaction എന്നിവയുടെ സ്വന്തം പതിപ്പുകൾ പുറത്തിറക്കുകയാണെങ്കിൽ, ഈ നേട്ടം ഒരു പ്രൊപ്രൈറ്ററി ആനുകൂല്യത്തിന് പകരം ഒരു അടിസ്ഥാന ഫീച്ചറായി മാറിയേക്കാം.
  • യഥാർത്ഥ ലോക പരീക്ഷണങ്ങൾ – കമ്പനികൾ തങ്ങളുടെ സ്വന്തം പ്രോബ്ലം സെറ്റുകളിൽ (ഉദാഹരണത്തിന്, ഇന്റേണൽ കോഡ്-ജനറേഷൻ സ്യൂട്ടുകൾ) പ്രകടനം വർദ്ധിച്ചുവരുന്നു. ഇത്തരം ഫലങ്ങൾ താരതമ്യം ചെയ്യാൻ പ്രയാസമാണെങ്കിലും, ഒരു പബ്ലിക് ബെഞ്ച്മാർക്കിനേക്കാൾ കൂടുതൽ പ്രാധാന്യം ലഭിക്കാൻ തുടങ്ങും.

എതിർവാദം: ഇത് ബെഞ്ച്മാർക്കിനെ "ഗെയിമിംഗ്" (gaming) ചെയ്യുകയാണോ?

ചില ഗവേഷകർ കസ്റ്റം API-കളുടെ ഉപയോഗത്തെ “benchmark gaming” എന്ന് വിശേഷിപ്പിക്കുന്നു; ഇത് മോഡലിന്റെ അടിസ്ഥാനപരമായ അറിവ് വർദ്ധിപ്പിക്കാതെ സ്കോറുകൾ അനാവശ്യമായി ഉയർത്തുന്നു എന്നാണ് അവരുടെ വാദം. കർശനമായ നിയന്ത്രണങ്ങൾക്കിടയിൽ ഒരു മോഡലിന്റെ പ്രകടനം ഒറ്റയക്കത്തിലേക്ക് (single-digit) താഴുന്നത് AGI ലക്ഷ്യത്തിൽ നിന്ന് ഇനിയും ഏറെ അകലെയാണെന്ന് അവർ ചൂണ്ടിക്കാട്ടുന്നു. യുക്തിസഹമായ ചിന്താശേഷിയിലുള്ള (reasoning ability) യഥാർത്ഥ മുന്നേറ്റത്തേക്കാൾ ഉപരിയായി, എഞ്ചിനീയറിംഗ് ഷോർട്ട്കട്ടുകൾക്ക് ഈ മേഖല പ്രതിഫലം നൽകാൻ തുടങ്ങുമോ എന്നതാണ് ആശങ്ക.

മോഡലും സിസ്റ്റവും തമ്മിലുള്ള വ്യത്യാസം കൂടുതൽ കൃത്രിമമായി മാറിക്കൊണ്ടിരിക്കുകയാണെന്ന് OpenAI ഊന്നിപ്പറയുന്നു. ആധുനിക AI ആപ്ലിക്കേഷനുകൾ ഒരു മോഡലിനെ ഒറ്റപ്പെട്ട രീതിയിൽ പ്രവർത്തിപ്പിക്കാറില്ല; അവ എപ്പോഴും കാഷിംഗ് (caching), കോണ്ടക്സ്റ്റ് സ്റ്റിച്ചിംഗ് (context stitching), ഔട്ട്‌പുട്ട് പോസ്റ്റ്-പ്രോസസ്സിംഗ് (output post-processing) എന്നിവ കൈകാര്യം ചെയ്യുന്ന ഒരു സർവിംഗ് ലെയറിന് പിന്നിലായിരിക്കും പ്രവർത്തിക്കുന്നത്. ആ കാഴ്ചപ്പാടിൽ നോക്കിയാൽ, ഉപയോക്താക്കൾ യഥാർത്ഥത്തിൽ അനുഭവിക്കുന്ന കാര്യങ്ങളെക്കുറിച്ച് കൂടുതൽ സത്യസന്ധമായ ചിത്രം നൽകുന്നത് മുഴുവൻ പൈപ്പ്‌ലൈനും (pipeline) അളക്കുന്നതിലൂടെയാണ്.

പ്രധാന പാഠം

ഇന്നത്തെ ബെഞ്ച്മാർക്ക് വിജയങ്ങൾ മോഡലിന്റെ വലുപ്പത്തോളം തന്നെ ഇൻഫറൻസ് എഞ്ചിനീയറിംഗിനെയും (inference engineering) ആശ്രയിച്ചിരിക്കുന്നു എന്ന് GPT-5.6 Sol കഥ കാണിച്ചുതരുന്നു. കമ്മ്യൂണിറ്റി സിസ്റ്റം-ലെവൽ സ്കോറുകളെ സ്വീകരിക്കുമോ അതോ കസ്റ്റം റാപ്പറുകളെ (custom wrappers) നിയന്ത്രിക്കുമോ എന്നതാണ് അടുത്ത “leaderboard” വാർത്തകൾ എങ്ങനെയായിരിക്കുമെന്ന് തീരുമാനിക്കുന്നത്. AI ഉൽപ്പന്നങ്ങൾ നിർമ്മിക്കുന്നവർക്കും അവയ്ക്ക് സാമ്പത്തിക സഹായം നൽകുന്നവർക്കും ഇതിലെ പാഠം വ്യക്തമാണ്: വെറും അക്കങ്ങൾ മാത്രം പോരാ, യഥാർത്ഥ ലോകത്തെ പ്രകടനത്തിൽ ചുറ്റുമുള്ള സോഫ്റ്റ്‌വെയർ നിർണ്ണായക ഘടകമായി മാറിയേക്കാം.