Kimi K3 പരാജയപ്പെട്ടപ്പോൾ, മൂന്ന് കഠിനമായ പ്രോംപ്റ്റുകളിൽ—ഒരു പ്രോബബിലിറ്റി പ്രശ്നം, ഒരു പുള്ളിയുടെ ഇനർഷ്യ (pulley-inertia) സാഹചര്യം, സങ്കീർണ്ണമായ ഒരു Python ബാക്ക്‌പാക്ക് സ്ക്രിപ്റ്റ്—GPT-5.6-SOL വിജയകരമായി ലക്ഷ്യസ്ഥാനത്ത് എത്തി. മൾട്ടി-സ്റ്റെപ്പ് കണക്ക്, ഫിസിക്സ്, കോഡിംഗ് എന്നിവയിൽ തടസ്സമില്ലാതെ ചിന്തിക്കാൻ (reason through) കഴിയുന്ന ഒരു മോഡൽ ആവശ്യമായി വരുമ്പോൾ, ടോക്കൺ ബജറ്റിംഗും (token budgeting) ലേറ്റൻസിയും (latency) എത്രത്തോളം പ്രധാനമാണെന്ന് ഈ വ്യത്യാസം കാണിച്ചുതരുന്നു.

എന്തുകൊണ്ടാണ് ഈ ബെഞ്ച്മാർക്ക് പ്രധാനമാകുന്നത്

ഡെവലപ്പർമാരും ഗവേഷകരും പലപ്പോഴും ഹെഡ്‌ലൈൻ സ്കോറുകൾ നോക്കിയാണ് ഒരു LLM തിരഞ്ഞെടുക്കുന്നത്, എന്നാൽ യഥാർത്ഥ സാഹചര്യങ്ങളിലെ അതിന്റെ പ്രവർത്തനം പലപ്പോഴും അവർ ശ്രദ്ധിക്കാറില്ല. ഈ താരതമ്യ പരിശോധനയിൽ, ഓരോ മോഡലും ദീർഘമായ യുക്തിചിന്ത (reasoning) ആവശ്യമായ ഒരു പ്രശ്നമാണ് കൈകാര്യം ചെയ്തത്. GPT-5.6-SOL മൂന്ന് മേഖലകളിലും പൂർണ്ണവും ശരിയുമായ ഉത്തരങ്ങൾ നൽകി; എന്നാൽ Kimi K3 ഉപയോഗപ്രദമായ ഒന്നും നൽകുന്നതിന് മുമ്പ് തന്നെ അതിന്റെ ടോക്കൺ ബജറ്റ് തീരുകയോ സമയം അവസാനിക്കുകയോ (timed out) ചെയ്തു.

ടെസ്റ്റ് സെറ്റപ്പ്

  • Math – ഒരു പ്രോബബിലിറ്റി ചോദ്യം; ഇതിൽ പാറ്റേൺ-ഓവർലാപ്പ് പ്രോബബിലിറ്റിയും എക്സ്പെക്റ്റേഷൻ (expectation), വേരിയൻസ് (variance - second moments) എന്നിവയും കണക്കാക്കേണ്ടതായിരുന്നു.
  • Physics – ഒരു പുള്ളിയുടെ (pulley) ഇനർഷ്യയും സ്പ്രിംഗ്-ടെൻഷൻഡ് കേബിൾ അയയുമ്പോൾ ഉണ്ടാകുന്ന ഊർജ്ജ നഷ്ടവും (energy loss) മോഡൽ ചെയ്യുക.
  • Programming – സങ്കീർണ്ണമായ ഡിപെൻഡൻസികളും ടൈ-ബ്രേക്ക് നിയമങ്ങളുമുള്ള ഒരു ബാക്ക്‌പാക്ക് പാക്കിംഗ് പ്രശ്നത്തിന് Python ഉപയോഗിച്ച് ഒരു പരിഹാരം എഴുതുക, തുടർന്ന് ആറ് സ്വതന്ത്ര ടെസ്റ്റ് കേസുകളുമായി അതിന്റെ ഔട്ട്‌പുട്ട് പരിശോധിക്കുക.

കണക്കുകൾ എന്ത് പറയുന്നു

GPT-5.6-SOL

  • Math – എക്സ്പെക്റ്റഡ് വാല്യൂവും വേരിയൻസും വ്യക്തമായി രേഖപ്പെടുത്തിയ പൂർണ്ണവും ശരിയുമായ പരിഹാരം നൽകി.
  • Physics – ഇനർഷ്യ മോഡൽ കൃത്യമായി നിർമ്മിക്കുകയും ഊർജ്ജ നഷ്ടം കണക്കിലെടുക്കുകയും ചെയ്തു, ഇത് അനലിറ്റിക്കൽ ഉത്തരവുമായി പൊരുത്തപ്പെടുന്നു.
  • Programming – കോംപൈൽ ചെയ്യാനും പ്രവർത്തിക്കാനും ആറ് പുറത്തുള്ള പരിശോധനകളും പാസ്സാകാനും കഴിയുന്ന കോഡ് നിർമ്മിച്ചു. എന്നാൽ ഒരു ഇന്റേണൽ ടെസ്റ്റ് അസർഷൻ (internal test assertion) തെറ്റായിരുന്നു, ഇത് മോഡൽ നിർമ്മിക്കുന്ന ടെസ്റ്റുകൾ എപ്പോഴും കൃത്യമാകണമെന്നില്ല എന്ന് നമ്മെ ഓർമ്മിപ്പിക്കുന്നു.

Kimi K3

  • Math – ടോക്കൺ പരിധിയിൽ (ആദ്യം 6,500 ടോക്കണുകളിലും പിന്നീട് 10,000 ടോക്കണുകളിലും) എത്തി ഉത്തരമൊന്നും കാണിക്കാതെ നിന്നുപോയി.
  • Physics – ഔട്ട്‌പുട്ട് കാണുന്നതിന് മുമ്പ് തന്നെ ടോക്കണുകൾ തീർന്നുപോയി.
  • Programming – 245 സെക്കൻഡിന് ശേഷം ടൈം ഔട്ട് (timed out) ആയി, പരിശോധിക്കാൻ ഒന്നും നൽകിയില്ല.

റീസണിംഗ് എഫിഷ്യൻസിയും പവർഫുൾ മോഡലുകളും

പ്രൊഡക്ഷൻ പൈപ്പ്‌ലൈനുകൾ നിർമ്മിക്കുന്നവർക്ക് ഇതിന്റെ അർത്ഥം വ്യക്തമാണ്: ഔട്ട്‌പുട്ട് നൽകാതെ ടോക്കണുകൾ മാത്രം ഉപയോഗിക്കുന്ന ഒരു മോഡൽ, തുടർന്നുള്ള പ്രക്രിയകളെ തടസ്സപ്പെടുത്തുകയും ചിലവ് വർദ്ധിപ്പിക്കുകയും ഉപയോക്താക്കളെ നിരാശപ്പെടുത്തുകയും ചെയ്തേക്കാം.

വിശ്വാസ്യതയും "പെർഫെക്റ്റ്" കോഡിന്റെ മറഞ്ഞിരിക്കുന്ന ചിലവും

വിജയിച്ച മോഡൽ പോലും പിഴവ് വരുത്തി: GPT-5.6-SOL സ്വയം നിർമ്മിച്ച ടെസ്റ്റ് കേസിൽ ഒരു തെറ്റായ അസർഷൻ ഉണ്ടായിരുന്നു. മോഡൽ നിർമ്മിക്കുന്ന വാലിഡേഷൻ (validation) മനുഷ്യന്റെ പരിശോധനയ്ക്ക് പകരമാവില്ലെന്ന് ഇത് കാണിക്കുന്നു. ഒരു മോഡൽ കോഡ് എഴുതുമ്പോൾ, നിങ്ങൾ ഇപ്പോഴും സ്വതന്ത്രമായ പരിശോധനകൾ നടത്തേണ്ടതുണ്ട്.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

  • Finish reason tracking – ഒരു മറുപടി ടോക്കൺ പരിധി കാരണമാണോ, ടൈം ഔട്ട് കാരണമാണോ, അതോ സ്വാഭാവികമായി അവസാനിച്ചതാണോ എന്ന് രേഖപ്പെടുത്തുക.
  • Reasoning token count – ഓരോ മോഡലും ആന്തരികമായ ചിന്തകൾക്കായി (internal deliberation) എത്ര ടോക്കണുകൾ ഉപയോഗിക്കുന്നുവെന്നും ഫൈനൽ ഔട്ട്‌പുട്ടിനായി എത്ര ഉപയോഗിക്കുന്നുവെന്നും താരതമ്യം ചെയ്യുക.
  • Latency monitoring – ഓരോ ഘട്ടത്തിനും എടുക്കുന്ന സമയം അളക്കുക; ഓരോ ക്വറിക്കും മിനിറ്റുകൾ എടുക്കുന്ന ഒരു മോഡൽ ഇന്ററാക്ടീവ് ആപ്പുകൾക്ക് അനുയോജ്യമായേക്കില്ല.

ഡെവലപ്പർമാർ ഈ മെട്രിക്സിനെ (metrics) വെറും അവസാന ഉത്തരമായി കാണാതെ പ്രധാന സൂചനകളായി പരിഗണിക്കണം.

ചുരുക്കത്തിൽ

പൂർണ്ണതയുടെ കാര്യത്തിൽ GPT-5.6-SOL, Kimi K3-യെക്കാൾ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്നു. "ശരിയായി ചെയ്യുന്നു" എന്ന് തോന്നുന്ന ഒരു മോഡൽ പോലും തെറ്റായ ഇന്റേണൽ ചെക്കുകൾ നൽകിയേക്കാം എന്ന കാര്യം ഈ ടെസ്റ്റ് നമ്മെ ഓർമ്മിപ്പിക്കുന്നു, അതിനാൽ മനുഷ്യന്റെ മേൽനോട്ടം അനിവാര്യമാണ്. ഫിനിഷ് റീസൺസ് (finish reasons), ടോക്കൺ ഉപയോഗം, ലേറ്റൻസി എന്നിവ ട്രാക്ക് ചെയ്യുന്നത് ഒരു സൈലന്റ് ടൈം ഔട്ടിൽ കുടുങ്ങാതെ ശരിയായ ടൂൾ തിരഞ്ഞെടുക്കാൻ നിങ്ങളെ സഹായിക്കും.