Kimi K3 ત્રણ ભારે પ્રોમ્પ્ટ્સ—એક સંભાવના (probability) સમસ્યા, એક પુલી-ઇનર્શિયા (pulley-inertia) સિનારિયો અને એક જટિલ Python બેકપેક સ્ક્રિપ્ટ—માં નિષ્ફળ રહ્યું જ્યારે GPT-5.6-SOL એ સફળતાપૂર્વક લક્ષ્ય હાંસલ કર્યું. આ તફાવત દર્શાવે છે કે જ્યારે તમારે એવા મોડેલની જરૂર હોય જે અટક્યા વગર બહુ-પગલાંવાળા ગણિત, ભૌતિક વિજ્ઞાન અને કોડિંગમાં તર્ક કરી શકે, ત્યારે ટોકન બજેટિંગ અને લેટન્સી (latency) શા માટે મહત્વપૂર્ણ છે.

બેન્ચમાર્ક શા માટે મહત્વપૂર્ણ છે

ડેવલપર્સ અને સંશોધકો ઘણીવાર LLM ની પસંદગી હેડલાઇન સ્કોર્સના આધારે કરે છે, નહીં કે વાસ્તવિક દુનિયાના દબાણ હેઠળ તે કેવી રીતે વર્તે છે તેના આધારે. આ સાઈડ-બાય-સાઈડ ટેસ્ટમાં, દરેક મોડેલે એવી સમસ્યાનો સામનો કર્યો જે લાંબા તર્કની સાંકળ (chain of reasoning) માટે મજબૂર કરે છે. GPT-5.6-SOL એ ત્રણેય ક્ષેત્રોમાં સંપૂર્ણ અને સાચા જવાબો આપ્યા; જ્યારે Kimi K3 તેના ટોકન બજેટને ખતમ કરી દીધું અથવા ઉપયોગી કંઈપણ આપતા પહેલા ટાઈમ આઉટ થઈ ગયું.

ટેસ્ટ સેટઅપ

  • ગણિત – એક સંભાવના પ્રશ્ન જેમાં પેટર્ન-ઓવરલેપ સંભાવના અને અપેક્ષા (expectation) તથા વિચલન (variance - second moments) બંનેની ગણતરી કરવાની જરૂર હતી.
  • ભૌતિક વિજ્ઞાન – પુલીના ઇનર્શિયાનું મોડેલિંગ અને સ્પ્રિંગ-ટેન્શનવાળી કેબલ ઢીલી પડતી વખતે થતા ઊર્જાના નુકસાનનું વિશ્લેષણ.
  • પ્રોગ્રામિંગ – જટિલ ડિપેન્ડન્સીઝ અને ટાઈ-બ્રેક નિયમો ધરાવતી બેકપેક-પેકિંગ સમસ્યા માટે Python સોલ્યુશન લખવું, અને પછી છ સ્વતંત્ર ટેસ્ટ કેસ સામે આઉટપુટ તપાસવું.

આંકડા શું કહે છે

GPT-5.6-SOL

  • ગણિત – અપેક્ષિત મૂલ્ય (expected value) અને વિચલન (variance) સાથેનું સંપૂર્ણ અને સાચું સોલ્યુશન આપ્યું.
  • ભૌતિક વિજ્ઞાન – ઇનર્શિયા મોડેલનું સાચું નિર્માણ કર્યું અને ઊર્જાના નુકસાનને ધ્યાનમાં લીધું, જે વિશ્લેષણાત્મક જવાબ સાથે સુસંગત હતું.
  • પ્રોગ્રામિંગ – એવો કોડ જનરેટ કર્યો જે કમ્પાઈલ થયો, ચાલ્યો અને તમામ છ બાહ્ય ચેક્સ પાસ કર્યા. એક આંતરિક ટેસ્ટ એસરશન (assertion) ખોટું હતું, જે આપણને યાદ અપાવે છે કે મોડેલ દ્વારા જનરેટ કરેલા ટેસ્ટ હંમેશા ભૂલરહિત હોતા નથી.

Kimi K3

  • ગણિત – તેની ટોકન મર્યાદા (પહેલા 6,500 ટોકન્સ પર, પછી 10,000 પર) વટાવી ગઈ અને કોઈ જવાબ આપ્યા વગર અટકી ગયું.
  • ભૌતિક વિજ્ઞાન – કોઈ પણ દેખીતું આઉટપુટ દેખાતા પહેલા જ ટોકન્સ ખતમ થઈ ગયા.
  • પ્રોગ્રામિંગ – 245 સેકન્ડ પછી ટાઈમ આઉટ થઈ ગયું, મૂલ્યાંકન કરવા માટે કંઈ જ આપ્યું નહીં.

તર્કની કાર્યક્ષમતા વિરુદ્ધ કાચી શક્તિ (raw power)

પ્રોડક્શન પાઇપલાઇન બનાવનાર કોઈપણ વ્યક્તિ માટે આનો અર્થ સ્પષ્ટ છે: જે મોડેલ આઉટપુટ આપ્યા વિના ટોકન્સ ખર્ચ કરે છે તે ડાઉનસ્ટ્રીમ પ્રક્રિયાઓને અટકાવી શકે છે, ખર્ચ વધારી શકે છે અને વપરાશકર્તાઓને નિરાશ કરી શકે છે.

વિશ્વસનીયતા અને "પરફેક્ટ" કોડનો છુપો ખર્ચ

વિજેતા મોડેલ પણ ભૂલ કરી ગયું: GPT-5.6-SOL ના સ્વ-જનરેટ કરેલા ટેસ્ટ કેસમાં એક ક્ષતિપૂર્ણ એસરશન (assertion) હતું. આ દર્શાવે છે કે મોડેલ દ્વારા કરવામાં આવતું વેરિફિકેશન માનવીય સમીક્ષાનો વિકલ્પ નથી. જ્યારે મોડેલ કોડ લખે છે, ત્યારે તમારે હજુ પણ સ્વતંત્ર ચેક્સ ચલાવવાની જરૂર છે.

આગળ શું જોવું જોઈએ

  • ફિનિશ રીઝન ટ્રેકિંગ (Finish reason tracking) – પ્રતિસાદ ટોકન મર્યાદાને કારણે સમાપ્ત થાય છે, ટાઈમ આઉટ થાય છે, કે કુદરતી રીતે અટકે છે તેનું લોગ રાખો.
  • રીઝનિંગ ટોકન કાઉન્ટ (Reasoning token count) – દરેક મોડેલ અંતિમ આઉટપુટની સરખામણીમાં આંતરિક વિચારણા (internal deliberation) પર કેટલા ટોકન્સ ખર્ચ કરે છે તેની તુલના કરો.
  • લેટન્સી મોનિટરિંગ (Latency monitoring) – દરેક સ્ટેપ માટે લાગતા સમયને માપો; જે મોડેલ દરેક ક્વેરી માટે મિનિટો લે છે તે ઇન્ટરેક્ટિવ એપ્સ માટે અયોગ્ય હોઈ શકે છે.

ડેવલપર્સે આ મેટ્રિક્સને માત્ર અંતિમ જવાબ તરીકે નહીં, પણ પ્રાથમિક સંકેતો (first-class signals) તરીકે જોવા જોઈએ.

નિષ્કર્ષ

GPT-5.6-SOL પૂર્ણતામાં Kimi K3 કરતા વધુ સારું પ્રદર્શન કરે છે. આ ટેસ્ટ આપણને એ પણ યાદ અપાવે છે કે જે મોડેલ "સાચું કરે છે" તે પણ ક્ષતિપૂર્ણ આંતરિક ચેક્સ આપી શકે છે, તેથી માનવીય દેખરેખ આવશ્યક છે. ફિનિશ રીઝન, ટોકન વપરાશ અને લેટન્સીને ટ્રેક કરવાથી તમને સાયલન્ટ ટાઈમઆઉટમાં ફસાયા વગર કામ માટે યોગ્ય સાધન પસંદ કરવામાં મદદ મળશે.