Kimi K3 ناکام رہا جبکہ GPT-5.6-SOL نے تین مشکل ترین پرامپٹس—ایک احتمال کا مسئلہ، ایک پلّی-انرشیا (pulley-inertia) کا منظرنامہ، اور ایک پیچیدہ پائتھن بیک پیک اسکرپٹ—کے مقابلے میں کامیابی سے فنش لائن عبور کی۔ یہ فرق ظاہر کرتا ہے کہ جب آپ کو ایسے ماڈل کی ضرورت ہو جو بغیر رکے ریاضی، فزکس اور کوڈ کے کثیر الجہتی مراحل پر استدلال کر سکے، تو ٹوکن بجٹنگ اور لیٹنسی (latency) کتنی اہمیت رکھتے ہیں۔

یہ بینچ مارک کیوں اہم ہے

ڈویلپرز اور محققین اکثر LLM کا انتخاب صرف سرخیوں میں نظر آنے والے اسکورز کی بنیاد پر کرتے ہیں، نہ کہ اس بنیاد پر کہ وہ حقیقی دنیا کے دباؤ میں کیسا عمل کرتا ہے۔ اس آمنے سامنے کے ٹیسٹ میں، ہر ماڈل نے ایک ایسے مسئلے کو حل کرنے کی کوشش کی جس کے لیے استدلال کے ایک طویل سلسلے کی ضرورت تھی۔ GPT-5.6-SOL نے تینوں شعبوں میں مکمل اور درست جوابات فراہم کیے؛ جبکہ Kimi K3 اپنا ٹوکن بجٹ ختم کرنے یا کوئی قابلِ استعمال نتیجہ دینے سے پہلے ہی ٹائم آؤٹ ہو گیا۔

ٹیسٹ کا طریقہ کار

  • ریاضی (Math) – احتمال کا ایک سوال جس کے لیے پیٹرن اوورلیپ کے احتمال اور توقع (expectation) و تغیر (variance) (دوسرے لمحات) کی پیمائش ضروری تھی۔
  • فزکس (Physics) – ایک پلّی کے انرشیا اور اس وقت ہونے والے توانائی کے نقصان کی ماڈلنگ جب ایک اسپرنگ سے کھنچا ہوا کیبل ڈھیلا پڑ جاتا ہے۔
  • پروگرامنگ (Programming) – پیچیدہ انحصار (dependencies) اور ٹائی بریک کے قواعد کے ساتھ بیک پیک پیک کرنے کے مسئلے کے لیے ایک پائتھن (Python) حل لکھنا، اور پھر چھ آزاد ٹیسٹ کیسز کے خلاف آؤٹ پٹ کی جانچ کرنا۔

اعداد و شمار کیا کہتے ہیں

GPT-5.6-SOL

  • ریاضی (Math) – مکمل اور درست حل فراہم کیا جس میں توقع (expected value) اور تغیر (variance) کو واضح طور پر بیان کیا گیا تھا۔
  • فزکس (Physics) – درست طریقے سے انرشیا ماڈل تیار کیا اور توانائی کے نقصان کا حساب لگایا، جو تجزیاتی جواب سے مطابقت رکھتا تھا۔
  • پروگرامنگ (Programming) – ایسا کوڈ تیار کیا جو کمپائل ہوا، چلا، اور تمام چھ بیرونی چیک پاس کر گیا۔ ایک اندرونی ٹیسٹ اسسرشن (assertion) غلط تھا، جو ہمیں یاد دلاتا ہے کہ ماڈل کے ذریعے تیار کردہ ٹیسٹ ناقابلِ خطا نہیں ہوتے۔

Kimi K3

  • ریاضی (Math) – اپنی ٹوکن کی حد (پہلے 6,500 ٹوکنز پر، پھر 10,000 پر) تک پہنچ گیا اور کوئی جواب دکھائے بغیر رک گیا۔
  • فزکس (Physics) – کوئی بھی نظر آنے والا آؤٹ پٹ آنے سے پہلے ہی ٹوکنز ختم ہو گئے۔
  • پروگرامنگ (Programming) – 245 سیکنڈ کے بعد ٹائم آؤٹ ہو گیا، اور جانچ کے لیے کچھ بھی فراہم نہ کر سکا۔

استدلال کی کارکردگی بمقابلہ خام طاقت

پروڈکشن پائپ لائنز بنانے والوں کے لیے اس کا نتیجہ واضح ہے: ایک ایسا ماڈل جو آؤٹ پٹ دیے بغیر ٹوکنز ضائع کرتا ہے، وہ بعد کے مراحل (downstream processes) کو روک سکتا ہے، اخراجات بڑھا سکتا ہے اور صارفین کو مایوس کر سکتا ہے۔

بھروسہ مندی اور "مکمل" کوڈ کی پوشیدہ قیمت

جیتنے والا ماڈل بھی چوک گیا: GPT-5.6-SOL کے خود تیار کردہ ٹیسٹ کیس میں ایک غلط اسسرشن (assertion) شامل تھا۔ یہ ظاہر کرتا ہے کہ ماڈل کے ذریعے تیار کردہ تصدیق انسانی نظر ثانی کا متبادل نہیں ہے۔ جب کوئی ماڈل کوڈ لکھتا ہے، تو آپ کو پھر بھی آزادانہ چیک کرنے کی ضرورت ہوتی ہے۔

آگے کیا دیکھنا ہے

  • فنش ریزن (Finish reason) کی ٹریکنگ – اس بات کا ریکارڈ رکھیں کہ آیا جواب ٹوکن کی حد تک پہنچنے، ٹائم آؤٹ ہونے، یا قدرتی طور پر رکنے کی وجہ سے ختم ہوا ہے۔
  • استدلال کے ٹوکنز کی تعداد – موازنہ کریں کہ ہر ماڈل حتمی آؤٹ پٹ کے مقابلے میں اندرونی غور و فکر پر کتنے ٹوکنز خرچ کرتا ہے۔
  • لیٹنسی (Latency) کی نگرانی – ہر مرحلے کے لیے اصل وقت (wall-clock time) کی پیمائش کریں؛ ایک ایسا ماڈل جو ہر سوال کے لیے منٹ لے، وہ انٹرایکٹو ایپس کے لیے موزوں نہیں ہو سکتا۔

ڈویلپرز کو ان میٹرکس کو صرف حتمی جواب کے بجائے بنیادی اشارے (first-class signals) کے طور پر لینا چاہیے۔

خلاصہ

GPT-5.6-SOL مکمل ہونے کے لحاظ سے Kimi K3 سے بہتر کارکردگی دکھاتا ہے۔ یہ ٹیسٹ ہمیں یہ بھی یاد دلاتا ہے کہ ایک ایسا ماڈل جو "درست" بھی ہو سکتا ہے، وہ اب بھی غلط اندرونی چیک پیدا کر سکتا ہے، اس لیے انسانی نگرانی اب بھی ضروری ہے۔ فنش ریزن، ٹوکن کے استعمال اور لیٹنسی کی ٹریکنگ آپ کو خاموش ٹائم آؤٹ میں پھنسے بغیر کام کے لیے صحیح ٹول منتخب کرنے میں مدد دے گی۔