OpenAI نے اعلان کیا ہے کہ اس کے GPT-5.6 Sol ماڈل نے ARC-AGI-3 لاجک بینچ مارک پر 38.3 فیصد اسکور حاصل کیا ہے، جو Anthropic کے Claude Opus 5 (30.2 فیصد) سے زیادہ ہے۔ اس دعوے نے فوری طور پر تکنیکی تنازع کو جنم دیا کیونکہ جب اسی ماڈل کو بینچ مارک کے آفیشل ٹیسٹ ہارس (test harness) کے ذریعے چلایا گیا تو اس نے صرف 7.8 فیصد اسکور کیا۔

ARC-AGI-3 اسکور کیوں اہم ہے

ARC-AGI-3 کسی ماڈل کی یاد شدہ پیٹرنز پر انحصار کرنے کے بجائے بالکل نئے اور استدلال (reasoning) پر مبنی مسائل حل کرنے کی صلاحیت کو پرکھتا ہے۔ محققین ان اسکورز کو "جنرل انٹیلی جنس" کی ترقی کے پیمانے کے طور پر دیکھتے ہیں، اس لیے دس پوائنٹس کی برتری انسانی طرز کے مسائل حل کرنے کی طرف ایک اہم قدم معلوم ہوتی ہے۔ صرف یہی وجہ ہے کہ اس خبر نے AI کمیونٹی میں ہلچل مچا دی۔

پوشیدہ حربہ: Retained Reasoning اور Compaction

OpenAI نے GPT-5.6 Sol کا جائزہ عوامی ٹیسٹ ہارس کے ذریعے نہیں لیا۔ اس کے بجائے اس نے اپنے Responses API کا استعمال کیا جس میں دو مخصوص آپشنز شامل تھے:

  • Retained Reasoning – یہ ماڈل کے سوچنے کے تسلسل (chain of thought) کو متعدد مراحل تک برقرار رکھتا ہے، جس سے درمیانی منطق کے ضائع ہونے سے بچا جا سکتا ہے جو ہر مرحلے کو الگ الگ لینے کی صورت میں ہوتا ہے۔
  • Compaction – یہ سابقہ سیاق و سباق (context) کو کاٹنے کے بجائے اسے کمپریس (compress) کر دیتا ہے، جس سے ماڈل کو ایک طویل اور خلاصہ شدہ تاریخ کا حوالہ دینے کی اجازت ملتی ہے۔

جب یہ سیٹنگز فعال ہوتی ہیں، تو ماڈل طویل دلائل کو آپس میں جوڑتا ہے اور پہلے سے اخذ کردہ نتائج کو دوبارہ استعمال کرتا ہے، جس سے کثیر مرحلہ وار کاموں میں کارکردگی بڑھ جاتی ہے۔ آفیشل ہارس میں، جو ہر عمل کے بعد استدلال کو ختم کر دیتا ہے، اسی ماڈل کا اسکور گر کر 7.8 فیصد رہ جاتا ہے، جو اسے Claude Opus 5 سے کافی پیچھے لے آتا ہے۔

OpenAI کا استدلال ہے کہ ایک بینچ مارک کو مکمل انفرنس پائپ لائن (inference pipeline) کی پیمائش کرنی چاہیے، نہ کہ صرف خام نیورل ویٹس (raw neural weights) کی۔ اس نقطہ نظر سے، وہ "wrapper" — یعنی وہ API لاجک جو سیاق و سباق کو محفوظ اور کمپیکٹ رکھتی ہے — اس سسٹم کا حصہ ہے جس کا جائزہ لیا جا رہا ہے۔

شفافیت کا مباحثہ

ARC Prize کے شریک بانی، François Chollet نے اس پر اپنی رائے دی۔ انہوں نے بینچ مارک کو "حل" کرنے کے لیے بنائے گئے مخصوص ہارسز اور عام مقصد کے لیے استعمال ہونے والی API سیٹنگز کے درمیان فرق واضح کیا۔ Chollet نے نوٹ کیا کہ اصل ARC Prize ٹیسٹنگ ماحول میں OpenAI طرز کی پرانی completions API استعمال کی گئی تھی، جس میں وہ جدید فیچرز موجود نہیں تھے جو اب Anthropic کی Claude API میں دستیاب ہیں۔ اس فرق کی وجہ سے ابتدائی راؤنڈز میں OpenAI کو نقصان پہنچ سکتا تھا۔

انہوں نے اس موازنے کو غیر مستند قرار دینے سے گریز کیا۔ Chollet کا کہنا تھا کہ اگر درست سیٹنگز اور متعلقہ اخراجات کو ظاہر کر دیا جائے تو آمنے سامنے کا دعویٰ قابل قبول ہے۔ انہوں نے دلیل دی کہ شفافیت کمیونٹی کو یہ جانچنے میں مدد دیتی ہے کہ آیا یہ فرق ماڈل کے آرکیٹیکچر کی وجہ سے ہے، انجینئرنگ کے حربوں کی وجہ سے، یا دونوں کی وجہ سے۔

کون جیتتا ہے، کون ہارتا ہے

اگر زیادہ اسکور کو بلا چون مانا جائے تو OpenAI کو عوامی تاثر میں بہتری اور کاروباری لائسنسنگ کے مذاکرات میں مضبوط پوزیشن حاصل ہوگی۔ دوسری طرف، Claude کی ٹیم معیاری ہارس پر خام ماڈل (raw-model) کی کارکردگی کو بطور ثبوت پیش کر سکتی ہے کہ اضافی انجینئرنگ تہوں کے بغیر ان کا آرکیٹیکچر زیادہ موثر ہے۔

وہ محققین اور ڈویلپرز جو سرمایہ کاری کے لیے بینچ مارک رینکنگ پر بھروسہ کرتے ہیں، ان کے لیے یہ واقعہ پریشان کن ہو سکتا ہے۔ یہ معاملہ ظاہر کرتا ہے کہ جیسے جیسے ماڈلز بڑے ہوتے جا رہے ہیں، ان کے انفرنس کو منظم کرنے والا سافٹ ویئر فیصلہ کن ثابت ہو سکتا ہے۔ وہ کمپنیاں جو کم لاگت پر جدید انفرنس اسٹیکس (inference stacks) فراہم کرتی ہیں، وہ کسی برتر بنیادی ماڈل کے بغیر بھی ہیڈ لائن اسکورز پر حاوی ہو سکتی ہیں۔

ARC-AGI-3 اور دیگر بینچ مارکس کے لیے آگے کیا ہے

اس تنازع کے بعد ممکنہ طور پر ARC Prize کے منتظمین اجازت شدہ انفرنس کنفیگریشنز کے بارے میں سخت قوانین لائیں گے۔ ممکنہ اقدامات میں شامل ہو سکتے ہیں:

  • صرف آفیشل ہارس کے ساتھ کارکردگی کو ظاہر کرنے والا ایک "بیس لائن" (baseline) اسکور شائع کرنا۔
  • شرکاء کے لیے اضافی سیٹنگز کے اخراجات کا تجزیہ جمع کروانا لازمی قرار دینا، تاکہ زیادہ اسکور کا موازنہ اضافی کمپیوٹ یا انجینئرنگ کے اخراجات سے کیا جا سکے۔
  • ایک الگ "سسٹم لیول" ٹریک شامل کرنا جو سیاق و سباق کے انتظام (context-management) کے فیچرز کے ہوشمندانہ استعمال کو انعام دے۔

اس طرح کے اقدامات خام ماڈل کی صلاحیت اور انجینئرنگ کی بہتری (optimization) کے درمیان واضح فرق پیدا کریں گے، جس سے مستقبل کے دعووں کا موازنہ کرنا آسان ہو جائے گا۔

جوابی دلیل: بینچ مارکس کو حقیقی دنیا کے استعمال کی عکاسی کرنی چاہیے

ایک فریق کا کہنا ہے کہ صرف "خام ماڈل" (raw-model) کا نظریہ غیر حقیقی ہے۔ عملی استعمال (production) میں، ڈویلپرز عام طور پر لینگویج ماڈلز پر کیشنگ (caching)، سیاق و سباق کا خلاصہ (context summarisation) اور دیگر تکنیکیں استعمال کرتے ہیں۔ اگر کسی بینچ مارک کا مقصد عملی افادیت کی پیش گوئی کرنا ہے، تو اسے ان بہتریوں (optimizations) کی اجازت دینی چاہیے یا بلکہ انہیں فروغ دینا چاہیے۔ اس زاویے سے، OpenAI کے Retained Reasoning اور Compaction جائز ٹولز ہیں جنہیں کوئی بھی حریف اپنا سکتا ہے، بشرطیکہ وہ عوامی طور پر دستاویزی شکل میں موجود ہوں۔

ناقدین کا کہنا ہے کہ ایک مشترکہ بنیاد کے بغیر، اسکورز ایک بدلتے ہوئے ہدف بن جاتے ہیں، جس سے ایک معروضی پیمانے کے طور پر بینچ مارک کا کردار کمزور ہو جاتا ہے۔ ecological validity (حقیقی استعمال کی عکاسی) اور methodological purity (ماڈل کو الگ تھلگ کرنے) کے درمیان کشمکش موجودہ تنازع کو ہوا دے رہی ہے۔

خلاصہ

GPT-5.6 Sol کا دعویٰ AI ایویلیوایشن میں بڑھتی ہوئی تقسیم کو اجاگر کرتا ہے: ماڈل کی خام صلاحیت بمقابلہ وہ انجینئرنگ ایکو سسٹم جو اسے بروئے کار لاتا ہے۔ جب تک کمیونٹی انفرنس سیٹنگز اور ان کی لاگت کی مکمل تفصیلات کا مطالبہ کرتی رہے گی، یہ بحث جنرل انٹیلی جنس کی طرف ہونے والی ترقی کے ہمارے تصور کو دھندلا کرنے کے بجائے مزید واضح کرے گی۔