OpenAI اعلام کرد که مدل GPT-5.6 Sol خود در بنچمارک منطقی ARC-AGI-3 به امتیاز ۳۸.۳ درصد دست یافته است که از امتیاز ۳۰.۲ درصدی Claude Opus 5 از شرکت Anthropic پیشی گرفته است. این ادعا بلافاصله باعث بروز یک اختلاف فنی شد، زیرا همان مدل وقتی از طریق ابزار تست رسمی (official test harness) بنچمارک اجرا شد، تنها ۷.۸ درصد امتیاز گرفت.
چرا امتیاز ARC-AGI-3 اهمیت دارد
ARC-AGI-3 توانایی مدل را در حل مسائل کاملاً جدید و مبتنی بر استدلال، به جای تکیه بر الگوهای حفظشده، میسنجد. پژوهشگران این امتیازها را معیاری برای پیشرفت «هوش عمومی» (general-intelligence) میدانند، بنابراین یک اختلاف ده امتیازی، گامی ملموس به سوی حل مسئله مشابه انسان به نظر میرسد. همین موضوع به تنهایی توضیح میدهد که چرا این خبر در جامعه هوش مصنوعی طنینانداز شد.
اهرم پنهان: Retained Reasoning و Compaction
OpenAI مدل GPT-5.6 Sol را با ابزار تست عمومی ارزیابی نکرد. در عوض، از Responses API خود با دو گزینه اختصاصی استفاده کرد:
- Retained Reasoning – زنجیره تفکر مدل را در طول چندین مرحله زنده نگه میدارد و از از دست رفتن منطق میانی (که هنگام برخورد جداگانه با هر مرحله رخ میدهد) جلوگیری میکند.
- Compaction – به جای قطع کردن بافتار (context) قبلی، آن را فشرده میکند و به مدل اجازه میدهد به یک تاریخچه طولانیتر و خلاصهشده ارجاع دهد.
وقتی این تنظیمات فعال باشند، مدل استدلالهای طولانیتری را به هم پیوند میدهد و از استنتاجهای قبلی دوباره استفاده میکند که باعث افزایش عملکرد در وظایف چندمرحلهای میشود. در ابزار رسمی، که پس از هر اقدام استدلال را دور میریزد، امتیاز همان مدل به ۷.۸ درصد سقوط میکند و آن را بسیار پایینتر از Claude Opus 5 قرار میدهد.
OpenAI استدلال میکند که یک بنچمارک باید کل خط لوله استنتاج (inference pipeline) را اندازهگیری کند، نه فقط وزنهای عصبی خام را. از این منظر، «پوشش» (wrapper) – یعنی منطق API که بافتار را حفظ و فشرده میکند – بخشی از سیستمی است که مورد ارزیابی قرار میگیرد.
بحث عدالت و انصاف
François Chollet، یکی از بنیانگذاران ARC Prize که حامی این بنچمارک است، وارد بحث شد. او بین ابزارهای سفارشی که برای «حل کردن» یک بنچمارک ساخته شدهاند و تنظیمات API عمومی که هر کاربری میتواند فعال کند، تمایز قائل شد. Chollet خاطرنشان کرد که محیط تست اصلی ARC Prize از یک API تکمیل (completions API) قدیمیتر به سبک OpenAI استفاده میکرد که فاقد ویژگیهای پیشرفتهای بود که اکنون در Claude API شرکت Anthropic در دسترس است. این عدم تطابق میتوانست در دورهای قبلی به ضرر OpenAI باشد.
او از اعلام بیاعتبار بودن این مقایسه خودداری کرد. Chollet گفت که اگر تنظیمات دقیق و هزینههای مرتبط با آن فاش شود، ادعای مقایسه رودررو همچنان قابل قبول است. او استدلال کرد که شفافیت به جامعه اجازه میدهد ارزیابی کند که آیا این شکاف ناشی از معماری مدل است، ترفندهای مهندسی، یا هر دو.
چه کسی برنده و چه کسی بازنده است
اگر امتیاز بالاتر به همان شکلی که هست پذیرفته شود، OpenAI از نظر درک عمومی تقویت میشود و موقعیت چانهزنی قویتری در مذاکرات مجوزهای سازمانی به دست میآورد. تیم Claude میتواند به عملکرد مدل خام در ابزار استاندارد شده به عنوان مدرکی بر این ادعا اشاره کند که معماری آنها در صورت حذف لایههای مهندسی اضافی، کارآمدتر است.
پژوهشگران و توسعهدهندگانی که برای هدایت سرمایهگذاریهای خود به رتبهبندیهای بنچمارک تکیه میکنند، ممکن است این ماجرا را نگرانکننده بیابند. این مورد نشان میدهد که با بزرگتر شدن مدلها، نرمافزاری که استنتاج آنها را مدیریت میکند میتواند تعیینکننده باشد. شرکتهایی که پشتههای استنتاج (inference stacks) پیچیده را با هزینه نهایی کم عرضه میکنند، میتوانند بدون داشتن یک مدل زیربنایی برتر، بر امتیازهای خبری مسلط شوند.
گامهای بعدی برای ARC-AGI-3 و سایر بنچمارکها
این اختلاف احتمالاً برگزارکنندگان ARC Prize را به سمت وضع قوانین سختگیرانهتر در مورد پیکربندیهای مجاز استنتاج سوق خواهد داد. پاسخهای احتمالی عبارتند از:
- انتشار یک امتیاز «خط پایه» (baseline) که تنها بازتابدهنده عملکرد با ابزار رسمی باشد.
- الزام شرکتکنندگان به ارائه تحلیل هزینه برای هرگونه تنظیمات اضافی، تا بتوان امتیاز بالا را در برابر محاسبات اضافی یا هزینههای مهندسی سنجید.
- افزودن یک بخش مجزا در سطح «سیستم» که استفاده هوشمندانه از ویژگیهای مدیریت بافتار (context-management) را پاداش دهد.
چنین اقداماتی باعث جدایی شفافتر بین قابلیتهای خام مدل و بهینهسازی مهندسی میشود و مقایسه ادعاهای آینده را آسانتر میکند.
استدلال متقابل: بنچمارکها باید بازتابدهنده استفاده در دنیای واقعی باشند
یک طرف استدلال میکند که دیدگاه سختگیرانه «فقط مدل خام» غیرواقعبینانه است. در محیطهای عملیاتی، توسعهدهندگان بهطور معمول لایههایی از کشینگ (caching)، خلاصهسازی بافتار و سایر ترفندها را روی مدلهای زبانی اعمال میکنند. اگر هدف یک بنچمارک پیشبینی کاربرد عملی است، باید اجازه – یا حتی تشویق – این بهینهسازیها را بدهد. از این منظر، Retained Reasoning و Compaction شرکت OpenAI ابزارهای مشروعی هستند که هر رقیبی میتواند از آنها استفاده کند، به شرطی که به صورت عمومی مستند شده باشند.
منتقدان استدلال میکنند که بدون یک خط مبنای مشترک، امتیازها به هدفی متغیر تبدیل میشوند و نقش بنچمارک را به عنوان یک معیار عینی تضعیف میکنند. تنش میان اعتبار اکولوژیک (بازتابدهنده استقرارهای واقعی) و خلوص روششناختی (جداسازی مدل)، به جنجالهای فعلی دامن میزند.
نکته کلیدی
ادعای GPT-5.6 Sol شکاف رو به رشدی را در ارزیابی هوش مصنوعی برجسته میکند: استعداد خام مدل در مقابل اکوسیستم مهندسی که آن را استخراج میکند. تا زمانی که جامعه خواستار افشای کامل تنظیمات استنتاج و هزینههای آنها باشد، این بحثها به جای آنکه دیدگاه ما را نسبت به پیشرفت به سوی هوش عمومی تیره و تار کند، بیش از پیش شدت خواهد گرفت.
