OpenAI اعلام کرد که مدل GPT-5.6 Sol خود در بنچمارک منطقی ARC-AGI-3 به امتیاز ۳۸.۳ درصد دست یافته است که از امتیاز ۳۰.۲ درصدی Claude Opus 5 از شرکت Anthropic پیشی گرفته است. این ادعا بلافاصله باعث بروز یک اختلاف فنی شد، زیرا همان مدل وقتی از طریق ابزار تست رسمی (official test harness) بنچمارک اجرا شد، تنها ۷.۸ درصد امتیاز گرفت.

چرا امتیاز ARC-AGI-3 اهمیت دارد

ARC-AGI-3 توانایی مدل را در حل مسائل کاملاً جدید و مبتنی بر استدلال، به جای تکیه بر الگوهای حفظ‌شده، می‌سنجد. پژوهشگران این امتیازها را معیاری برای پیشرفت «هوش عمومی» (general-intelligence) می‌دانند، بنابراین یک اختلاف ده امتیازی، گامی ملموس به سوی حل مسئله مشابه انسان به نظر می‌رسد. همین موضوع به تنهایی توضیح می‌دهد که چرا این خبر در جامعه هوش مصنوعی طنین‌انداز شد.

اهرم پنهان: Retained Reasoning و Compaction

OpenAI مدل GPT-5.6 Sol را با ابزار تست عمومی ارزیابی نکرد. در عوض، از Responses API خود با دو گزینه اختصاصی استفاده کرد:

  • Retained Reasoning – زنجیره تفکر مدل را در طول چندین مرحله زنده نگه می‌دارد و از از دست رفتن منطق میانی (که هنگام برخورد جداگانه با هر مرحله رخ می‌دهد) جلوگیری می‌کند.
  • Compaction – به جای قطع کردن بافتار (context) قبلی، آن را فشرده می‌کند و به مدل اجازه می‌دهد به یک تاریخچه طولانی‌تر و خلاصه‌شده ارجاع دهد.

وقتی این تنظیمات فعال باشند، مدل استدلال‌های طولانی‌تری را به هم پیوند می‌دهد و از استنتاج‌های قبلی دوباره استفاده می‌کند که باعث افزایش عملکرد در وظایف چندمرحله‌ای می‌شود. در ابزار رسمی، که پس از هر اقدام استدلال را دور می‌ریزد، امتیاز همان مدل به ۷.۸ درصد سقوط می‌کند و آن را بسیار پایین‌تر از Claude Opus 5 قرار می‌دهد.

OpenAI استدلال می‌کند که یک بنچمارک باید کل خط لوله استنتاج (inference pipeline) را اندازه‌گیری کند، نه فقط وزن‌های عصبی خام را. از این منظر، «پوشش» (wrapper) – یعنی منطق API که بافتار را حفظ و فشرده می‌کند – بخشی از سیستمی است که مورد ارزیابی قرار می‌گیرد.

بحث عدالت و انصاف

François Chollet، یکی از بنیان‌گذاران ARC Prize که حامی این بنچمارک است، وارد بحث شد. او بین ابزارهای سفارشی که برای «حل کردن» یک بنچمارک ساخته شده‌اند و تنظیمات API عمومی که هر کاربری می‌تواند فعال کند، تمایز قائل شد. Chollet خاطرنشان کرد که محیط تست اصلی ARC Prize از یک API تکمیل (completions API) قدیمی‌تر به سبک OpenAI استفاده می‌کرد که فاقد ویژگی‌های پیشرفته‌ای بود که اکنون در Claude API شرکت Anthropic در دسترس است. این عدم تطابق می‌توانست در دورهای قبلی به ضرر OpenAI باشد.

او از اعلام بی‌اعتبار بودن این مقایسه خودداری کرد. Chollet گفت که اگر تنظیمات دقیق و هزینه‌های مرتبط با آن فاش شود، ادعای مقایسه رودررو همچنان قابل قبول است. او استدلال کرد که شفافیت به جامعه اجازه می‌دهد ارزیابی کند که آیا این شکاف ناشی از معماری مدل است، ترفندهای مهندسی، یا هر دو.

چه کسی برنده و چه کسی بازنده است

اگر امتیاز بالاتر به همان شکلی که هست پذیرفته شود، OpenAI از نظر درک عمومی تقویت می‌شود و موقعیت چانه‌زنی قوی‌تری در مذاکرات مجوزهای سازمانی به دست می‌آورد. تیم Claude می‌تواند به عملکرد مدل خام در ابزار استاندارد شده به عنوان مدرکی بر این ادعا اشاره کند که معماری آن‌ها در صورت حذف لایه‌های مهندسی اضافی، کارآمدتر است.

پژوهشگران و توسعه‌دهندگانی که برای هدایت سرمایه‌گذاری‌های خود به رتبه‌بندی‌های بنچمارک تکیه می‌کنند، ممکن است این ماجرا را نگران‌کننده بیابند. این مورد نشان می‌دهد که با بزرگ‌تر شدن مدل‌ها، نرم‌افزاری که استنتاج آن‌ها را مدیریت می‌کند می‌تواند تعیین‌کننده باشد. شرکت‌هایی که پشته‌های استنتاج (inference stacks) پیچیده را با هزینه نهایی کم عرضه می‌کنند، می‌توانند بدون داشتن یک مدل زیربنایی برتر، بر امتیازهای خبری مسلط شوند.

گام‌های بعدی برای ARC-AGI-3 و سایر بنچمارک‌ها

این اختلاف احتمالاً برگزارکنندگان ARC Prize را به سمت وضع قوانین سخت‌گیرانه‌تر در مورد پیکربندی‌های مجاز استنتاج سوق خواهد داد. پاسخ‌های احتمالی عبارتند از:

  • انتشار یک امتیاز «خط پایه» (baseline) که تنها بازتاب‌دهنده عملکرد با ابزار رسمی باشد.
  • الزام شرکت‌کنندگان به ارائه تحلیل هزینه برای هرگونه تنظیمات اضافی، تا بتوان امتیاز بالا را در برابر محاسبات اضافی یا هزینه‌های مهندسی سنجید.
  • افزودن یک بخش مجزا در سطح «سیستم» که استفاده هوشمندانه از ویژگی‌های مدیریت بافتار (context-management) را پاداش دهد.

چنین اقداماتی باعث جدایی شفاف‌تر بین قابلیت‌های خام مدل و بهینه‌سازی مهندسی می‌شود و مقایسه ادعاهای آینده را آسان‌تر می‌کند.

استدلال متقابل: بنچمارک‌ها باید بازتاب‌دهنده استفاده در دنیای واقعی باشند

یک طرف استدلال می‌کند که دیدگاه سخت‌گیرانه «فقط مدل خام» غیرواقع‌بینانه است. در محیط‌های عملیاتی، توسعه‌دهندگان به‌طور معمول لایه‌هایی از کشینگ (caching)، خلاصه‌سازی بافتار و سایر ترفندها را روی مدل‌های زبانی اعمال می‌کنند. اگر هدف یک بنچمارک پیش‌بینی کاربرد عملی است، باید اجازه – یا حتی تشویق – این بهینه‌سازی‌ها را بدهد. از این منظر، Retained Reasoning و Compaction شرکت OpenAI ابزارهای مشروعی هستند که هر رقیبی می‌تواند از آن‌ها استفاده کند، به شرطی که به صورت عمومی مستند شده باشند.

منتقدان استدلال می‌کنند که بدون یک خط مبنای مشترک، امتیازها به هدفی متغیر تبدیل می‌شوند و نقش بنچمارک را به عنوان یک معیار عینی تضعیف می‌کنند. تنش میان اعتبار اکولوژیک (بازتاب‌دهنده استقرارهای واقعی) و خلوص روش‌شناختی (جداسازی مدل)، به جنجال‌های فعلی دامن می‌زند.

نکته کلیدی

ادعای GPT-5.6 Sol شکاف رو به رشدی را در ارزیابی هوش مصنوعی برجسته می‌کند: استعداد خام مدل در مقابل اکوسیستم مهندسی که آن را استخراج می‌کند. تا زمانی که جامعه خواستار افشای کامل تنظیمات استنتاج و هزینه‌های آن‌ها باشد، این بحث‌ها به جای آنکه دیدگاه ما را نسبت به پیشرفت به سوی هوش عمومی تیره و تار کند، بیش از پیش شدت خواهد گرفت.