Kimi K3 در حین عبور GPT-5.6-SOL از خط پایان در سه پرامپت سنگین — یک مسئله احتمالات، یک سناریوی اینرسی قرقره و یک اسکریپت پیچیده Python برای مسئله کوله‌پشتی — کم آورد. این شکاف نشان می‌دهد که چرا وقتی به مدلی نیاز دارید که بتواند بدون توقف، ریاضیات، فیزیک و کدنویسی چندمرحله‌ای را استدلال کند، بودجه‌بندی توکن و تأخیر (latency) اهمیت دارند.

چرا این بنچمارک اهمیت دارد

توسعه‌دهندگان و پژوهشگران اغلب یک LLM را بر اساس امتیازات تبلیغاتی انتخاب می‌کنند، نه بر اساس نحوه عملکرد آن تحت فشار دنیای واقعی. در این تست مقایسه‌ای، هر مدل با مسئله‌ای روبرو شد که زنجیره طولانی از استدلال را می‌طلبد. GPT-5.6-SOL در هر سه حوزه پاسخ‌های کامل و صحیح ارائه داد؛ در حالی که Kimi K3 پیش از ارائه هرگونه پاسخ قابل استفاده، بودجه توکن خود را تمام کرد یا با تایم‌اوت (timeout) مواجه شد.

تنظیمات تست

  • ریاضی – یک سوال احتمالات که نیازمند محاسبه احتمال هم‌پوشانی الگو و همچنین امید ریاضی و واریانس (گشتاورهای دوم) بود.
  • فیزیک – مدل‌سازی اینرسی یک قرقره و اتلاف انرژی هنگام شل شدن کابل تحت کشش فنر.
  • برنامه‌نویسی – نوشتن یک راه حل Python برای مسئله بسته‌بندی کوله‌پشتی با وابستگی‌های پیچیده و قوانین tie-break، و سپس بررسی خروجی با شش مورد تست مستقل.

اعداد چه می‌گویند

GPT-5.6-SOL

  • ریاضی – یک راه حل کامل و صحیح همراه با مقدار مورد انتظار و واریانس که به وضوح مشخص شده بود، ارائه داد.
  • فیزیک – مدل اینرسی را به درستی ساخت و اتلاف انرژی را محاسبه کرد که با پاسخ تحلیلی مطابقت داشت.
  • برنامه‌نویسی – کدی تولید کرد که کامپایل شد، اجرا شد و از تمام شش بررسی خارجی عبور کرد. یک assertion تست داخلی اشتباه بود که به ما یادآوری می‌کند تست‌های تولید شده توسط مدل، خطاپذیر هستند.

Kimi K3

  • ریاضی – به سقف توکن خود رسید (ابتدا در ۶۵۰۰ توکن و سپس در ۱۰,۰۰۰ توکن) و بدون نمایش هیچ پاسخی متوقف شد.
  • فیزیک – پیش از ظاهر شدن هرگونه خروجی قابل مشاهده، توکن‌هایش تمام شد.
  • برنامه‌نویسی – پس از ۲۴۵ ثانیه با تایم‌اوت مواجه شد و هیچ چیزی برای ارزیابی ارائه نداد.

کارایی استدلال در مقابل قدرت خام

پیام این تست برای هر کسی که در حال ساخت خط لوله‌های تولید (production pipelines) است، روشن است: مدلی که بدون ارائه خروجی، توکن‌ها را مصرف می‌کند، می‌تواند فرآیندهای پایین‌دستی را متوقف کند، هزینه‌ها را افزایش دهد و کاربران را ناامید کند.

قابلیت اطمینان و هزینه پنهان کد «بی‌نقص»

حتی مدل برنده هم دچار لغزش شد: assertion تستِ خود-تولید شده توسط GPT-5.6-SOL حاوی یک خطای منطقی بود. این نشان می‌دهد که اعتبارسنجی تولید شده توسط مدل، جایگزینی برای بازبینی انسانی نیست. وقتی یک مدل کد می‌نویسد، شما همچنان نیاز به اجرای بررسی‌های مستقل دارید.

آنچه باید در آینده زیر نظر داشت

  • ردیابی دلیل پایان (Finish reason tracking) – ثبت اینکه آیا پاسخ به دلیل رسیدن به محدودیت توکن، تایم‌اوت یا توقف طبیعی پایان یافته است یا خیر.
  • تعداد توکن‌های استدلال – مقایسه اینکه هر مدل چه تعداد توکن را صرف تاملات داخلی در مقابل خروجی نهایی می‌کند.
  • نظارت بر تأخیر (Latency monitoring) – اندازه‌گیری زمان واقعی (wall-clock time) برای هر مرحله؛ مدلی که برای هر پرسش دقایقی زمان می‌برد، ممکن است برای اپلیکیشن‌های تعاملی مناسب نباشد.

توسعه‌دهندگان باید با این معیارها به عنوان سیگنال‌های اصلی برخورد کنند، نه فقط به عنوان پاسخ نهایی.

خلاصه کلام

GPT-5.6-SOL از نظر کامل بودن، عملکرد بهتری نسبت به Kimi K3 دارد. این تست همچنین به ما یادآوری می‌کند که حتی مدلی که «درست عمل می‌کند» همچنان می‌تواند بررسی‌های داخلی معیوبی تولید کند، بنابراین نظارت انسانی همچنان ضروری است. ردیابی دلایل پایان، میزان مصرف توکن و تأخیر به شما کمک می‌کند تا بدون گرفتار شدن در یک تایم‌اوت بی‌صدا، ابزار مناسب را برای کار خود انتخاب کنید.