Kimi K3 در حین عبور GPT-5.6-SOL از خط پایان در سه پرامپت سنگین — یک مسئله احتمالات، یک سناریوی اینرسی قرقره و یک اسکریپت پیچیده Python برای مسئله کولهپشتی — کم آورد. این شکاف نشان میدهد که چرا وقتی به مدلی نیاز دارید که بتواند بدون توقف، ریاضیات، فیزیک و کدنویسی چندمرحلهای را استدلال کند، بودجهبندی توکن و تأخیر (latency) اهمیت دارند.
چرا این بنچمارک اهمیت دارد
توسعهدهندگان و پژوهشگران اغلب یک LLM را بر اساس امتیازات تبلیغاتی انتخاب میکنند، نه بر اساس نحوه عملکرد آن تحت فشار دنیای واقعی. در این تست مقایسهای، هر مدل با مسئلهای روبرو شد که زنجیره طولانی از استدلال را میطلبد. GPT-5.6-SOL در هر سه حوزه پاسخهای کامل و صحیح ارائه داد؛ در حالی که Kimi K3 پیش از ارائه هرگونه پاسخ قابل استفاده، بودجه توکن خود را تمام کرد یا با تایماوت (timeout) مواجه شد.
تنظیمات تست
- ریاضی – یک سوال احتمالات که نیازمند محاسبه احتمال همپوشانی الگو و همچنین امید ریاضی و واریانس (گشتاورهای دوم) بود.
- فیزیک – مدلسازی اینرسی یک قرقره و اتلاف انرژی هنگام شل شدن کابل تحت کشش فنر.
- برنامهنویسی – نوشتن یک راه حل Python برای مسئله بستهبندی کولهپشتی با وابستگیهای پیچیده و قوانین tie-break، و سپس بررسی خروجی با شش مورد تست مستقل.
اعداد چه میگویند
GPT-5.6-SOL
- ریاضی – یک راه حل کامل و صحیح همراه با مقدار مورد انتظار و واریانس که به وضوح مشخص شده بود، ارائه داد.
- فیزیک – مدل اینرسی را به درستی ساخت و اتلاف انرژی را محاسبه کرد که با پاسخ تحلیلی مطابقت داشت.
- برنامهنویسی – کدی تولید کرد که کامپایل شد، اجرا شد و از تمام شش بررسی خارجی عبور کرد. یک assertion تست داخلی اشتباه بود که به ما یادآوری میکند تستهای تولید شده توسط مدل، خطاپذیر هستند.
Kimi K3
- ریاضی – به سقف توکن خود رسید (ابتدا در ۶۵۰۰ توکن و سپس در ۱۰,۰۰۰ توکن) و بدون نمایش هیچ پاسخی متوقف شد.
- فیزیک – پیش از ظاهر شدن هرگونه خروجی قابل مشاهده، توکنهایش تمام شد.
- برنامهنویسی – پس از ۲۴۵ ثانیه با تایماوت مواجه شد و هیچ چیزی برای ارزیابی ارائه نداد.
کارایی استدلال در مقابل قدرت خام
پیام این تست برای هر کسی که در حال ساخت خط لولههای تولید (production pipelines) است، روشن است: مدلی که بدون ارائه خروجی، توکنها را مصرف میکند، میتواند فرآیندهای پاییندستی را متوقف کند، هزینهها را افزایش دهد و کاربران را ناامید کند.
قابلیت اطمینان و هزینه پنهان کد «بینقص»
حتی مدل برنده هم دچار لغزش شد: assertion تستِ خود-تولید شده توسط GPT-5.6-SOL حاوی یک خطای منطقی بود. این نشان میدهد که اعتبارسنجی تولید شده توسط مدل، جایگزینی برای بازبینی انسانی نیست. وقتی یک مدل کد مینویسد، شما همچنان نیاز به اجرای بررسیهای مستقل دارید.
آنچه باید در آینده زیر نظر داشت
- ردیابی دلیل پایان (Finish reason tracking) – ثبت اینکه آیا پاسخ به دلیل رسیدن به محدودیت توکن، تایماوت یا توقف طبیعی پایان یافته است یا خیر.
- تعداد توکنهای استدلال – مقایسه اینکه هر مدل چه تعداد توکن را صرف تاملات داخلی در مقابل خروجی نهایی میکند.
- نظارت بر تأخیر (Latency monitoring) – اندازهگیری زمان واقعی (wall-clock time) برای هر مرحله؛ مدلی که برای هر پرسش دقایقی زمان میبرد، ممکن است برای اپلیکیشنهای تعاملی مناسب نباشد.
توسعهدهندگان باید با این معیارها به عنوان سیگنالهای اصلی برخورد کنند، نه فقط به عنوان پاسخ نهایی.
خلاصه کلام
GPT-5.6-SOL از نظر کامل بودن، عملکرد بهتری نسبت به Kimi K3 دارد. این تست همچنین به ما یادآوری میکند که حتی مدلی که «درست عمل میکند» همچنان میتواند بررسیهای داخلی معیوبی تولید کند، بنابراین نظارت انسانی همچنان ضروری است. ردیابی دلایل پایان، میزان مصرف توکن و تأخیر به شما کمک میکند تا بدون گرفتار شدن در یک تایماوت بیصدا، ابزار مناسب را برای کار خود انتخاب کنید.
