قام فريق بحثي ببناء موجه (router) لتحديد ما إذا كان بإمكان نموذج لغوي رخيص التعامل مع طلب برمجي، على أمل تقليل تكاليف الاستدلال (inference costs)، لكن الموجه لم يتمكن من التفوق على خط الأساس القائم على سياسة "عدم التصعيد مطلقاً" (never-escalate). يوضح هذا الفشل سبب تضليل المقاييس التي تركز على الدقة لسلاسل النماذج (cascades)، ويشير إلى الإشارات التي تلتقط الصعوبة فعلياً.

لماذا كان الموجه مهماً

تقوم سلاسل النماذج (Model cascades) بإرسال كل طلب إلى أصغر نموذج يمكنه الإجابة عليه بشكل صحيح. إذا أرسل الموجه أمراً (prompt) بسيطاً إلى نموذج رخيص، فإن النظام يتخطى العمليات الحسابية المكلفة المطلوبة لنموذج أكبر. قام الفريق بتدريب موجه على 539 مهمة برمجة حقيقية — 428 سهلة و111 صعبة — متوقعين أن يتعلم متى يكون النموذج الرخيص كافياً.

الأرقام التي لم تكن كافية

  • المساحة تحت منحنى ROC (AUC) للبيانات المحجوزة: 0.594
  • نطاق التحقق المتقاطع خماسي الطيات (5-fold cross-validation): 0.55 – 0.57
  • أفضل عتبة (threshold): تطابق سياسة "عدم التصعيد مطلقاً"

كانت قيمة AUC للبيانات المحجوزة 0.594 وتراوح التحقق المتقاطع بين 0.55 و0.57، مما يعني أن المصنف بالكاد يميز بين الحالات السهلة والصعبة. عندما تعيد العتبة المثلى إنتاج سياسة لا تستخدم النموذج المكلف أبداً، فإن الموجه لا يضيف أي قيمة، حيث يتصرف كمُتنبئ ثابت بدلاً من صانع قرار.

ما اختبرته التجارب

قارن الباحثون بين ثلاث مجموعات من الميزات:

مجموعة الميزات AUC
11 ميزة سطحية بسيطة (مثل عدد الرموز token count أو وجود كلمات مفتاحية) 0.610
تضمين أمر (prompt embedding) بأبعاد 1024 (متجه دلالي) 0.552
كلاهما معاً 0.609

ومن المثير للدهشة أن الميزات السطحية خفيفة الوزن تفوقت على التضمين الدلالي عالي الأبعاد. التقط التضمين موضوع الأمر ولكن لم يلتقط صعوبته الجوهرية. أدى تزويد الموجه بمسودة النموذج الرخيص إلى رفع قيمة AUC إلى 0.640، مما يشير إلى أن الإشارات التي تظهر أثناء عملية التوليد أكثر إفادة من تلك الموجودة في الأمر وحده.

فخّان أساسيان

1. الدقة هي مقياس خاطئ

يجب أن يحسن الموجه المقايضة بين التكلفة والدقة مقارنة بالسياسة الساذجة، وليس مجرد التنبؤ بالصحة. إذا لم يتمكن من التفوق على سياسة "عدم التصعيد مطلقاً"، فإنه لا يقدم أي فائدة من حيث التكلفة، بغض النظر عن الدقة الخام. تتجاهل المقاييس التقليدية مثل AUC البعد الاقتصادي لسلاسل النماذج.

2. "التصعيد دائماً" ليس هو السقف

افترضت التجربة أن النموذج المكلف لا يخطئ، حيث تم التعامل مع "استخدام النموذج الكبير دائماً" كحد أقصى. في الواقع، أفسد النموذج الأكبر أحياناً إجابات نجح النموذج الرخيص في تقديمها بشكل صحيح. يمكن للموجه المثالي الذي يعرف متى يلتزم بالنموذج الرخيص أن يتفوق على خط أساس "التصعيد دائماً" بنحو 4.2 نقطة في مقياس التكلفة المختار. وتظهر هذه الفجوة أن سقف أداء النموذج المكلف أقل مما كان يُفترض.

تصميم إشارات توجيه أفضل

تشير النتائج إلى ثلاثة اتجاهات عملية:

  • تضمين إشارات وقت التوليد. إن تزويد الموجه بالمخرجات الوسيطة للنموذج الرخيص (مسودته) يلتقط الصعوبة التي يخفيها الأمر وحده.
  • إعطاء الأولوية للميزات السطحية الخاصة بالمهمة. يمكن للمقاييس البسيطة — مثل الطول، أو وجود معاملات معينة، أو علامات نمط الكود — أن تكون أكثر قدرة على التنبؤ من التضمينات الدلالية العامة.
  • قياس النجاح بمقاييس تراعي التكلفة. بدلاً من الدقة المحضة أو AUC، قم بتقييم عدد الاستدعاءات المكلفة التي تم تجنبها مع الحفاظ على مستويات الجودة المستهدفة.

الخلاصة: الموجه الذي يعمل فقط على تحسين الدقة لا يمكنه ضمان توفير التكاليف؛ فالتوجيه الفعال يتطلب أدلة من وقت التوليد وتقييماً يراعي التكلفة.