لماذا يبدو النموذج الجديد "أصعب"

طورت Google نموذج Gemini 3.8 Flash للوكلاء المستقلين الذين يتعين عليهم التفكير عبر عدة مراحل. وعلى عكس Gemini 3.7 Flash، الذي كان يجيب عادةً في تمريرة واحدة، يقوم 3.8 بتقسيم المشكلة إلى أسئلة فرعية، ويستدعي واجهات برمجة تطبيقات (APIs) خارجية، ويكرر العملية حتى يصل إلى النتيجة المرضية. وتحذر Google من أن هذا المجهود الذهني الإضافي يستهلك المزيد من الرموز (tokens)، خاصة عند ضبط إعداد "المجهود" (effort) على مستوى أعلى.

ويظهر تحليل مستقل أن رموز المخرجات لكل مهمة ترتفع بنسبة 30% تقريبًا مقارنة بـ 3.7 Flash، كما تزداد جولات التفاعل أيضًا. ونظرًا لأن رسوم الرمز الواحد تظل ثابتة، فإن التكلفة الفعلية ترتفع بنحو 40% للعديد من أعباء العمل في العالم الحقيقي.

معايير الأداء التي تهم المطورين

هذه المقايضة ليست مجرد مسألة نظرية. ففي اختبارات المواجهة المباشرة على معيار الهندسة البرمجية DeepSWE v1.1، تفوق Gemini 3.8 Flash على Fable 5 من Anthropic بشكل حاسم. كما تصدر النموذج معايير Vals Finance Agent V2 وHarvey’s Legal Agent، مما يثبت قدرته على التعامل مع الحسابات المالية المعقدة والاستدلال القانوني الدقيق.

وقد لخص جون إنيس، الرئيس التنفيذي لشركة Aigora.ai، هذه الميزة قائلاً: يقدم النموذج "جودة برمجة تضاهي Opus 5" بينما يعمل بجزء بسيط من التكلفة وبسرعة أعلى بشكل ملحوظ. واستشهد بحالات استخدام مثل إنشاء فيديوهات Remotion، حيث يساهم الاستدلال السريع وتوليد الكود المتطور في اختصار ساعات من مسارات الإنتاج.

التحول في اقتصاديات الذكاء الاصطناعي

اعتاد المطورون تقييم القدرة على تحمل التكاليف بناءً على سعر الرمز الواحد (price-per-token). لكن الوكلاء الذين يعملون عبر جولات متعددة ومعززين بالأدوات يقلبون هذا المقياس إلى السعر لكل مهمة ناجحة (price-per-successful-task). ومع Gemini 3.8 Flash، لم يعد سعر الرمز الأرخص يضمن فاتورة أقل إذا كان النموذج يستهلك رموزًا أكثر للوصول إلى النتيجة نفسها.

تضع Google هذا النموذج في منطقة وسطى بين النماذج الرائدة (frontier models) فائقة التكلفة وبين المولدات خفيفة الوزن ذات التمريرة الواحدة. ومن خلال تسميته "الذكاء عند الطلب" (intelligence-on-demand)، تشير الشركة إلى أنه يمكن للمطورين الاستفادة من قدرات استدلال أعلى دون زمن الاستجابة (latency) الذي يصاحب عادةً النماذج الأكبر والأبطأ. والمقايضة واضحة: المخرجات الأكثر تطورًا تعني عددًا إجماليًا أكبر من الرموز.

متى يجب البقاء على الإصدار الأقدم

يجب على الفرق التي تحتاج إلى قدرة عالية على التنبؤ بالتكاليف — خاصة تلك التي تشغل مهام دفعية (batch jobs) واسعة النطاق أو تعمل بهوامش ربح ضئيلة — الالتزام بـ Gemini 3.7 Flash. فالنموذج الأقدم لا يزال يوفر زمن استجابة منخفضًا واستهلاكًا مستقرًا للرموز، مما يجعل التنبؤ بالإنفاق الشهري أسهل.

ما يجب مراقبته لاحقًا

  • تسعير استدعاء الأدوات (Tool-call pricing):

الخلاصة

يُظهر Gemini 3.8 Flash أن الاستدلال الأعلى يمكن أن يصل إلى زمن استجابة بمستوى "Flash"، ولكنه يستهلك المزيد من الرموز في كل تفاعل. سيجد المطورون الذين يبنون وكلاء ذكاء اصطناعي متطورين ومتعددي الخطوات أن مكاسب الأداء مغرية، ومع ذلك، يجب عليهم تعديل ميزانياتهم لتغطية تكلفة الرموز الخفية. أما بالنسبة للآخرين، فيظل الإصدار الأقدم 3.7 Flash هو الخيار الأكثر أمانًا وقابلية للتنبؤ.