Laguna S 2.1 من Poolside: نموذج صغير مفتوح الأوزان يعيد تعريف الذكاء الاصطناعي للبرمجة
أطلقت Poolside نموذج Laguna S 2.1، وهو نموذج برمجة مدمج مفتوح الأوزان يتفوق بشكل ملحوظ على منافسين أكبر منه بكثير. ومن خلال إعطاء الأولوية للمثابرة الوكيلية (agentic persistence) والاستدلال على مجرد عدد المعلمات (parameters)، يمثل هذا الإصدار تحولاً جذرياً في كيفية تعاملنا مع تطوير نماذج اللغات الكبيرة (LLM) المتخصصة.
التفوق على عمالقة التريليون معلمة
يثبت Laguna S 2.1 أن حجم النموذج ليس المسار الوحيد للوصول إلى الذكاء. ففي اختبار Terminal-Bench 2.1، الذي يقيم مهام الطرفية (terminal) طويلة الأمد، حقق النموذج درجة 70.2% عند تفعيل "وضع التفكير" (thinking mode). ويضع هذا الأداء النموذج مباشرة خلف نموذج Hy3 الضخم من Tencent بقدرة 295B-A21B، ولكنه يتفوق على أنظمة مفتوحة الأوزان أكبر بكثير مثل DeepSeek-V4-Pro-Max و Nemotron 3 Ultra.
ويصبح التفاوت أكثر وضوحاً في اختبار Datacurve DeepSWE؛ حيث سجل Laguna S 2.1 نسبة 40.4%، وهي نتيجة مذهلة مقارنة بعدة نماذج مفتوحة الأوزان تتجاوز تريليون معلمة فشلت في كسر حاجز الـ 10%. كما يظهر النموذج أداءً متميزاً في اختبارات SWE-Bench Multilingual و SWE-Bench Pro و SWE Atlas، مما يثبت فائدته في سير عمل هندسة البرمجيات المعقدة.
قوة المثابرة و"التفكير"
يتمثل أحد الفوارق الجوهرية لنموذج Laguna S 2.1 في "وضع التفكير" (thinking mode)، الذي يحسن بشكل كبير معدلات النجاح من المحاولة الأولى (pass-at-one rates). فبدون خطوة الاستدلال هذه، تنخفض درجات Terminal-Bench من 70.2% إلى 60.4%، وتنخفض درجات DeepSWE من 40.4% إلى 16.5%.
وتجادل Poolside بأنها بدلاً من مجرد إضافة الذكاء، ركزت على تحسين "السلوكيات" التي تؤدي إلى القدرة. ويشمل ذلك زيادة التحقق، وتقليل الميل إلى اعتبار الافتراضات من المسلمات، وتعزيز المثابرة. وفي تجارب موثقة، قام النموذج ببناء محرك متصفح وظيفي من مجلد فارغ في 50 دقيقة فقط. والأكثر إثارة للإعجاب هو أنه أعاد اكتشاف حل لمسألة Erdos Problem #397 — وهي مسألة رياضية لم تُحل منذ عام 1975 — بشكل مستقل، باستخدام 40 خطوة استدلال فقط وبتكلفة لم تتجاوز 0.088 دولاراً.
التدريب الوكيلي على نطاق واسع
كانت القفزة في الأداء من إصدار XS 2.1 السابق إلى S 2.1 مدفوعة بالتدريب المكثف اللاحق (post-training) بدلاً من بيانات التدريب المسبق (pre-training) الجديدة. وقد استخدمت مرحلة التدريب الوكيلي 409,000 بيئة متميزة، تشمل:
- 83,000 بيئة لمهام الطرفية المحددة.
- 168,000 بيئة لسير عمل هندسة البرمجيات.
- 38,000 عملية إرسال كود (commits) من العالم الحقيقي مستمدة من حوالي 17,000 مستودع (repositories).
تمت عملية التدريب هذه بدعم من عنقود حوسبة ضخم يضم 4,096 وحدة معالجة رسومات Nvidia H200. ومن الجدير بالذكر أن S 2.1 هو أول نموذج في السلسلة يتم تدريبه باستخدام التعلم التعزيزي (reinforcement learning) بدقة FP8. ولمنع "اختراق المكافأة" (reward hacking) — حيث قد يبحث النموذج عن طلبات سحب (pull requests) موجودة بدلاً من حل المهمة — طبقت Poolside نظام "صندوق رمل" (sandbox) جديد لحظر الوصول إلى الشبكة بشكل انتقائي.
إمكانية الوصول والنشر
تم إصدار Laguna S 2.1 بموجب ترخيص OpenMDW 1.1 (المدعوم من Linux Foundation)، مما يسمح بالاستخدام التجاري والتعديل وإعادة التوزيع. يمكن للمطورين الوصول إلى النموذج عبر Hugging Face، أو من خلال الخدمات المستضافة مثل Baseten و Vercel AI Gateway و OpenRouter. ويقدم OpenRouter نافذة سياق (context window) كبيرة تبلغ 256K مجانًا، مع فئة مدفوعة تدعم ما يصل إلى مليون رمز (token).
النقاط الرئيسية
- الكفاءة فوق الحجم: يثبت Laguna S 2.1 أن السلوكيات الوكيلية مثل المثابرة والتحقق يمكن أن تسمح للنماذج الصغيرة بالتفوق على الأنظمة التي تحتوي على تريليون معلمة.
- الاستدلال أمر ضروري: يعد "وضع التفكير" أمراً بالغ الأهمية للمهام المعقدة، حيث يعزز الأداء بشكل كبير عبر جميع اختبارات البرمجة الرئيسية.
- نجاح التدريب الوكيلي: تنبع قوة النموذج من التدريب اللاحق واسع النطاق عبر 409,000 بيئة متخصصة وعمليات إرسال كود من العالم الحقيقي.
