رموز القوالب تُمكّن من تقليم الرؤوس
تسمح رموز القوالب (Template tokens) للباحثين بتقليص حوالي خمس عمل محولات الانتشار (diffusion transformers) دون الحاجة لإعادة التدريب؛ وتكون الخسارة في الجودة غير ملحوظة تقريبًا.
وجدت دراسة جديدة أن رموزًا معينة تعمل كسجلات دلالية (semantic registers)—وهي بمثابة "بالوعات" صغيرة تخزن المعلومات من المطالبة (prompt). ومن خلال تتبع رؤوس الانتباه (attention heads) التي تركز بشكل أكبر على هذه السجلات، قام المؤلفون بحذف تلك الرؤوس، مما أدى إلى تقليص عمليات الفاصلة العائمة (FLOPs) الخاصة بالانتباه في النموذج بنسبة 20% تقريبًا، بينما انخفض مقياس GenEval بمقدار 1.4 نقطة فقط.
لماذا يهم التقليم نماذج الانتشار
تُشغل محولات الانتشار العديد من مولدات النصوص إلى صور. وتهيمن طبقات الانتباه الخاصة بها على ميزانية الحوسبة أثناء الاستدلال (inference)، لذا فإن أي تقليص متواضع سيسرع من عملية توليد الصور ويقلل من استهلاك الطاقة. عادةً ما تفحص حيل التقليم الحالية مقدار الأوزان أو إشارات التدرج (gradient signals)، بافتراض أن كل رأس يساهم بالتساوي. وهذا النهج الشامل إما يترك الكثير من العمل دون مساس، أو يضر بجودة المخرجات عند إزالة الكثير من الرؤوس.
خدعة رمز القالب
لاحظ الباحثون أن حفنة من الرموز تجمع باستمرار إشارات على مستوى الكائن من المطالبة النصية. وتتصرف "رموز القوالب" هذه مثل سجلات مخصصة: فهي تمتص دلالات المطالبة وتنقلها إلى المراحل التالية، بينما يستمر بقية النموذج في معالجة التفاصيل المرئية.
خطوات عملية التقليم مباشرة:
- إجراء تمريرة أمامية (forward pass) على عدد قليل من المطالبات وتسجيل درجات الانتباه.
- تحديد الرؤوس التي تشير أقوى اتصالاتها إلى رموز القوالب.
- إزالة تلك الرؤوس من النموذج؛ دون الحاجة إلى بيانات إضافية، أو ضبط دقيق (fine-tuning)، أو تغييرات هيكلية.
نظرًا لأن الرؤوس التي تمت إزالتها كانت تنقل بشكل أساسي نفس معلومات المطالبة التي تمتلكها رموز القوالب بالفعل، فإن تدفق الإشارة الإجمالي يظل سليمًا.
أرقام تتحدث عن نفسها
تؤدي عملية تطبيق هذه الطريقة على محولات الانتشار القياسية من النص إلى الصورة إلى ما يلي:
- تقليص بنسبة ≈ 20% في عمليات FLOPs الخاصة بالانتباه، مما يسرع الاستدلال مباشرة.
- انخفاض في درجة GenEval بمقدار 1.4 نقطة فقط، وهو انخفاض طفيف بالنظر إلى المكاسب الحوسبية.
- القدرة على تقليم 20%–30% من الرؤوس مع الحفاظ على الدقة المرئية دون تغيير كبير.
في المقابل، غالبًا ما تتسبب عمليات قطع نسبة الرؤوس الساذجة في انخفاضات أكبر في الجودة، لأنها تتخلص بشكل عشوائي من مسارات خلط السياق المفيدة.
القيود والأسئلة المفتوحة
يركز هذا العمل حصريًا على محولات الانتشار التي تترجم المطالبات النصية إلى صور. ولا يزال من غير الواضح ما إذا كانت ظاهرة رمز القالب نفسها تظهر في النماذج اللغوية الأكبر أو البنيات متعددة الوسائط الأخرى. فإذا كانت السجلات غائبة أو تتصرف بشكل مختلف، فقد تفقد وصفة التقليم ميزتها.
نقطة حذر أخرى هي الانخفاض المتواضع في الجودة.
ما يجب مراقبته لاحقًا
من المرجح أن تبحث الأبحاث المستقبلية في:
- ما إذا كانت رموز القوالب تظهر بشكل طبيعي في عائلات المحولات الأخرى.
- كيفية توسع هذا النهج مع حجم النموذج وحجم بيانات التدريب.
الخلاصة: من خلال استغلال الدور الخفي لرموز القوالب كسجلات دلالية، وجد الباحثون طريقة جراحية لتقليم محولات الانتشار — حيث يتم تقليص حوالي خمس العمل مع الحفاظ على جودة المخرجات سليمة تقريبًا. قد يجعل هذا الصور المولدة بواسطة الذكاء الاصطناعي أسرع وأرخص دون الحاجة إلى إعادة تدريب مكلفة.
