टेम्पलेट टोकन्समुळे हेड प्रूनिंग (Head Pruning) शक्य होते

टेम्पलेट टोकन्समुळे संशोधकांना पुन्हा प्रशिक्षण (retraining) न देता डिफ्यूजन ट्रान्सफॉर्मरच्या कामाचा सुमारे पाचवा हिस्सा कमी करता येतो; यामुळे गुणवत्तेवर होणारा परिणाम नगण्य असतो.

एका नवीन अभ्यासातून असे दिसून आले आहे की काही विशिष्ट टोकन्स 'सिमँटिक रजिस्टर्स' (semantic registers) म्हणून काम करतात—हे प्रॉम्प्टमधील माहिती साठवून ठेवणारे लहान "सिंक्स" (sinks) आहेत. कोणते अटेंशन हेड्स (attention heads) या रजिस्टर्सवर सर्वाधिक लक्ष केंद्रित करतात, याचा मागोवा घेऊन संशोधकांनी ते हेड्स काढून टाकले आहेत, ज्यामुळे मॉडेलच्या अटेंशन FLOPs मध्ये सुमारे २०% घट झाली आहे, तर GenEval बेंचमार्कमध्ये केवळ १.४ अंकांची घट झाली आहे.

डिफ्यूजन मॉडेल्ससाठी प्रूनिंग का महत्त्वाचे आहे

डिफ्यूजन ट्रान्सफॉर्मर्स अनेक टेक्स्ट-टू-इमेज जनरेटर्सना शक्ती देतात. इन्फरन्स (inference) दरम्यान त्यांच्या अटेंशन लेयर्सचा कम्प्युट बजेटमध्ये मोठा वाटा असतो, त्यामुळे थोडी जरी घट झाली तरी इमेज जनरेशनचा वेग वाढतो आणि ऊर्जेचा वापर कमी होतो. सध्याच्या प्रूनिंग पद्धती सहसा वेट मॅग्निट्यूड (weight magnitude) किंवा ग्रेडियंट सिग्नल्स तपासतात, ज्यामध्ये प्रत्येक हेड समान योगदान देते असे मानले जाते. हा सर्वसमावेशक दृष्टिकोन एकतर खूप जास्त काम न बदलता सोडतो किंवा खूप जास्त हेड्स काढून टाकल्यास आउटपुटच्या गुणवत्तेला हानी पोहोचवतो.

टेम्पलेट-टोकन ट्रिक

संशोधकांनी असे निरीक्षण केले की काही मोजके टोकन्स टेक्स्ट प्रॉम्प्टमधून सातत्याने ऑब्जेक्ट-लेव्हल संकेत (object-level cues) गोळा करतात. हे "टेम्पलेट टोकन्स" समर्पित रजिस्टर्सप्रमाणे काम करतात: ते प्रॉम्प्टचे अर्थ (semantics) शोषून घेतात आणि ते पुढे पाठवतात, तर मॉडेलचा उर्वरित भाग व्हिज्युअल तपशीलांवर प्रक्रिया करणे सुरू ठेवतो.

प्रूनिंगची प्रक्रिया सोपी आहे:

  1. काही प्रॉम्प्ट्सवर फॉरवर्ड पास (forward pass) चालवा आणि अटेंशन स्कोअर रेकॉर्ड करा.
  2. ज्या हेड्सचे सर्वात मजबूत कनेक्शन टेम्पलेट टोकन्सकडे आहेत, त्यांची ओळख पटवा.
  3. ते हेड्स मॉडेलमधून काढून टाका; यासाठी अतिरिक्त डेटा, फाईन-ट्यूनिंग किंवा आर्किटेक्चरल बदलांची आवश्यकता नाही.

काढून टाकलेले हेड्स प्रामुख्याने तीच प्रॉम्प्ट माहिती पोहोचवत होते जी टेम्पलेट टोकन्समध्ये आधीच असते, त्यामुळे एकूण सिग्नल फ्लो (signal flow) अखंड राहतो.

आकडेवारी जे स्पष्ट करते

मानक टेक्स्ट-टू-इमेज डिफ्यूजन ट्रान्सफॉर्मर्सना ही पद्धत लागू केल्यावर खालील परिणाम मिळतात:

  • अटेंशन FLOPs मध्ये ≈ २०% घट, ज्यामुळे इन्फरन्सचा वेग थेट वाढतो.
  • GenEval स्कोअरमध्ये केवळ १.४ अंकांची घट, कम्प्युटमधील फायद्याच्या तुलनेत ही घट नगण्य आहे.
  • व्हिज्युअल फिडेलिटी (visual fidelity) मोठ्या प्रमाणात न बदलता २०%–३०% हेड्स प्रून करण्याची क्षमता.

याउलट, साध्या पद्धतीने हेड्सच्या टक्केवारीमध्ये कपात केल्यास अनेकदा गुणवत्तेत मोठी घट होते, कारण त्यामध्ये उपयुक्त कॉन्टेक्स्ट-मिक्सिंग पाथवेज (context-mixing pathways) विनाकारण काढून टाकले जातात.

मर्यादा आणि उघड्या प्रश्नांवर

हे कार्य केवळ टेक्स्ट प्रॉम्प्टचे इमेजमध्ये रूपांतर करणाऱ्या डिफ्यूजन ट्रान्सफॉर्मर्सवर लक्ष केंद्रित करते. हे 'टेम्पलेट-टोकन' सारखेच वैशिष्ट्य मोठ्या लँग्वेज मॉडेल्समध्ये किंवा इतर मल्टीमोडल आर्किटेक्चरमध्ये दिसून येते का, हे अद्याप स्पष्ट नाही. जर रजिस्टर्स उपलब्ध नसतील किंवा वेगळ्या प्रकारे वागले, तर ही प्रूनिंग पद्धत प्रभावी ठरणार नाही.

गुणवत्तेतील किरकोळ घट ही देखील एक सावधगिरीची बाब आहे.

पुढे काय पाहावे

भविष्यातील संशोधन बहुधा खालील गोष्टींचा शोध घेईल:

  • इतर ट्रान्सफॉर्मर फॅमिलीमध्ये टेम्पलेट टोकन्स नैसर्गिकरित्या तयार होतात का.
  • मॉडेलचा आकार आणि ट्रेनिंग डेटाच्या प्रमाणासोबत ही पद्धत कशी स्केल होते.

थोडक्यात सांगायचे तर: टेम्पलेट टोकन्सची 'सिमँटिक रजिस्टर्स' म्हणून असलेली गुप्त भूमिका वापरून, संशोधकांनी डिफ्यूजन ट्रान्सफॉर्मर्सना कमी करण्याचा एक अचूक मार्ग शोधला आहे—आउटपुटची गुणवत्ता जवळपास कायम ठेवून कामाचा सुमारे पाचवा हिस्सा कमी केला आहे. यामुळे खर्चिक री-ट्रेनिंगशिवाय AI-जनरेटेड इमेज अधिक जलद आणि स्वस्त होऊ शकतात.