டெம்ப்ளேட் டோக்கன்கள் ஹெட் ப்ரூனிங்கை (Head Pruning) சாத்தியமாக்குகின்றன

டெம்ப்ளேட் டோக்கன்கள் (Template tokens), மறுபயிற்சி (retraining) செய்யாமலேயே ஒரு டிஃப்யூஷன் டிரான்ஸ்பார்மரின் (diffusion transformer) வேலையை ஐந்தில் ஒரு பங்கு வரை குறைக்க ஆராய்ச்சியாளர்களுக்கு உதவுகின்றன; இதனால் தரத்தில் ஏற்படும் பாதிப்பு மிகக் குறைவாகவே இருக்கும்.

சில டோக்கன்கள் 'செமாண்டிக் ரெஜிஸ்டர்களாக' (semantic registers) செயல்படுகின்றன—அதாவது ப்ராம்ப்ட்டிலிருந்து (prompt) தகவல்களைச் சேகரிக்கும் சிறிய "சிங்க்குகள்" (sinks) போலச் செயல்படுகின்றன என்று ஒரு புதிய ஆய்வு கண்டறிந்துள்ளது. எந்தெந்த அட்டென்ஷன் ஹெட்ஸ்கள் (attention heads) இந்த ரெஜிஸ்டர்களில் அதிகம் கவனம் செலுத்துகின்றன என்பதைக் கண்காணிப்பதன் மூலம், அந்த ஹெட்ஸ்களை நீக்குவதன் மூலம், GenEval பெஞ்ச்மார்க் வெறும் 1.4 புள்ளிகள் மட்டுமே குறைய, மாடலின் அட்டென்ஷன் FLOPs-ஐ சுமார் 20% குறைக்க முடிந்தது.

டிஃப்யூஷன் மாடல்களுக்கு ப்ரூனிங் (pruning) ஏன் முக்கியமானது

டிஃப்யூஷன் டிரான்ஸ்பார்மர்கள் பல டெக்ஸ்ட்-டு-இமேஜ் (text-to-image) ஜெனரேட்டர்களுக்குத் தூணாக உள்ளன. இன்ஃபரன்ஸ் (inference) செயல்பாட்டின் போது அவற்றின் அட்டென்ஷன் லேயர்கள் (attention layers) அதிகப்படியான கணக்கீட்டுத் திறனை (compute budget) எடுத்துக்கொள்கின்றன, எனவே சிறிய அளவிலான குறைப்பு கூட பட உருவாக்க வேகத்தை அதிகரிப்பதோடு ஆற்றல் பயன்பாட்டையும் குறைக்கும். தற்போதுள்ள ப்ரூனிங் நுட்பங்கள் பொதுவாக ஒவ்வொரு ஹெட்டும் சமமாகப் பங்களிக்கிறது என்று கருதி, வெயிட் மேக்னிடியூட் (weight magnitude) அல்லது கிரேடியன்ட் சிக்னல்களை (gradient signals) ஆய்வு செய்கின்றன. இத்தகைய பொதுவான அணுகுமுறை, அதிகப்படியான வேலையை மாற்றமில்லாமல் விட்டுவிடுகின்றது அல்லது அதிகப்படியான ஹெட்ஸ்கள் நீக்கப்படும்போது வெளியீட்டுத் தரத்தைப் பாதிக்கிறது.

டெம்ப்ளேட்-டோக்கன் தந்திரம்

டெக்ஸ்ட் ப்ராம்ப்ட்டிலிருந்து சில குறிப்பிட்ட டோக்கன்கள் தொடர்ந்து பொருள்களின் குறிப்புகளை (object-level cues) சேகரிப்பதைக் ஆராய்ச்சியாளர்கள் கவனித்தனர். இந்த "டெம்ப்ளேட் டோக்கன்கள்" பிரத்யேக ரெஜிஸ்டர்களைப் போலச் செயல்படுகின்றன: அவை ப்ராம்ப்ட்டின் பொருளை (semantics) உள்வாங்கி அடுத்தடுத்த நிலைகளுக்குக் கடத்துகின்றன, அதே நேரத்தில் மாடலின் மற்ற பகுதிகள் காட்சி விவரங்களை (visual details) செயலாக்கத் தொடர்கின்றன.

ப்ரூனிங் செயல்முறை (pipeline) மிகவும் எளிமையானது:

  1. சில ப்ராம்ப்ட்களில் ஒரு ஃபார்வர்ட் பாஸ் (forward pass) செய்து அட்டென்ஷன் ஸ்கோர்களைப் பதிவு செய்யவும்.
  2. டெம்ப்ளேட் டோக்கன்களுடன் வலுவான தொடர்பைக் கொண்ட ஹெட்ஸ்களைக் கண்டறியவும்.
  3. அந்த ஹெட்ஸ்களை மாடலில் இருந்து நீக்கவும்; இதற்கு கூடுதல் தரவு, ஃபைன்-டியூனிங் (fine-tuning) அல்லது கட்டமைப்பு மாற்றங்கள் தேவையில்லை.

நீக்கப்பட்ட ஹெட்ஸ்கள் முக்கியமாக டெம்ப்ளேட் டோக்கன்கள் ஏற்கனவே வைத்திருக்கும் அதே ப்ராம்ப்ட் தகவல்களைத் தான் கடத்தின, எனவே ஒட்டுமொத்த சிக்னல் ஓட்டம் (signal flow) சிதையாமல் அப்படியே இருக்கும்.

புள்ளிவிவரங்கள் சொல்லும் உண்மை

நிலையான டெக்ஸ்ட்-டு-இமேஜ் டிஃப்யூஷன் டிரான்ஸ்பார்மர்களில் இந்த முறையைப் பயன்படுத்துவதன் மூலம் கிடைக்கும் முடிவுகள்:

  • அட்டென்ஷன் FLOPs-ல் ≈ 20% குறைப்பு, இது இன்ஃபரன்ஸ் வேகத்தை நேரடியாக அதிகரிக்கிறது.
  • GenEval ஸ்கோரில் வெறும் 1.4 புள்ளிகள் மட்டுமே குறைவு, கணக்கீட்டுத் திறன் அதிகரிப்பைக் கருத்தில் கொண்டால் இது மிகச்சிறிய அளவேயாகும்.
  • காட்சித் தரம் (visual fidelity) பெரிய அளவில் மாறாமல், 20%–30% ஹெட்ஸ்களைப் ப்ரூனிங் செய்யும் திறன்.

இதற்கு நேர்மாறாக, சாதாரணமான ஹெட்-சதவீதக் குறைப்புகள் (naïve head-percentage cuts), பயனுள்ள சூழல்-கலப்புப் பாதைகளை (context-mixing pathways) பாராமையின்றி நீக்குவதால், பெரும்பாலும் தரத்தில் பெரிய வீழ்ச்சியை ஏற்படுத்துகின்றன.

வரம்புகள் மற்றும் திறந்த கேள்விகள்

இந்த ஆய்வு டெக்ஸ்ட் ப்ராம்ப்ட்களைப் படங்களாக மாற்றும் டிஃப்யூஷன் டிரான்ஸ்பார்மர்களில் மட்டுமே கவனம் செலுத்துகிறது. இதே போன்ற டெம்ப்ளேட்-டோக்கன் நிகழ்வு பெரிய மொழி மாதிரிகளிலோ (language models) அல்லது பிற மல்டிமோடல் கட்டமைப்புகளிலோ (multimodal architectures) ஏற்படுமா என்பது இன்னும் தெளிவாகத் தெரியவில்லை. ஒருவேளை அந்த ரெஜிஸ்டர்கள் இல்லையென்றால் அல்லது வேறு விதமாகச் செயல்பட்டால், இந்த ப்ரூனிங் முறை தனது சிறப்பம்சத்தை இழக்கக்கூடும்.

தரத்தில் ஏற்படும் சிறிய வீழ்ச்சியும் ஒரு எச்சரிக்கைப் புள்ளியாகும்.

அடுத்து கவனிக்க வேண்டியவை

எதிர்கால ஆராய்ச்சிகள் பின்வருவனவற்றை ஆராயக்கூடும்:

  • மற்ற டிரான்ஸ்பார்மர் குடும்பங்களில் டெம்ப்ளேட் டோக்கன்கள் இயற்கையாக உருவாகின்றனவா என்பது குறித்து.
  • மாடலின் அளவு மற்றும் பயிற்சித் தரவின் அளவைப் பொறுத்து இந்த அணுகுமுறை எவ்வாறு செயல்படுகிறது என்பது குறித்து.

முக்கியக் கருத்து: டெம்ப்ளேட் டோக்கன்கள் 'செமாண்டிக் ரெஜிஸ்டர்களாக' செயல்படும் மறைமுகப் பங்கைப் பயன்படுத்துவதன் மூலம், டிஃப்யூஷன் டிரான்ஸ்பார்மர்களைத் துல்லியமான முறையில் செதுக்கும் முறையை ஆராய்ச்சியாளர்கள் கண்டறிந்துள்ளனர்—இது வெளியீட்டுத் தரத்தை கிட்டத்தட்ட அப்படியே வைத்திருக்கும் அதே வேளையில், வேலையை ஐந்தில் ஒரு பங்கு வரை குறைக்கிறது. இது அதிகப்படியான மறுபயிற்சி இன்றி, AI மூலம் உருவாக்கப்படும் படங்களை வேகமாகவும் மலிவாகவும் மாற்ற உதவும்.