ടെംപ്ലേറ്റ് ടോക്കണുകൾ ഹെഡ് പ്രൂണിംഗ് (Head Pruning) സാധ്യമാക്കുന്നു

റീട്രെയിനിംഗ് (retraining) കൂടാതെ തന്നെ ഒരു ഡിഫ്യൂഷൻ ട്രാൻസ്ഫോർമറിന്റെ (diffusion transformer) പ്രവർത്തനഭാരത്തിന്റെ ഏകദേശം അഞ്ചിലൊന്ന് ഭാഗം കുറയ്ക്കാൻ ടെംപ്ലേറ്റ് ടോക്കണുകൾ ഗവേഷകരെ സഹായിക്കുന്നു; ഗുണനിലവാരത്തിൽ പ്രകടമായ കുറവ് സംഭവിക്കുന്നില്ല.

ചില ടോക്കണുകൾ സെമാന്റിക് രജിസ്റ്ററുകളായി (semantic registers) പ്രവർത്തിക്കുന്നുണ്ടെന്ന് പുതിയൊരു പഠനം കണ്ടെത്തി—അതായത് പ്രോംപ്റ്റിൽ നിന്നുള്ള വിവരങ്ങൾ ശേഖരിച്ചു വെക്കുന്ന ചെറിയ "സിങ്കുകൾ" (sinks) പോലെയാണവ. ഏത് അറ്റൻഷൻ ഹെഡുകളാണ് (attention heads) ഈ രജിസ്റ്ററുകളിൽ കൂടുതൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നത് എന്ന് കണ്ടെത്തുന്നതിലൂടെ, ഗവേഷകർ ആ ഹെഡുകൾ ഒഴിവാക്കുന്നു. ഇത് മോഡലിന്റെ അറ്റൻഷൻ FLOPs-ൽ ഏകദേശം 20% കുറവുണ്ടാക്കുന്നുണ്ടെങ്കിലും, GenEval ബെഞ്ച്മാർക്കിൽ വെറും 1.4 പോയിന്റുകളുടെ കുറവ് മാത്രമേ ഉണ്ടാകുന്നുള്ളൂ.

ഡിഫ്യൂഷൻ മോഡലുകളിൽ പ്രൂണിംഗ് (pruning) പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്?

പല ടെക്സ്റ്റ്-ടു-ഇമേജ് (text-to-image) ജനറേറ്ററുകളുടെയും കരുത്ത് ഡിഫ്യൂഷൻ ട്രാൻസ്ഫോർമറുകളാണ്. ഇൻഫറൻസ് (inference) സമയത്ത് ഇവയുടെ അറ്റൻഷൻ ലെയറുകളാണ് കൂടുതൽ കമ്പ്യൂട്ട് ശേഷി ഉപയോഗിക്കുന്നത്, അതിനാൽ ചെറിയ കുറവുകൾ പോലും ഇമേജ് ജനറേഷൻ വേഗത്തിലാക്കാനും ഊർജ്ജ ഉപഭോഗം കുറയ്ക്കാനും സഹായിക്കും. നിലവിലുള്ള പ്രൂണിംഗ് രീതികൾ സാധാരണയായി എല്ലാ ഹെഡുകളും തുല്യമായ സംഭാവന നൽകുന്നു എന്ന് കരുതി വെയിറ്റ് മാഗ്നിറ്റ്യൂഡ് (weight magnitude) അല്ലെങ്കിൽ ഗ്രേഡിയന്റ് സിഗ്നലുകൾ പരിശോധിക്കുന്നു. എന്നാൽ ഇത്തരത്തിലുള്ള പൊതുവായ സമീപനം ഒന്നുകിൽ അനാവശ്യമായ ജോലിഭാരം മാറ്റാതെ വിടുന്നു, അല്ലെങ്കിൽ കൂടുതൽ ഹെഡുകൾ നീക്കം ചെയ്യുമ്പോൾ ഔട്ട്പുട്ടിന്റെ ഗുണനിലവാരത്തെ ബാധിക്കുന്നു.

ടെംപ്ലേറ്റ്-ടോക്കൺ വിദ്യ

ടെക്സ്റ്റ് പ്രോംപ്റ്റിൽ നിന്ന് ഒബ്‌ജക്റ്റ് ലെവൽ സൂചനകൾ (object-level cues) കുറച്ച് ടോക്കണുകൾ സ്ഥിരമായി ശേഖരിക്കുന്നതായി ഗവേഷകർ നിരീക്ഷിച്ചു. ഈ "ടെംപ്ലേറ്റ് ടോക്കണുകൾ" പ്രത്യേക രജിസ്റ്ററുകളെപ്പോലെ പ്രവർത്തിക്കുന്നു: അവ പ്രോംപ്റ്റിന്റെ സെമാന്റിക്സ് (semantics) ഉൾക്കൊള്ളുകയും അവ അടുത്ത ഘട്ടങ്ങളിലേക്ക് കൈമാറുകയും ചെയ്യുന്നു, അതേസമയം മോഡലിന്റെ ബാക്കി ഭാഗം വിഷ്വൽ വിവരങ്ങൾ പ്രോസസ്സ് ചെയ്തുകൊണ്ടിരിക്കുന്നു.

പ്രൂണിംഗ് പ്രക്രിയ ലളിതമാണ്:

  1. കുറച്ച് പ്രോംപ്റ്റുകളിൽ ഫോർവേഡ് പാസ് (forward pass) നടത്തി അറ്റൻഷൻ സ്കോറുകൾ രേഖപ്പെടുത്തുക.
  2. ടെംപ്ലേറ്റ് ടോക്കണുകളുമായി ഏറ്റവും ശക്തമായ ബന്ധമുള്ള ഹെഡുകളെ തിരിച്ചറിയുക.
  3. ആ ഹെഡുകളെ മോഡലിൽ നിന്ന് നീക്കം ചെയ്യുക; ഇതിനായി അധിക ഡാറ്റയോ, ഫൈൻ ട്യൂണിംഗോ (fine-tuning), ആർക്കിടെക്ചറൽ മാറ്റങ്ങളോ ആവശ്യമില്ല.

നീക്കം ചെയ്ത ഹെഡുകൾ പ്രധാനമായും ടെംപ്ലേറ്റ് ടോക്കണുകൾ നേരത്തെ തന്നെ കൈവശം വെച്ചിട്ടുള്ള പ്രോംപ്റ്റ് വിവരങ്ങൾ തന്നെയാണ് കൈമാറിയിരുന്നത് എന്നതുകൊണ്ട്, മൊത്തത്തിലുള്ള സിഗ്നൽ ഫ്ലോ (signal flow) തടസ്സപ്പെടാതെ നിലനിൽക്കുന്നു.

വസ്തുതകൾ വ്യക്തമാക്കുന്ന കണക്കുകൾ

ഈ രീതി സാധാരണ ടെക്സ്റ്റ്-ടു-ഇമേജ് ഡിഫ്യൂഷൻ ട്രാൻസ്ഫോർമറുകളിൽ പ്രയോഗിക്കുമ്പോൾ ലഭിക്കുന്ന ഫലങ്ങൾ:

  • അറ്റൻഷൻ FLOPs-ൽ ഏകദേശം 20% കുറവ്, ഇത് ഇൻഫറൻസ് വേഗത നേരിട്ട് വർദ്ധിപ്പിക്കുന്നു.
  • GenEval സ്കോറിൽ വെറും 1.4 പോയിന്റുകളുടെ കുറവ് മാത്രം, കമ്പ്യൂട്ട് ലാഭവുമായി താരതമ്യം ചെയ്യുമ്പോൾ ഇത് വളരെ കുറവാണ്.
  • വിഷ്വൽ ഫിഡിലിറ്റി (visual fidelity) വലിയ മാറ്റമില്ലാതെ തന്നെ ഹെഡുകളുടെ 20%–30% വരെ പ്രൂൺ ചെയ്യാൻ സാധിക്കുന്നു.

ഇതിനു വിപരീതമായി, ഹെഡുകളുടെ ശതമാനം നോക്കി വെറുതെ കുറയ്ക്കുന്നത് ഗുണനിലവാരത്തിൽ വലിയ ഇടിവുണ്ടാക്കാൻ കാരണമാകുന്നു, കാരണം അവ ഉപയോഗപ്രദമായ കോൺടെക്സ്റ്റ് മിക്സിംഗ് പാതകളെ (context-mixing pathways) തിരിച്ചറിയാതെ ഒഴിവാക്കുന്നു.

പരിമിതികളും തുറന്ന ചോദ്യങ്ങളും

ടെക്സ്റ്റ് പ്രോംപ്റ്റുകളെ ചിത്രങ്ങളാക്കി മാറ്റുന്ന ഡിഫ്യൂഷൻ ട്രാൻസ്ഫോർമറുകളിൽ മാത്രമാണ് ഈ പഠനം ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നത്. ഇതേ ടെംപ്ലേറ്റ്-ടോക്കൺ പ്രതിഭാസം വലിയ ലാംഗ്വേജ് മോഡലുകളിലോ (language models) മറ്റ് മൾട്ടിമോഡൽ ആർക്കിടെക്ചറുകളിലോ ഉണ്ടാകുമോ എന്നത് ഇപ്പോഴും വ്യക്തമല്ല. രജിസ്റ്ററുകൾ ഇല്ലെങ്കിലോ അവ വ്യത്യസ്തമായി പ്രവർത്തിച്ചാലോ, ഈ പ്രൂണിംഗ് രീതിയുടെ ഫലപ്രാപ്തി കുറയാൻ സാധ്യതയുണ്ട്.

ഗുണനിലവാരത്തിലുണ്ടാകുന്ന ചെറിയ കുറവും ഒരു ശ്രദ്ധാകേന്ദ്രമാണ്.

ഇനി എന്താണ് ശ്രദ്ധിക്കേണ്ടത്?

ഭാവി ഗവേഷണങ്ങൾ താഴെ പറയുന്നവയിൽ ശ്രദ്ധ കേന്ദ്രീകരിച്ചേക്കാം:

  • മറ്റ് ട്രാൻസ്ഫോർമർ കുടുംബങ്ങളിൽ ടെംപ്ലേറ്റ് ടോക്കണുകൾ സ്വാഭാവികമായി ഉണ്ടാകുന്നുണ്ടോ എന്നത്.
  • മോഡലിന്റെ വലിപ്പവും ട്രെയിനിംഗ് ഡാറ്റയുടെ അളവും അനുസരിച്ച് ഈ രീതി എത്രത്തോളം ഫലപ്രദമാകുന്നു എന്നത്.

ചുരുക്കത്തിൽ: ടെംപ്ലേറ്റ് ടോക്കണുകൾ സെമാന്റിക് രജിസ്റ്ററുകളായി പ്രവർത്തിക്കുന്ന രഹസ്യമായ പങ്കിനെ പ്രയോജനപ്പെടുത്തിക്കൊണ്ട്, ഡിഫ്യൂഷൻ ട്രാൻസ്ഫോർമറുകളെ വളരെ കൃത്യതയോടെ കുറയ്ക്കാൻ (trim) ഗവേഷകർക്ക് കഴിഞ്ഞു—ഔട്ട്പുട്ട് ഗുണനിലവാരം നിലനിർത്തിക്കൊണ്ടുതന്നെ പ്രവർത്തനഭാരത്തിന്റെ അഞ്ചിലൊന്ന് ഭാഗം കുറയ്ക്കാൻ ഇതിലൂടെ സാധിക്കുന്നു. ഇത് വലിയ ചിലവുള്ള റീട്രെയിനിംഗ് ഇല്ലാതെ തന്നെ AI നിർമ്മിത ചിത്രങ്ങൾ വേഗത്തിലും കുറഞ്ഞ ചിലവിലും ലഭ്യമാക്കാൻ സഹായിച്ചേക്കാം.