ಟೆಂಪ್ಲೇಟ್ ಟೋಕನ್‌ಗಳು ಹೆಡ್ ಪ್ರೂನಿಂಗ್‌ಗೆ (Head Pruning) ಅನುವು ಮಾಡಿಕೊಡುತ್ತವೆ

ಟೆಂಪ್ಲೇಟ್ ಟೋಕನ್‌ಗಳು ಸಂಶೋಧಕರಿಗೆ ಮರುತರಬೇತಿ (retraining) ನೀಡದೆ ಡಿಫ್ಯೂಷನ್ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ನ ಕೆಲಸದ ಸುಮಾರು ಐದನೇ ಒಂದು ಭಾಗವನ್ನು ಕಡಿತಗೊಳಿಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತವೆ; ಇದರಿಂದ ಗುಣಮಟ್ಟದಲ್ಲಿ ಆಗುವ ಇಳಿಕೆಯು ಕೇವಲ ಗಮನಾರ್ಹವಲ್ಲದಷ್ಟು ಕಡಿಮೆ ಇರುತ್ತದೆ.

ಕೆಲವು ಟೋಕನ್‌ಗಳು 'ಸೆಮ್ಯಾಂಟಿಕ್ ರಿಜಿಸ್ಟರ್‌ಗಳಾಗಿ' (semantic registers) ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ—ಅಂದರೆ ಪ್ರಾಂಪ್ಟ್‌ನಿಂದ ಮಾಹಿತಿಯನ್ನು ಸಂಗ್ರಹಿಸುವ ಸಣ್ಣ "ಸಿಂಕ್‌ಗಳು" (sinks) ಎಂದು ಹೊಸ ಅಧ್ಯಯನವು ತಿಳಿಸಿದೆ. ಯಾವ ಅಟೆನ್ಷನ್ ಹೆಡ್‌ಗಳು (attention heads) ಈ ರಿಜಿಸ್ಟರ್‌ಗಳ ಮೇಲೆ ಹೆಚ್ಚು ಗಮನಹರಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಪತ್ತೆಹಚ್ಚುವ ಮೂಲಕ, ಲೇಖಕರು ಆ ಹೆಡ್‌ಗಳನ್ನು ತೆಗೆದುಹಾಕುತ್ತಾರೆ. ಇದರಿಂದ ಮಾಡೆಲ್‌ನ ಅಟೆನ್ಷನ್ FLOPs ಸುಮಾರು 20% ರಷ್ಟು ಕಡಿಮೆಯಾಗುತ್ತದೆ, ಆದರೆ GenEval ಬೆಂಚ್‌ಮಾರ್ಕ್ ಕೇವಲ 1.4 ಪಾಯಿಂಟ್‌ಗಳಷ್ಟು ಮಾತ್ರ ಕುಸಿಯುತ್ತದೆ.

ಡಿಫ್ಯೂಷನ್ ಮಾಡೆಲ್‌ಗಳಿಗೆ ಪ್ರೂನಿಂಗ್ ಏಕೆ ಮುಖ್ಯ

ಡಿಫ್ಯೂಷನ್ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ಗಳು ಅನೇಕ ಟೆಕ್ಸ್ಟ್-ಟು-ಇಮೇಜ್ (text-to-image) ಜನರೇಟರ್‌ಗಳಿಗೆ ಶಕ್ತಿಯನ್ನು ನೀಡುತ್ತವೆ. ಇನ್ಫರೆನ್ಸ್ (inference) ಸಮಯದಲ್ಲಿ ಅವುಗಳ ಅಟೆನ್ಷನ್ ಲೇಯರ್‌ಗಳು ಕಂಪ್ಯೂಟ್ ಬಜೆಟ್‌ನಲ್ಲಿ ಹೆಚ್ಚಿನ ಪಾಲನ್ನು ಹೊಂದಿದ್ದವು, ಆದ್ದರಿಂದ ಸಣ್ಣ ಕಡಿತಗಳು ಕೂಡ ಚಿತ್ರ ತಯಾರಿಕೆಯ ವೇಗವನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ ಮತ್ತು ಇಂಧನ ಬಳಕೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತವೆ. ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಪ್ರೂನಿಂಗ್ ತಂತ್ರಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಪ್ರತಿಯೊಂದು ಹೆಡ್ ಕೂಡ ಸಮಾನವಾಗಿ ಕೊಡುಗೆ ನೀಡುತ್ತದೆ ಎಂದು ಭಾವಿಸಿ, ವೇಯ್ಟ್ ಮ್ಯಾಗ್ನಿಟ್ಯೂಡ್ (weight magnitude) ಅಥವಾ ಗ್ರೇಡಿಯಂಟ್ ಸಿಗ್ನಲ್‌ಗಳನ್ನು ಪರಿಶೀಲಿಸುತ್ತವೆ. ಈ ಸಾಮಾನ್ಯ ವಿಧಾನವು ಹೆಚ್ಚಿನ ಕೆಲಸವನ್ನು ಹಾಗೆಯೇ ಬಿಡಬಹುದು ಅಥವಾ ಅತಿಯಾದ ಹೆಡ್‌ಗಳನ್ನು ತೆಗೆದುಹಾಕಿದಾಗ ಔಟ್‌ಪುಟ್ ಗುಣಮಟ್ಟಕ್ಕೆ ಹಾನಿ ಮಾಡಬಹುದು.

ಟೆಂಪ್ಲೇಟ್-ಟೋಕನ್ ತಂತ್ರ

ಕೆಲವು ಟೋಕನ್‌ಗಳು ಟೆಕ್ಸ್ಟ್ ಪ್ರಾಂಪ್ಟ್‌ನಿಂದ ವಸ್ತು-ಮಟ್ಟದ (object-level) ಸೂಚನೆಗಳನ್ನು ನಿರಂತರವಾಗಿ ಸಂಗ್ರಹಿಸುತ್ತವೆ ಎಂದು ಸಂಶೋಧಕರು ಗಮನಿಸಿದ್ದಾರೆ. ಈ "ಟೆಂಪ್ಲೇಟ್ ಟೋಕನ್‌ಗಳು" ಮೀಸಲಾದ ರಿಜಿಸ್ಟರ್‌ಗಳಂತೆ ವರ್ತಿಸುತ್ತವೆ: ಅವು ಪ್ರಾಂಪ್ಟ್‌ನ ಸೆಮ್ಯಾಂಟಿಕ್ಸ್ ಅನ್ನು ಹೀರಿಕೊಳ್ಳುತ್ತವೆ ಮತ್ತು ಉಳಿದ ಮಾಡೆಲ್ ದೃಶ್ಯ ವಿವರಗಳನ್ನು ಪ್ರೊಸೆಸ್ ಮಾಡುವಾಗ ಅವುಗಳನ್ನು ಮುಂದಿನ ಹಂತಗಳಿಗೆ ವರ್ಗಾಯಿಸುತ್ತವೆ.

ಪ್ರೂನಿಂಗ್ ಪ್ರಕ್ರಿಯೆಯು ಸರಳವಾಗಿದೆ:

  1. ಕೆಲವು ಪ್ರಾಂಪ್ಟ್‌ಗಳ ಮೇಲೆ ಫಾರ್ವರ್ಡ್ ಪಾಸ್ (forward pass) ನಡೆಸಿ ಅಟೆನ್ಷನ್ ಸ್ಕೋರ್‌ಗಳನ್ನು ದಾಖಲಿಸಿ.
  2. ಟೆಂಪ್ಲೇಟ್ ಟೋಕನ್‌ಗಳೊಂದಿಗೆ ಬಲವಾದ ಸಂಪರ್ಕ ಹೊಂದಿರುವ ಹೆಡ್‌ಗಳನ್ನು ಗುರುತಿಸಿ.
  3. ಆ ಹೆಡ್‌ಗಳನ್ನು ಮಾಡೆಲ್‌ನಿಂದ ತೆಗೆದುಹಾಕಿ; ಇದಕ್ಕೆ ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ಡೇಟಾ, ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಅಥವಾ ಆರ್ಕಿಟೆಕ್ಚರಲ್ ಬದಲಾವಣೆಗಳ ಅಗತ್ಯವಿಲ್ಲ.

ತೆಗೆದುಹಾಕಲಾದ ಹೆಡ್‌ಗಳು ಪ್ರಮುಖವಾಗಿ ಟೆಂಪ್ಲೇಟ್ ಟೋಕನ್‌ಗಳು ಈಗಾಗಲೇ ಹೊಂದಿರುವ ಅದೇ ಪ್ರಾಂಪ್ಟ್ ಮಾಹಿತಿಯನ್ನು ವರ್ಗಾಯಿಸುತ್ತಿದ್ದರಿಂದ, ಒಟ್ಟಾರೆ ಸಿಗ್ನಲ್ ಹರಿವು ಅಖಂಡವಾಗಿರುತ್ತದೆ.

ಅಂಕಿಅಂಶಗಳು ಸ್ವತಃ ಮಾತನಾಡುತ್ತವೆ

ಈ ವಿಧಾನವನ್ನು ಪ್ರಮಾಣಿತ ಟೆಕ್ಸ್ಟ್-ಟು-ಇಮೇಜ್ ಡಿಫ್ಯೂಷನ್ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ಗಳಿಗೆ ಅನ್ವಯಿಸಿದಾಗ ಸಿಗುವ ಫಲಿತಾಂಶಗಳು:

  • ಅಟೆನ್ಷನ್ FLOPs ನಲ್ಲಿ ≈ 20% ಕಡಿತ, ಇದು ನೇರವಾಗಿ ಇನ್ಫರೆನ್ಸ್ ವೇಗವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ.
  • GenEval ಸ್ಕೋರ್‌ನಲ್ಲಿ ಕೇವಲ 1.4 ಪಾಯಿಂಟ್‌ಗಳಷ್ಟು ಇಳಿಕೆ, ಕಂಪ್ಯೂಟ್ ಲಾಭಕ್ಕೆ ಹೋಲಿಸಿದರೆ ಇದು ಅತ್ಯಲ್ಪ ಕುಸಿತವಾಗಿದೆ.
  • ದೃಶ್ಯ ನಿಖರತೆಯನ್ನು (visual fidelity) ಬಹುತೇಕ ಬದಲಾಯಿಸದೆ 20%–30% ಹೆಡ್‌ಗಳನ್ನು ಪ್ರೂನ್ ಮಾಡುವ ಸಾಮರ್ಥ್ಯ.

ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, ಸಾಮಾನ್ಯ ಹೆಡ್-ಪರ್ಸೆಂಟ್ೇಜ್ ಕಡಿತಗಳು ಉಪಯುಕ್ತ ಕಾನ್ಟೆಕ್ಸ್ಟ್-ಮಿಕ್ಸಿಂಗ್ ಮಾರ್ಗಗಳನ್ನು ಅಸಂಗತವಾಗಿ ವಿಲೇವಾರಿ ಮಾಡುವುದರಿಂದ ಗುಣಮಟ್ಟದಲ್ಲಿ ದೊಡ್ಡ ಇಳಿಕೆಯನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ.

ಮಿತಿಗಳು ಮತ್ತು ಮುಕ್ತ ಪ್ರಶ್ನೆಗಳು

ಈ ಕೆಲಸವು ಕೇವಲ ಟೆಕ್ಸ್ಟ್ ಪ್ರಾಂಪ್ಟ್‌ಗಳನ್ನು ಚಿತ್ರಗಳಾಗಿ ಪರಿವರ್ತಿಸುವ ಡಿಫ್ಯೂಷನ್ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ಗಳ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದೆ. ಇದೇ ರೀತಿಯ ಟೆಂಪ್ಲೇಟ್-ಟೋಕನ್ ವಿದ್ಯಮಾನವು ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳಲ್ಲಿ (language models) ಅಥವಾ ಇತರ ಮಲ್ಟಿಮೋಡಲ್ ಆರ್ಕಿಟೆಕ್ಚರ್‌ಗಳಲ್ಲಿ ಕಂಡುಬರುತ್ತದೆಯೇ ಎಂಬುದು ಇನ್ನೂ ಅಸ್ಪಷ್ಟವಾಗಿದೆ. ಒಂದು ವೇಳೆ ರಿಜಿಸ್ಟರ್‌ಗಳು ಇಲ್ಲದಿದ್ದರೆ ಅಥವಾ ವಿಭಿನ್ನವಾಗಿ ವರ್ತಿಸಿದರೆ, ಈ ಪ್ರೂನಿಂಗ್ ವಿಧಾನವು ತನ್ನ ಪ್ರಭಾವವನ್ನು ಕಳೆದುಕೊಳ್ಳಬಹುದು.

ಗುಣಮಟ್ಟದಲ್ಲಿ ಆಗುವ ಸಣ್ಣ ಇಳಿಕೆಯು ಮತ್ತೊಂದು ಎಚ್ಚರಿಕೆಯ ಅಂಶವಾಗಿದೆ.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

ಭವಿಷ್ಯದ ಸಂಶೋಧನೆಗಳು ಬಹುಶಃ ಇವುಗಳನ್ನು ಪರೀಕ್ಷಿಸಬಹುದು:

  • ಇತರ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್ ಕುಟುಂಬಗಳಲ್ಲಿ ಟೆಂಪ್ಲೇಟ್ ಟೋಕನ್‌ಗಳು ನೈಸರ್ಗಿಕವಾಗಿ ಉದ್ಭವಿಸುತ್ತವೆಯೇ ಎಂಬುದು.
  • ಮಾಡೆಲ್ ಗಾತ್ರ ಮತ್ತು ತರಬೇತಿ ಡೇಟಾದ ಪ್ರಮಾಣಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಈ ವಿಧಾನವು ಹೇಗೆ ಹೊಂದಿಕೊಳ್ಳುತ್ತದೆ ಎಂಬುದು.

ಸಾರಾಂಶ: ಟೆಂಪ್ಲೇಟ್ ಟೋಕನ್‌ಗಳ ಗುಪ್ತ ಪಾತ್ರವನ್ನು ಸೆಮ್ಯಾಂಟಿಕ್ ರಿಜಿಸ್ಟರ್‌ಗಳಾಗಿ ಬಳಸಿಕೊಳ್ಳುವ ಮೂಲಕ, ಸಂಶೋಧಕರು ಡಿಫ್ಯೂಷನ್ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ಗಳನ್ನು ಕತ್ತರಿಸಲು ಒಂದು ನಿಖರವಾದ ಮಾರ್ಗವನ್ನು ಕಂಡುಕೊಂಡಿದ್ದಾರೆ—ಔಟ್‌ಪುಟ್ ಗುಣಮಟ್ಟವನ್ನು ಬಹುತೇಕ ಹಾಗೆಯೇ ಉಳಿಸಿಕೊಂಡು ಕೆಲಸದ ಸುಮಾರು ಐದನೇ ಒಂದು ಭಾಗವನ್ನು ಕಡಿತಗೊಳಿಸಬಹುದು. ಇದು ದುಬಾರಿ ಮರುತರಬೇತಿಯಿಲ್ಲದೆ AI-ಸೃಷ್ಟಿತ ಚಿತ್ರಗಳನ್ನು ವೇಗವಾಗಿ ಮತ್ತು ಅಗ್ಗವಾಗಿ ಮಾಡಲು ಸಹಾಯ ಮಾಡಬಹುದು.