PIVOT ಎಂಬುದು ಸ್ಪಾರ್ಸ್-ಅಟೆನ್ಷನ್ ಮಾಡೆಲ್ಗಳಿಗಾಗಿ ಇರುವ ಹೊಸ ಇನ್ಫರೆನ್ಸ್-ಟೈಮ್ (inference-time) ತಂತ್ರವಾಗಿದ್ದು, ಇದು ಮಾಡೆಲ್ನ ತೂಕಗಳನ್ನು (weights) ಬದಲಾಯಿಸದೆಯೇ ಇಂಡೆಕ್ಸರ್ ವೆಚ್ಚವನ್ನು ನಾಲ್ಕು ಪಟ್ಟು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಒಟ್ಟಾರೆ ಲ್ಯಾಟೆನ್ಸಿಯನ್ನು (latency) ಸುಮಾರು 1.6× ರಷ್ಟು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ. ಇದು ಕ್ವೆರಿಗಳನ್ನು ಗುಂಪು ಮಾಡುವ ಮೂಲಕ ಮತ್ತು ಒಂದೇ ಒಂದು "ಪ್ರೊಕ್ಸಿ" (proxy) ಕ್ವೆರಿಯು ಹೆಚ್ಚಿನ ಕೆಲಸವನ್ನು ಮಾಡುವಂತೆ ಮಾಡುವ ಮೂಲಕ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ.
100K ಟೋಕನ್ಗಳಲ್ಲಿ ಸ್ಪಾರ್ಸ್ ಅಟೆನ್ಷನ್ ಏಕೆ ವಿಫಲವಾಗುತ್ತದೆ
ಸ್ಪಾರ್ಸ್ ಅಟೆನ್ಷನ್ ಅನ್ನು ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚವನ್ನು ಕೈಗೆಟುಕುವಂತೆ ಇರಿಸಿಕೊಳ್ಳುತ್ತಲೇ, ಟ್ರಾನ್ಸ್ಫಾರ್ಮರ್ಗಳು ಬಹಳ ಉದ್ದದ ಸರಣಿಗಳನ್ನು—ಅಂದರೆ 100K ಟೋಕನ್ಗಳು ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚು—ನೋಡಲು ಅನುವು ಮಾಡಿಕೊಡಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿತ್ತು. ಆದರೆ ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಸರಣಿಯು ಕೆಲವು ಹತ್ತಾರು ಸಾವಿರ ಟೋಕನ್ಗಳನ್ನು ಮೀರಿದ ತಕ್ಷಣ, ಭರವಸೆ ನೀಡಲಾದ ವೇಗವರ್ಧನೆಯು ಮಾಯವಾಗುತ್ತದೆ. ಇದಕ್ಕೆ ಕಾರಣ ಇಂಡೆಕ್ಸರ್. ಇದು ಯಾವ ಟೋಕನ್ಗಳು ಸ್ಪಾರ್ಸ್ ಪ್ಯಾಟರ್ನ್ನಲ್ಲಿ ಇರಬೇಕು ಎಂದು ನಿರ್ಧರಿಸಲು ಪ್ರತಿಯೊಂದು ಟೋಕನ್ ಅನ್ನು ಪ್ರತಿಯೊಂದು ಕ್ವೆರಿಯೊಂದಿಗೆ ಹೋಲಿಸಿ ಸ್ಕೋರ್ ಮಾಡುತ್ತದೆ. ಇದರ ಕೆಲಸವು O(L²) (L = ಸೀಕ್ವೆನ್ಸ್ ಉದ್ದ) ರಂತೆ ಬೆಳೆಯುತ್ತದೆ, ಆದ್ದರಿಂದ 100K ಟೋಕನ್ಗಳಿದ್ದಾಗ ಇಂಡೆಕ್ಸರ್ ಮಾತ್ರವೇ ರನ್ಟೈಮ್ ಅನ್ನು ನಿಯಂತ್ರಿಸುತ್ತದೆ ಮತ್ತು ಸ್ಪಾರ್ಸಿಟಿ (sparsity) ನಿಂದ ಸಿಗುವ ಯಾವುದೇ ಪ್ರಯೋಜನವನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ.
PIVOT ಹಿಂದಿರುವ ಎರಡು ಅವಲೋಕನಗಳು
ಪಕ್ಕದ ಕ್ವೆರಿಗಳು ಬಹುತೇಕ ಯಾವಾಗಲೂ ಒಂದೇ ರೀತಿಯ ಟಾಪ್-k ಟೋಕನ್ಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡುತ್ತವೆ—ಅಂದರೆ ಸುಮಾರು 90% ಓವರ್ಲ್ಯಾಪ್ ಇರುತ್ತದೆ ಎಂದು ಸಂಶೋಧಕರು ಕಂಡುಕೊಂಡಿದ್ದಾರೆ. ಇದರರ್ಥ, ಒಂದೇ ಒಂದು ಪ್ರತಿನಿಧಿ ಕ್ವೆರಿಯು ಪಕ್ಕದ ಕ್ವೆರಿಗಳ ಇಡೀ ಬ್ಯಾಚ್ ಅನ್ನು ಪ್ರತಿನಿಧಿಸಬಲ್ಲದು ಮತ್ತು ಉಪಯುಕ್ತವಾದ ಕ್ಯಾಂಡಿಡೇಟ್ ಸೆಟ್ ಅನ್ನು ನೀಡಬಲ್ಲದು. PIVOT ಇದನ್ನು ಈ ಕೆಳಗಿನಂತೆ ಬಳಸಿಕೊಳ್ಳುತ್ತದೆ:
- ನಿಗದಿತ ಸಂಖ್ಯೆಯ ಸತತ ಕ್ವೆರಿಗಳನ್ನು ಗುಂಪು ಮಾಡುವುದು (ಗಾತ್ರ g).
- ಪ್ರೊಕ್ಸಿ ಕ್ವೆರಿಯನ್ನು ರಚಿಸಲು ಗುಂಪಿನ ಸರಾಸರಿ (Averaging) ಮಾಡುವುದು.
- ಮೂಲ ಕ್ವೆರಿಯ ಪ್ರತಿಯೊಂದಕ್ಕೂ ಒಮ್ಮೆ ಮಾಡುವ ಬದಲು, ಪ್ರೊಕ್ಸಿಯ ಮೇಲೆ ಇಂಡೆಕ್ಸರ್ ಅನ್ನು ಒಮ್ಮೆ ಮಾತ್ರ ಚಲಾಯಿಸುವುದು.
- ಗುಂಪಿನ ಪ್ರತಿಯೊಬ್ಬ ಸದಸ್ಯನಿಗಾಗಿ ಪ್ರೊಕ್ಸಿಯ ಕ್ಯಾಂಡಿಡೇಟ್ ಪಟ್ಟಿಯನ್ನು ಪರಿಷ್ಕರಿಸುವುದು (Refining).
ಗಣಿತವು O(L²) ನಿಂದ O(L²/g) ಗೆ ಇಳಿಯುತ್ತದೆ. ಎಂಟು ಗುಂಪಿನ ಗಾತ್ರವಿದ್ದರೆ, ಇಂಡೆಕ್ಸರ್ ಎಂಟು ಪಟ್ಟು ಕಡಿಮೆ ಫುಲ್ ಸ್ಕ್ಯಾನ್ಗಳನ್ನು ಮಾಡುತ್ತದೆ.
ಎರಡು ಕಾರ್ಯಾಚರಣೆ ವಿಧಾನಗಳು
- PIVOT-Refine ಮಾಡೆಲ್ನ ನಿಖರತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳುತ್ತಲೇ ಇಂಡೆಕ್ಸರ್ ಹಂತದಲ್ಲಿ ಸುಮಾರು ಮೂರು ಪಟ್ಟು ವೇಗವನ್ನು ನೀಡುತ್ತದೆ.
- PIVOT-Reuse ಗರಿಷ್ಠ ಥ್ರೂಪುಟ್ (throughput) ಲಾಭಕ್ಕಾಗಿ ಸ್ವಲ್ಪ ನಿಖರತೆಯನ್ನು ಬಲಿಕೊಟ್ಟು, ವೇಗವನ್ನು ಇನ್ನಷ್ಟು ಹೆಚ್ಚಿಸುತ್ತದೆ.
DeepSeek-V3.2 ಮತ್ತು GLM-5.1 ಮಾಡೆಲ್ಗಳ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು, ಇನ್ಫರೆನ್ಸ್ ಸಮಯದಲ್ಲಿ PIVOT ಅನ್ನು ಅನ್ವಯಿಸಿದಾಗ ಇಂಡೆಕ್ಸರ್ ವೇಗವು ಸ್ಥಿರವಾಗಿ ನಾಲ್ಕು ಪಟ್ಟು ಹೆಚ್ಚಾಗುತ್ತದೆ ಮತ್ತು ಎಂಡ್-ಟು-ಎಂಡ್ (end-to-end) ಲ್ಯಾಟೆನ್ಸಿ 1.6× ರಷ್ಟು ಕಡಿಮೆಯಾಗುತ್ತದೆ ಎಂದು ತೋರಿಸುತ್ತವೆ.
ಪ್ಲಗ್-ಅಂಡ್-ಪ್ಲೇ (Plug-and-play) ಅನುಷ್ಠಾನ
ಈ ತಂತ್ರವು ಯಾವುದೇ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಡೈನಾಮಿಕ್ ಸ್ಪಾರ್ಸ್ ಅಟೆನ್ಷನ್ (DSA) ಪೈಪ್ಲೈನ್ಗೆ ಬಳಸಬಹುದಾದ ರೆಫರೆನ್ಸ್ ಇಂಪ್ಲಿಮೆಂಟೇಶನ್ ಆಗಿ ಬಂದಿದೆ. ಇದಕ್ಕೆ ಯಾವುದೇ ತೂಕದ (weight) ಬದಲಾವಣೆಗಳ ಅಗತ್ಯವಿಲ್ಲ, ಆದ್ದರಿಂದ ಸ್ಟ್ಯಾಂಡರ್ಡ್ ಸ್ಪಾರ್ಸ್-ಅಟೆನ್ಷನ್ ವಿಧಾನಗಳೊಂದಿಗೆ ತರಬೇತಿ ಪಡೆದ ಮಾಡೆಲ್ಗಳು ಯಾವುದೇ ಬದಲಾವಣೆಯಿಲ್ಲದೆ ಕೆಲಸ ಮಾಡುತ್ತವೆ. ಏಕೈಕ ಎಚ್ಚರಿಕೆ ಎಂದರೆ, ರೆಫರೆನ್ಸ್ ಕೋಡ್ ಸಾಮಾನ್ಯ GPU ಕರ್ನಲ್ಗಳ ಮೇಲೆ ಚಲಿಸುತ್ತದೆ; ಪೂರ್ಣ ವೇಗದ ಸಾಮರ್ಥ್ಯವನ್ನು ತಲುಪಲು ಪ್ರೊಡಕ್ಷನ್ ಡಿಪ್ಲಾಯ್ಮೆಂಟ್ಗಳಿಗೆ ಹ್ಯಾಂಡ್-ಟ್ಯೂನ್ ಮಾಡಲಾದ Triton ಅಥವಾ CUDA ಕರ್ನಲ್ಗಳ ಅಗತ್ಯವಿರುತ್ತದೆ.
ಟ್ರೇಡ್-ಆಫ್ಗಳು (Trade-offs) ಹೇಗಿವೆ
PIVOT-Reuse ನ ವೇಗದ ಪ್ರಯೋಜನವು ಅಟೆನ್ಷನ್ ಗುಣಮಟ್ಟದಲ್ಲಿ ಸಣ್ಣ ಇಳಿಕೆಯನ್ನು ತರುತ್ತದೆ, ಇದು ನಿಖರವಾದ ಟೋಕನ್ ಆಯ್ಕೆಗೆ ಹೆಚ್ಚು ಸೂಕ್ಷ್ಮವಾಗಿರುವ ಕಾರ್ಯಗಳಿಗೆ ಮುಖ್ಯವಾಗಬಹುದು. ತಂಡಗಳು ಆ ನಷ್ಟವನ್ನು ತಮ್ಮ ಲ್ಯಾಟೆನ್ಸಿ ಬಜೆಟ್ನೊಂದಿಗೆ ಹೋಲಿಸಿ ನೋಡಬೇಕಾಗುತ್ತದೆ. ಹೆಚ್ಚುವರಿಯಾಗಿ, ಕಸ್ಟಮ್ ಕರ್ನಲ್ಗಳ ಅಗತ್ಯವು GPU-ಕರ್ನಲ್ ಪರಿಣತಿ ಇಲ್ಲದ ಸಂಸ್ಥೆಗಳಿಗೆ ಇಂಜಿನಿಯರಿಂಗ್ ಹೊರೆ (overhead) ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
ಕೆಲಸದ ಚಾಣಾಕ್ಷತನದ ಮರು-ವ್ಯವಸ್ಥೆ—ಅಂದರೆ ಕ್ವೆರಿಗಳನ್ನು ಗುಂಪು ಮಾಡುವುದು ಮತ್ತು ಪ್ರೊಕ್ಸಿ ಸ್ಕ್ಯಾನ್ ಅನ್ನು ಹಂಚಿಕೊಳ್ಳುವುದು—ನಿಜವಾದ ಉದ್ದವಾದ ಕಾನ್ಟೆಕ್ಸ್ಟ್ಗಳಿಗಾಗಿ (contexts) ಸ್ಪಾರ್ಸ್ ಅಟೆನ್ಷನ್ನ ಭರವಸೆಯನ್ನು ಪುನರುಜ್ಜೀವನಗೊಳಿಸಬಲ್ಲದು ಮತ್ತು ಮರು-ತರಬೇತಿಯ ವೆಚ್ಚವಿಲ್ಲದೆ ಗಮನಾರ್ಹ ವೇಗದ ಲಾಭಗಳನ್ನು ನೀಡಬಲ್ಲದು ಎಂದು PIVOT ತೋರಿಸುತ್ತದೆ.
