sparse-attention மாதிரிகளுக்கான புதிய inference-time நுட்பமான PIVOT, மாதிரியின் weights-களை மாற்றாமலேயே indexer செலவை நான்கு மடங்கு வரை குறைக்கிறது மற்றும் ஒட்டுமொத்த latency-யை தோராயமாக 1.6× குறைக்கிறது. இது வினவல்களைக் (queries) குழுவாக்கி, ஒரு ஒற்றை "proxy" வினவல் மூலம் கடினமான பணிகளைச் செய்வதன் மூலம் செயல்படுகிறது.
ஏன் sparse attention 100 K tokens-இல் முடங்குகிறது
கணக்கீட்டுச் செலவைக் (compute) குறைவாக வைத்திருக்கும் அதே வேளையில், transformers மிக நீண்ட தொடர்களை (100 K tokens அல்லது அதற்கு மேல்) கவனிப்பதற்கு sparse attention வடிவமைக்கப்பட்டது. ஆனால் நடைமுறையில், தொடரின் நீளம் சில பத்தாயிரம் tokens-களைத் தாண்டும்போது, வாக்குறுதி அளிக்கப்பட்ட வேக அதிகரிப்பு காணாமல் போகிறது. இதற்குப் பொறுப்பான indexer தான், எந்த tokens ஒரு sparse pattern-இல் இருக்க வேண்டும் என்பதைத் தீர்மானிக்க ஒவ்வொரு query-யுடனும் ஒவ்வொரு token-ஐயும் ஒப்பிட்டு மதிப்பெண் வழங்குகிறது. இதன் வேலை O(L²) (L = sequence length) விகிதத்தில் அதிகரிக்கிறது, எனவே 100 K tokens-இல் indexer மட்டுமே இயக்க நேரத்தின் பெரும்பகுதியை ஆக்கிரமித்து, sparsity-யால் கிடைக்கும் பலனைத் தவிடுபொடியாக்கிவிடுகிறது.
PIVOT-ன் பின்னணியில் உள்ள இரண்டு அவதானிப்புகள்
அருகருகே உள்ள வினவல்கள் (adjacent queries) கிட்டத்தட்ட எப்போதும் ஒரே மாதிரியான top-k tokens-களையே தேர்ந்தெடுக்கின்றன—சுமார் 90% overlap உள்ளது என்பதை ஆராய்ச்சியாளர்கள் கண்டறிந்துள்ளனர். அதாவது, ஒரு ஒற்றை பிரதிநிதித்துவ வினவல் (representative query), அருகிலுள்ள வினவல்களின் முழுத் தொகுப்பிற்கும் பதிலாகச் செயல்பட்டு, பயனுள்ள candidate set-ஐத் தரவல்லது. PIVOT இதனைப் பின்வருமாறு பயன்படுத்துகிறது:
- ஒரு குறிப்பிட்ட எண்ணிக்கையிலான தொடர்ச்சியான வினவல்களைக் (size g) குழுவாக்குதல் (Grouping).
- ஒரு proxy வினவலை உருவாக்க அந்தத் தொகுப்பைப் சராசரி செய்தல் (Averaging).
- ஒவ்வொரு அசல் வினவலுக்கும் ஒருமுறை எனச் செய்வதற்குப் பதிலாக, proxy வினவலில் ஒரே ஒருமுறை indexer-ஐ இயக்குதல்.
- குழுவின் ஒவ்வொரு உறுப்பினருக்கும் proxy-யின் candidate list-ஐ மேம்படுத்துதல் (Refining).
இதன் கணிதச் செயல்பாடு O(L²) என்பதிலிருந்து O(L² / g) ஆகக் குறைகிறது. எட்டு அளவுள்ள குழுத் தொகுப்பைப் பயன்படுத்தும்போது, indexer எட்டு மடங்கு குறைவான முழு ஸ்கேன்களை (full scans) மட்டுமே செய்கிறது.
இரண்டு செயல்பாட்டு முறைகள்
- PIVOT-Refine, dense indexer-இன் துல்லியத்தைப் பராமரிக்கும் அதே வேளையில், indexer நிலையில் சுமார் மூன்று மடங்கு வேக அதிகரிப்பை வழங்குகிறது.
- PIVOT-Reuse, அதிகபட்ச throughput லாபத்திற்காகச் சிறிய அளவிலான துல்லியத்தை விட்டுக்கொடுத்து, வேகத்தை இன்னும் அதிகமாக உயர்த்துகிறது.
DeepSeek-V3.2 மற்றும் GLM-5.1 மாதிரிகளில் மேற்கொள்ளப்பட்ட Benchmarks, inference-இன் போது PIVOT பயன்படுத்தப்படும்போது, indexer வேகத்தில் நிலையான நான்கு மடங்கு அதிகரிப்பையும் மற்றும் end-to-end latency-யில் 1.6× குறைவையும் காட்டுகின்றன.
Plug-and-play செயலாக்கம்
இந்த நுட்பம், எந்தவொரு தற்போதுள்ள Dynamic Sparse Attention (DSA) pipeline-லும் இணைக்கக்கூடிய ஒரு reference implementation ஆக வந்துள்ளது. இதற்கு எடைகளில் (weights)
