PIVOT, स्पार्स-अटेंशन मॉडल्स के लिए एक नई इन्फरेंस-टाइम तकनीक है, जो मॉडल के वेट्स को बदले बिना इंडक्सर लागत को चार गुना तक कम कर देती है और कुल लेटेंसी को लगभग 1.6× तक घटा देती है। यह क्वेरीज को ग्रुप करने और एक सिंगल "प्रॉक्सी" क्वेरी से सारा मुख्य काम करवाने के सिद्धांत पर काम करती है।
स्पार्स अटेंशन 100K टोकन पर क्यों रुक जाता है
स्पार्स अटेंशन का उद्देश्य कंप्यूट को किफायती रखते हुए ट्रांसफॉर्मर्स को बहुत लंबे सीक्वेंस—जैसे 100K टोकन या उससे अधिक—देखने की अनुमति देना था। व्यवहार में, जैसे ही सीक्वेंस कुछ दस हजार टोकन से आगे बढ़ता है, वादा किया गया स्पीड-अप खत्म हो जाता है। इसका मुख्य कारण इंडक्सर है, जो यह तय करने के लिए कि कौन से टोकन स्पार्स पैटर्न में होने चाहिए, हर टोकन को हर क्वेरी के विरुद्ध स्कोर करता है। इसका काम O(L²) (L = सीक्वेंस की लंबाई) के रूप में स्केल होता है, इसलिए 100K टोकन पर केवल इंडक्सर ही रनटाइम पर हावी हो जाता है और स्पार्सिटी से मिलने वाले किसी भी लाभ को खत्म कर देता है।
PIVOT के पीछे के दो अवलोकन
शोधकर्ताओं ने पाया कि आस-पास की क्वेरीज लगभग हमेशा एक ही टॉप-k टोकन चुनती हैं—लगभग 90% ओवरलैप। इसका मतलब है कि एक सिंगल प्रतिनिधि क्वेरी पड़ोसियों के पूरे बैच की जगह ले सकती है और फिर भी एक उपयोगी कैंडिडेट सेट सामने ला सकती है। PIVOT इसका लाभ इस प्रकार उठाता है:
- ग्रुपिंग: लगातार आने वाली एक निश्चित संख्या में क्वेरीज को ग्रुप करना (साइज g)।
- एवरेजिंग: प्रॉक्सी क्वेरी बनाने के लिए ग्रुप का औसत निकालना।
- मूल क्वेरी के लिए एक-एक बार चलाने के बजाय प्रॉक्सी पर एक बार इंडक्सर चलाना।
- ग्रुप के प्रत्येक सदस्य के लिए प्रॉक्सी की कैंडिडेट लिस्ट को रिफाइन करना।
गणित O(L²) से घटकर O(L²/g) हो जाता है। आठ के ग्रुप साइज के साथ, इंडक्सर को आठ गुना कम फुल स्कैन करने पड़ते हैं।
दो ऑपरेटिंग मोड
- PIVOT-Refine इंडक्सर स्टेज पर लगभग तीन गुना स्पीड बूस्ट देते हुए डेंस इंडक्सर की सटीकता बनाए रखता है।
- PIVOT-Reuse अधिकतम थ्रूपुट लाभ के लिए थोड़ी सी सटीकता का त्याग करते हुए स्पीड को और भी आगे बढ़ा देता है।
DeepSeek-V3.2 और GLM-5.1 मॉडल्स पर बेंचमार्क दिखाते हैं कि इन्फरेंस के दौरान PIVOT लागू करने पर इंडक्सर की स्पीड में लगातार चार गुना वृद्धि और एंड-टू-एंड लेटेंसी में 1.6× की कमी आती है।
प्लग-एंड-प्ले इम्प्लीमेंटेशन
यह तकनीक एक रेफरेंस इम्प्लीमेंटेशन के रूप में आती है जिसे किसी भी मौजूदा Dynamic Sparse Attention (DSA) पाइपलाइन में इस्तेमाल किया जा सकता है। इसमें किसी वेट बदलाव की आवश्यकता नहीं होती है, इसलिए स्टैंडर्ड स्पार्स-अटेंशन रेसिपी के साथ प्रशिक्षित मॉडल बिना किसी बदलाव के काम करते हैं। एकमात्र शर्त यह है कि रेफरेंस कोड जेनेरिक GPU कर्नेल पर चलता है; पूरी स्पीड क्षमता प्राप्त करने के लिए प्रोडक्शन डिप्लॉयमेंट में हैंड-ट्यून्ड Triton या CUDA कर्नेल की आवश्यकता होगी।
ट्रेड-ऑफ (Trade-offs) कैसे दिखते हैं
PIVOT-Reuse का स्पीड एडवांटेज अटेंशन क्वालिटी में मामूली गिरावट के साथ आता है, जो उन कार्यों के लिए महत्वपूर्ण हो सकता है जो सटीक टोकन चयन के प्रति अत्यधिक संवेदनशील होते हैं। टीमों को उस नुकसान को अपने लेटेंसी बजट के साथ तौलना होगा। इसके अतिरिक्त, कस्टम कर्नेल की आवश्यकता उन संगठनों के लिए इंजीनियरिंग ओवरहेड बढ़ा देती है जिनके पास GPU-कर्नेल विशेषज्ञता नहीं है।
आगे क्या देखें
PIVOT दिखाता है कि काम का एक चतुर पुनर्गठन—क्वेरीज को ग्रुप करना और एक प्रॉक्सी स्कैन साझा करना—वाकई लंबे कॉन्टेक्स्ट के लिए स्पार्स अटेंशन के वादे को पुनर्जीवित कर सकता है, जो बिना रीट्रेनिंग की लागत के ठोस स्पीड लाभ प्रदान करता है।
