PIVOT, sparse-attention मॉडेल्ससाठी एक नवीन inference-time ट्रिक आहे, जी मॉडेलचे weights न बदलता indexer चा खर्च चार पटीने कमी करते आणि एकूण latency साधारणपणे 1.6× ने कमी करते. हे queries एकत्रित करून (grouping) आणि एका सिंगल “proxy” query द्वारे मुख्य काम करून कार्य करते.

Sparse attention १००K tokens वर का मंदावते

Sparse attention चा उद्देश transformers ला खूप लांब sequences—उदा. १००K tokens किंवा त्यापेक्षा जास्त—पाहण्यास सक्षम करणे आणि त्याच वेळी compute खर्च परवडण्याजोगा ठेवणे हा होता. प्रत्यक्षात, एकदा का sequence काही हजार tokens च्या पुढे गेली की, अपेक्षित वेग (speed-up) कमी होत जातो. यासाठी मुख्यत्वे indexer कारणीभूत असतो, जो कोणत्या tokens चा sparse pattern मध्ये समावेश असावा हे ठरवण्यासाठी प्रत्येक token ला प्रत्येक query सोबत score करतो. याचे काम O(L²) (L = sequence length) प्रमाणे वाढते, त्यामुळे १००K tokens असताना केवळ indexer मुळे runtime वाढतो आणि sparsity चा कोणताही फायदा मिळत नाही.

PIVOT च्यामागील दोन निरीक्षणे

संशोधकांना असे आढळले की शेजारील queries जवळजवळ नेहमीच सारखेच top-k tokens निवडतात—यात सुमारे ९०% overlap असते. याचा अर्थ असा की, एक सिंगल representative query शेजारील queries च्या संपूर्ण बॅचची जागा घेऊ शकते आणि तरीही उपयुक्त candidate set शोधू शकते. PIVOT याचा फायदा खालीलप्रमाणे घेते:

  1. Grouping ठराविक संख्येने सलग queries चे (size g).
  2. Averaging त्या group चे करून एक proxy query तयार करणे.
  3. प्रत्येक मूळ query साठी एकदा indexer चालवण्याऐवजी, proxy वर एकदाच indexer चालवणे.
  4. Group मधील प्रत्येक सदस्यासाठी proxy च्या candidate list ला Refine करणे.

यामुळे गणितीय गुंतागुंत O(L²) वरून O(L² / g) पर्यंत कमी होते. आठच्या group size सह, indexer ला आठ पटीने कमी full scans करावे लागतात.

दोन ऑपरेटिंग मोड

  • PIVOT-Refine indexer stage वर सुमारे तीन पटीने वेग वाढवताना dense indexer ची अचूकता (accuracy) कायम ठेवते.
  • PIVOT-Reuse जास्तीत जास्त throughput मिळवण्यासाठी थोडी अचूकता कमी करून वेग आणखी वाढवते.

DeepSeek-V3.2 आणि GLM-5.1 मॉडेल्सवरील benchmarks असे दर्शवतात की, inference दरम्यान PIVOT वापरल्यास indexer चा वेग सातत्याने चार पटीने वाढतो आणि end-to-end latency मध्ये 1.6× घट होते.

Plug-and-play implementation

ही पद्धत एक reference implementation म्हणून उपलब्ध आहे, जी कोणत्याही अस्तित्वात असलेल्या Dynamic Sparse Attention (DSA) pipeline मध्ये वापरता येते. यासाठी weights मध्ये कोणताही बदल करण्याची गरज नाही, त्यामुळे standard sparse-attention पद्धतीने प्रशिक्षित केलेली मॉडेल्स न बदलता वापरता येतात. एकमेव अडचण म्हणजे reference code generic GPU kernels वर चालतो; पूर्ण वेग मिळवण्यासाठी production deployments मध्ये hand-tuned Triton किंवा CUDA kernels ची आवश्यकता असेल.

Trade-offs कसे आहेत

PIVOT-Reuse चा वेग वाढवण्याचा फायदा attention quality मध्ये थोड्या प्रमाणात घट आणतो, जे अचूक token selection वर अत्यंत संवेदनशील असलेल्या कामांसाठी महत्त्वाचे ठरू शकते. टीम्सना ही घट त्यांच्या latency budget च्या संदर्भात तपासावी लागेल. याव्यतिरिक्त, custom kernels ची गरज असल्यामुळे ज्या संस्थांकडे GPU-kernel चे कौशल्य नाही, त्यांच्यासाठी engineering overhead वाढू शकतो.

पुढे काय पाहायचे

PIVOT हे दर्शवते की कामाची हुशार पुनर्रचना (re-ordering)—queries चे grouping करणे आणि proxy scan शेअर करणे—खरोखरच लांब contexts साठी sparse attention चे आश्वासन पुन्हा जिवंत करू शकते, आणि retraining च्या खर्चाशिवाय प्रत्यक्ष वेग वाढवून देऊ शकते.