sparse-attention மாதிரிகளுக்கான புதிய inference-time நுட்பமான PIVOT, மாதிரியின் weights-களை மாற்றாமலேயே indexer செலவை நான்கு மடங்கு வரை குறைக்கிறது மற்றும் ஒட்டுமொத்த latency-யை தோராயமாக 1.6× குறைக்கிறது. இது வினவல்களைக் (queries) குழுவாக்கி, ஒரு ஒற்றை "proxy" வினவல் மூலம் கடினமான பணிகளைச் செய்வதன் மூலம் செயல்படுகிறது.

ஏன் sparse attention 100 K tokens-இல் முடங்குகிறது

கணக்கீட்டுச் செலவைக் (compute) குறைவாக வைத்திருக்கும் அதே வேளையில், transformers மிக நீண்ட தொடர்களை (100 K tokens அல்லது அதற்கு மேல்) கவனிப்பதற்கு sparse attention வடிவமைக்கப்பட்டது. ஆனால் நடைமுறையில், தொடரின் நீளம் சில பத்தாயிரம் tokens-களைத் தாண்டும்போது, வாக்குறுதி அளிக்கப்பட்ட வேக அதிகரிப்பு காணாமல் போகிறது. இதற்குப் பொறுப்பான indexer தான், எந்த tokens ஒரு sparse pattern-இல் இருக்க வேண்டும் என்பதைத் தீர்மானிக்க ஒவ்வொரு query-யுடனும் ஒவ்வொரு token-ஐயும் ஒப்பிட்டு மதிப்பெண் வழங்குகிறது. இதன் வேலை O(L²) (L = sequence length) விகிதத்தில் அதிகரிக்கிறது, எனவே 100 K tokens-இல் indexer மட்டுமே இயக்க நேரத்தின் பெரும்பகுதியை ஆக்கிரமித்து, sparsity-யால் கிடைக்கும் பலனைத் தவிடுபொடியாக்கிவிடுகிறது.

PIVOT-ன் பின்னணியில் உள்ள இரண்டு அவதானிப்புகள்

அருகருகே உள்ள வினவல்கள் (adjacent queries) கிட்டத்தட்ட எப்போதும் ஒரே மாதிரியான top-k tokens-களையே தேர்ந்தெடுக்கின்றன—சுமார் 90% overlap உள்ளது என்பதை ஆராய்ச்சியாளர்கள் கண்டறிந்துள்ளனர். அதாவது, ஒரு ஒற்றை பிரதிநிதித்துவ வினவல் (representative query), அருகிலுள்ள வினவல்களின் முழுத் தொகுப்பிற்கும் பதிலாகச் செயல்பட்டு, பயனுள்ள candidate set-ஐத் தரவல்லது. PIVOT இதனைப் பின்வருமாறு பயன்படுத்துகிறது:

  1. ஒரு குறிப்பிட்ட எண்ணிக்கையிலான தொடர்ச்சியான வினவல்களைக் (size g) குழுவாக்குதல் (Grouping).
  2. ஒரு proxy வினவலை உருவாக்க அந்தத் தொகுப்பைப் சராசரி செய்தல் (Averaging).
  3. ஒவ்வொரு அசல் வினவலுக்கும் ஒருமுறை எனச் செய்வதற்குப் பதிலாக, proxy வினவலில் ஒரே ஒருமுறை indexer-ஐ இயக்குதல்.
  4. குழுவின் ஒவ்வொரு உறுப்பினருக்கும் proxy-யின் candidate list-ஐ மேம்படுத்துதல் (Refining).

இதன் கணிதச் செயல்பாடு O(L²) என்பதிலிருந்து O(L² / g) ஆகக் குறைகிறது. எட்டு அளவுள்ள குழுத் தொகுப்பைப் பயன்படுத்தும்போது, indexer எட்டு மடங்கு குறைவான முழு ஸ்கேன்களை (full scans) மட்டுமே செய்கிறது.

இரண்டு செயல்பாட்டு முறைகள்

  • PIVOT-Refine, dense indexer-இன் துல்லியத்தைப் பராமரிக்கும் அதே வேளையில், indexer நிலையில் சுமார் மூன்று மடங்கு வேக அதிகரிப்பை வழங்குகிறது.
  • PIVOT-Reuse, அதிகபட்ச throughput லாபத்திற்காகச் சிறிய அளவிலான துல்லியத்தை விட்டுக்கொடுத்து, வேகத்தை இன்னும் அதிகமாக உயர்த்துகிறது.

DeepSeek-V3.2 மற்றும் GLM-5.1 மாதிரிகளில் மேற்கொள்ளப்பட்ட Benchmarks, inference-இன் போது PIVOT பயன்படுத்தப்படும்போது, indexer வேகத்தில் நிலையான நான்கு மடங்கு அதிகரிப்பையும் மற்றும் end-to-end latency-யில் 1.6× குறைவையும் காட்டுகின்றன.

Plug-and-play செயலாக்கம்

இந்த நுட்பம், எந்தவொரு தற்போதுள்ள Dynamic Sparse Attention (DSA) pipeline-லும் இணைக்கக்கூடிய ஒரு reference implementation ஆக வந்துள்ளது. இதற்கு எடைகளில் (weights)