PIVOT, sparse-attention మోడల్స్ కోసం ఒక కొత్త inference-time ట్రిక్, మోడల్ వెయిట్స్‌ను మార్చకుండానే indexer ఖర్చును నాలుగు రెట్లు తగ్గించడమే కాకుండా, మొత్తం latencyని సుమారు 1.6× తగ్గిస్తుంది. ఇది క్వెరీలను (queries) గ్రూప్ చేయడం ద్వారా మరియు ఒకే ఒక "proxy" క్వెరీ ద్వారా ప్రధాన పనిని చేయించడం ద్వారా పనిచేస్తుంది.

sparse attention 100 K టోకెన్ల వద్ద ఎందుకు మందగిస్తుంది

Sparse attention అనేది కంప్యూట్ ఖర్చును అందుబాటులో ఉంచుతూనే, ట్రాన్స్‌ఫార్మర్లు (transformers) చాలా పొడవైన సీక్వెన్స్‌లను—అంటే 100 K టోకెన్లు లేదా అంతకంటే ఎక్కువ—చూడటానికి వీలుగా రూపొందించబడింది. కానీ వాస్తవంలో, సీక్వెన్స్ కొన్ని పది వేల టోకెన్ల కంటే ఎక్కువ పెరిగినప్పుడు, వాగ్దానం చేయబడిన స్పీడ్-అప్ (speed-up) తగ్గిపోతుంది. దీనికి కారణం indexer. sparse patternలో ఏ టోకెన్లు ఉండాలో నిర్ణయించడానికి ఇది ప్రతి టోకెన్‌ను ప్రతి క్వెరీతో పోల్చి స్కోర్ చేస్తుంది. దీని పనితీరు O(L²) (L = sequence length) గా ఉంటుంది, కాబట్టి 100 K టోకెన్ల వద్ద indexer మాత్రమే రన్‌టైమ్‌లో ఎక్కువ సమయం తీసుకుంటుంది మరియు sparsity వల్ల కలిగే ప్రయోజనాలను తగ్గిస్తుంది.

PIVOT వెనుక ఉన్న రెండు పరిశీలనలు

పక్కపక్కనే ఉన్న క్వెరీలు దాదాపు ఎప్పుడూ ఒకే రకమైన top-k టోకెన్లను ఎంచుకుంటాయని పరిశోధకులు కనుగొన్నారు—సుమారు 90% ఓవర్‌ల్యాప్ (overlap) ఉంటుంది. అంటే, ఒకే ఒక ప్రతినిధి క్వెరీ (representative query) పక్కన ఉన్న క్వెరీల సమూహం (batch of neighbours) తరపున పనిచేయగలదు మరియు ఉపయోగకరమైన కాండిడేట్ సెట్‌ను (candidate set) అందించగలదు. PIVOT దీనిని ఈ క్రింది విధంగా ఉపయోగించుకుంటుంది:

  1. నిర్ణీత సంఖ్యలో వరుస క్వెరీలను గ్రూప్ చేయడం (పరిమాణం g).
  2. proxy క్వెరీని సృష్టించడానికి ఆ గ్రూప్‌ను సగటు (averaging) చేయడం.
  3. ప్రతి అసలు క్వెరీకి ఒకసారి రన్ చేసే బదులు, proxy పై ఒక్కసారి మాత్రమే indexerని రన్ చేయడం.
  4. గ్రూప్‌లోని ప్రతి సభ్యుని కోసం proxy యొక్క కాండిడేట్ జాబితాను పరిష్కరించడం (refining).

గణితం O(L²) నుండి O(L² / g) కి తగ్గుతుంది. ఎనిమిది సభ్యుల గ్రూప్ పరిమాణంతో, indexer ఎనిమిది రెట్లు తక్కువ ఫుల్ స్కాన్‌లను (full scans) చేస్తుంది.

రెండు ఆపరేటింగ్ మోడ్‌లు

  • PIVOT-Refine డెన్స్ indexer యొక్క ఖచ్చితత్వాన్ని (accuracy) కాపాడుతూనే, indexer దశలో సుమారు మూడు రెట్ల వేగవంతమైన పెంపును అందిస్తుంది.
  • PIVOT-Reuse గరిష్ట త్రూపుట్ (throughput) లాభం కోసం స్వల్ప ఖచ్చితత్వాన్ని త్యాగం చేస్తూ, వేగాన్ని మరింత పెంచుతుంది.

DeepSeek-V3.2 మరియు GLM-5.1 మోడల్స్‌పై చేసిన బెంచ్‌మార్క్‌లు, inference సమయంలో PIVOTని ఉపయోగించినప్పుడు, indexer వేగం స్థిరంగా నాలుగు రెట్లు పెరగడం మరియు end-to-end latency 1.6× తగ్గడం చూపిస్తున్నాయి.

ప్లగ్-అండ్-ప్లే ఇంప్లిమెంటేషన్

ఈ సాంకేతికత ఏదైనా ఉన్నతమైన Dynamic Sparse Attention (DSA) పైప్‌లైన్‌లో నేరుగా ఉపయోగించగల ఒక రిఫరెన్స్ ఇంప్లిమెంటేషన్‌గా అందుబాటులోకి వచ్చింది. దీనికి వెయిట్ మార్పులు అవసరం లేదు, కాబట్టి స్టాండర్డ్ sparse-attention పద్ధతులతో శిక్షణ పొందిన మోడల్స్ ఎటువంటి మార్పు లేకుండా పనిచేస్తాయి. అయితే, రిఫరెన్స్ కోడ్ జనరిక్ GPU కెర్నల్స్‌పై నడుస్తుంది; పూర్తి వేగాన్ని సాధించడానికి ప్రొడక్షన్ డిప్లాయ్‌మెంట్లలో హ్యాండ్-ట్యూన్ చేసిన Triton లేదా CUDA కెర్నల్స్ అవసరమవుతాయి.

ట్రేడ్-ఆఫ్స్ (trade-offs) ఎలా ఉంటాయి

PIVOT-Reuse యొక్క వేగవంతమైన ప్రయోజనం వల్ల అటెన్షన్ క్వాలిటీలో స్వల్ప తగ్గుదల ఉంటుంది, ఇది ఖచ్చితమైన టోకెన్ ఎంపికపై ఆధారపడి ఉండే పనులకు (tasks) కీలకం కావచ్చు. టీమ్‌లు ఆ నష్టాన్ని తమ latency బడ్జెట్‌తో పోల్చి చూడాలి. అదనంగా, కస్టమ్ కెర్నల్స్ అవసరం కావడం వల్ల GPU-kernel నైపుణ్యం లేని సంస్థలకు ఇంజనీరింగ్ భారం పెరుగుతుంది.

తదుపరి ఏమి చూడాలి

పనులను తెలివిగా పునర్వ్యవస్థీకరించడం ద్వారా—అంటే క్వెరీలను గ్రూప్ చేయడం మరియు ఒక proxy స్కాన్‌ను పంచుకోవడం ద్వారా—నిజమైన లాంగ్ కాంటెక్స్ట్‌ల (long contexts) కోసం sparse attention యొక్క వాగ్దానాన్ని తిరిగి పునరుద్ధరించవచ్చని PIVOT నిరూపిస్తుంది, ఇది రీట్రైనింగ్ ఖర్చు లేకుండా గణనీయమైన వేగ లాభాలను అందిస్తుంది.