PIVOT, sparse-attention ਮਾਡਲਾਂ ਲਈ ਇੱਕ ਨਵਾਂ inference-time ਤਰੀਕਾ ਹੈ, ਜੋ ਮਾਡਲ ਦੇ weights ਨੂੰ ਬਦਲੇ ਬਿਨਾਂ indexer ਦੀ ਲਾਗਤ ਨੂੰ ਚਾਰ ਗੁਣਾ ਤੱਕ ਘਟਾਉਂਦਾ ਹੈ ਅਤੇ ਸਮੁੱਚੀ latency ਨੂੰ ਲਗਭਗ 1.6× ਤੱਕ ਘਟਾਉਂਦਾ ਹੈ। ਇਹ queries ਨੂੰ ਸਮੂਹਬੱਧ (grouping) ਕਰਕੇ ਅਤੇ ਇੱਕ ਸਿੰਗਲ "proxy" query ਨੂੰ ਮੁੱਖ ਕੰਮ ਕਰਨ ਦੇ ਕੇ ਕੰਮ ਕਰਦਾ ਹੈ।
Sparse attention 100 K tokens 'ਤੇ ਕਿਉਂ ਰੁਕ ਜਾਂਦੀ ਹੈ
Sparse attention ਦਾ ਮਕਸਦ transformers ਨੂੰ ਬਹੁਤ ਲੰਬੀਆਂ sequences—ਜਿਵੇਂ ਕਿ 100 K tokens ਜਾਂ ਇਸ ਤੋਂ ਵੱਧ—ਦੇਖਣ ਦੇ ਯੋਗ ਬਣਾਉਣਾ ਸੀ, ਜਦੋਂ ਕਿ compute ਨੂੰ ਕਿਫਾਇਤੀ ਰੱਖਿਆ ਜਾ ਸਕੇ। ਅਸਲ ਵਿੱਚ, ਜਦੋਂ sequence ਕੁਝ ਦਸ ਹਜ਼ਾਰ tokens ਤੋਂ ਵੱਧ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਵਾਅਦਾ ਕੀਤਾ ਗਿਆ speed-up ਖਤਮ ਹੋ ਜਾਂਦਾ ਹੈ। ਇਸਦਾ ਮੁੱਖ ਕਾਰਨ indexer ਹੈ, ਜੋ ਇਹ ਫੈਸਲਾ ਕਰਨ ਲਈ ਹਰ token ਨੂੰ ਹਰ query ਦੇ ਵਿਰੁੱਧ ਸਕੋਰ ਕਰਦਾ ਹੈ ਕਿ ਕਿਹੜੇ tokens sparse pattern ਵਿੱਚ ਆਉਂਦੇ ਹਨ। ਇਸਦਾ ਕੰਮ O(L²) (L = sequence length) ਦੇ ਅਨੁਸਾਰ ਵਧਦਾ ਹੈ, ਇਸ ਲਈ 100 K tokens 'ਤੇ ਸਿਰਫ਼ indexer ਹੀ runtime 'ਤੇ ਹਾਵੀ ਹੋ ਜਾਂਦਾ ਹੈ ਅਤੇ sparsity ਤੋਂ ਮਿਲਣ ਵਾਲੇ ਕਿਸੇ ਵੀ ਫਾਇਦੇ ਨੂੰ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ।
PIVOT ਦੇ ਪਿੱਛੇ ਦੋ ਅਨੁਭਵ (observations)
ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਪਾਇਆ ਕਿ ਲਗਭਗ ਹਮੇਸ਼ਾ ਨਾਲ ਵਾਲੀਆਂ queries ਇੱਕੋ ਜਿਹੇ top-k tokens ਚੁਣਦੀਆਂ ਹਨ—ਲਗਭਗ 90% overlap। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇੱਕ ਸਿੰਗਲ ਪ੍ਰਤੀਨਿਧ (representative) query ਪੂਰੇ ਗੁਆਂਢੀ batch ਦੀ ਥਾਂ ਲੈ ਸਕਦੀ ਹੈ ਅਤੇ ਫਿਰ ਵੀ ਇੱਕ ਲਾਹੇਵੰਦ candidate set ਪ੍ਰਦਾਨ ਕਰ ਸਕਦੀ ਹੈ। PIVOT ਇਸਦਾ ਫਾਇਦਾ ਇਸ ਤਰ੍ਹਾਂ ਉਠਾਉਂਦਾ ਹੈ:
- ਲਗਾਤਾਰ queries ਦੀ ਇੱਕ ਨਿਸ਼ਚਿਤ ਗਿਣਤੀ ਨੂੰ grouping ਕਰਨਾ (size g)।
- ਇੱਕ proxy query ਬਣਾਉਣ ਲਈ group ਦਾ averaging ਕਰਨਾ।
- ਹਰ ਅਸਲ query ਲਈ ਇੱਕ ਵਾਰ ਚਲਾਉਣ ਦੀ ਬਜਾਏ proxy 'ਤੇ indexer ਨੂੰ ਇੱਕ ਵਾਰ ਚਲਾਉਣਾ।
- Group ਦੇ ਹਰੇਕ ਮੈਂਬਰ ਲਈ proxy ਦੀ candidate list ਨੂੰ refine ਕਰਨਾ।
ਗਣਿਤ O(L²) ਤੋਂ ਘਟ ਕੇ O(L² / g) ਹੋ ਜਾਂਦਾ ਹੈ। ਅੱਠ ਦੇ group size ਦੇ ਨਾਲ, indexer ਅੱਠ ਗੁਣਾ ਘੱਟ full scans ਚਲਾਉਂਦਾ ਹੈ।
ਦੋ operating modes
- PIVOT-Refine indexer stage 'ਤੇ ਲਗਭਗ ਤਿੰਨ ਗੁਣਾ speed boost ਦੇਣ ਦੇ ਨਾਲ-ਨਾਲ dense indexer ਦੀ accuracy ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ।
- PIVOT-Reuse speed ਨੂੰ ਹੋਰ ਵੀ ਅੱਗੇ ਲੈ ਜਾਂਦਾ ਹੈ, ਜੋ ਵੱਧ ਤੋਂ ਵੱਧ throughput ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਕੁਝ ਹੱਦ ਤੱਕ accuracy ਦਾ ਤਿਆਗ ਕਰਦਾ ਹੈ।
DeepSeek-V3.2 ਅਤੇ GLM-5.1 ਮਾਡਲਾਂ 'ਤੇ benchmarks ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ ਜਦੋਂ inference ਦੌਰਾਨ PIVOT ਲਾਗੂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ indexer ਦੀ speed ਲਗਾਤਾਰ ਚਾਰ ਗੁਣਾ ਵਧ ਜਾਂਦੀ ਹੈ ਅਤੇ end-to-end latency ਵਿੱਚ 1.6× ਦੀ ਕਮੀ ਆਉਂਦੀ ਹੈ।
Plug-and-play implementation
ਇਹ ਤਕਨੀਕ ਇੱਕ reference implementation ਵਜੋਂ ਆਉਂਦੀ ਹੈ ਜਿਸ ਨੂੰ ਕਿਸੇ ਵੀ ਮੌਜੂਦਾ Dynamic Sparse Attention (DSA) pipeline ਵਿੱਚ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਇਸ ਵਿੱਚ ਕਿਸੇ weight ਬਦਲਾਅ ਦੀ ਲੋੜ ਨਹੀਂ ਹੈ, ਇਸ ਲਈ standard sparse-attention recipes ਨਾਲ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਮਾਡਲ ਬਿਨਾਂ ਕਿਸੇ ਬਦਲਾਅ ਦੇ ਕੰਮ ਕਰਦੇ ਹਨ। ਇਕਲੌਤੀ ਸ਼ਰਤ ਇਹ ਹੈ ਕਿ reference code generic GPU kernels 'ਤੇ ਚੱਲਦਾ ਹੈ; ਪੂਰੀ speed ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ production deployments ਵਿੱਚ hand-tuned Triton ਜਾਂ CUDA kernels ਦੀ ਲੋੜ ਹੋਵੇਗੀ।
Trade-offs ਕਿਹੋ ਜਿਹੇ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ
PIVOT-Reuse ਦਾ speed ਫਾਇਦਾ attention quality ਵਿੱਚ ਮਾਮੂਲੀ ਗਿਰਾਵਟ ਦੇ ਨਾਲ ਆਉਂਦਾ ਹੈ, ਜੋ ਕਿ ਉਹਨਾਂ ਕੰਮਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੋ ਸਕਦਾ ਹੈ ਜੋ ਸਹੀ token selection ਪ੍ਰਤੀ ਬਹੁਤ ਸੰਵੇਦਨਸ਼ੀਲ ਹਨ। ਟੀਮਾਂ ਨੂੰ ਉਸ ਨੁਕਸਾਨ ਨੂੰ ਆਪਣੇ latency budget ਦੇ ਮੁਕਾਬਲੇ ਤੋਲਣਾ ਚਾਹੀਦਾ ਹੈ। ਇਸ ਤੋਂ ਇਲਾਵਾ, custom kernels ਦੀ ਲੋੜ ਉਹਨਾਂ ਸੰਸਥਾਵਾਂ ਲਈ engineering overhead ਵਧਾਉਂਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਕੋਲ GPU-kernel ਦੀ ਮੁਹਾਰਤ ਨਹੀਂ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
PIVOT ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਕੰਮ ਦੀ ਇੱਕ ਚਲਾਕ re-ordering—queries ਨੂੰ group ਕਰਨਾ ਅਤੇ ਇੱਕ proxy scan ਨੂੰ ਸਾਂਝਾ ਕਰਨਾ—ਸੱਚਮੁੱਚ ਲੰਬੇ contexts ਲਈ sparse attention ਦੇ ਵਾਅਦੇ ਨੂੰ ਮੁੜ ਸੁਰਜੀਤ ਕਰ ਸਕਦੀ ਹੈ, ਜੋ retraining ਦੀ ਲਾਗਤ ਤੋਂ ਬਿਨਾਂ ਮਹੱਤਵਪੂਰਨ speed gains ਪ੍ਰਦਾਨ ਕਰਦੀ ਹੈ।
