PIVOT, un nuovo trucco durante l'inferenza per i modelli a attenzione sparsa (sparse-attention), riduce i costi dell'indexer fino a quattro volte e accorcia la latenza complessiva di circa 1,6×, il tutto senza toccare i pesi del modello. Funziona raggruppando le query e permettendo a una singola query "proxy" di svolgere il lavoro pesante.
PIVOT abbatte i costi dell'indexer Sparse Attention di 4x e riduce la latenza di 1,6x
Translated for your language. Leggi l'originale.
AI-assisted, human-reviewed.
