PIVOT, un nuovo trucco durante l'inferenza per i modelli a attenzione sparsa (sparse-attention), riduce i costi dell'indexer fino a quattro volte e accorcia la latenza complessiva di circa 1,6×, il tutto senza toccare i pesi del modello. Funziona raggruppando le query e permettendo a una singola query "proxy" di svolgere il lavoro pesante.

Perché l'attenzione sparsa si blocca a