PIVOT, satu teknik baharu semasa masa inferens untuk model sparse-attention, mengurangkan kos pengindeks sehingga empat kali ganda dan memendekkan latensi keseluruhan sebanyak kira-kira 1.6×, semuanya tanpa mengubah pemberat model tersebut. Ia berfungsi dengan mengelompokkan pertanyaan (queries) dan membiarkan satu pertanyaan “proksi” melakukan kerja berat.
Mengapa sparse attention terhenti pada 100K token
Sparse attention bertujuan untuk membolehkan transformer melihat urutan yang sangat panjang—bayangkan 100K token atau lebih—sambil mengekalkan kos pengiraan yang berpatutan. Dalam praktiknya, peningkatan kelajuan yang dijanjikan akan hilang sebaik sahaja urutan melebihi beberapa puluh ribu token. Punca utamanya ialah pengindeks (indexer), yang memberikan skor kepada setiap token terhadap setiap pertanyaan untuk menentukan token mana yang tergolong dalam corak sparse. Kerjanya berskala sebagai O(L²) (L = panjang urutan), jadi pada 100K token, pengindeks sahaja sudah mendominasi masa larian dan menghapuskan sebarang manfaat daripada sparsity.
Dua pemerhatian di sebalik PIVOT
Penyelidik mendapati bahawa pertanyaan yang bersebelahan hampir sentiasa memilih token top-k yang sama—dengan pertindihan sekitar 90%. Ini bermakna satu pertanyaan wakil boleh menggantikan satu kelompok jiran dan masih dapat menghasilkan set calon yang berguna. PIVOT memanfaatkan perkara ini dengan:
- Mengelompokkan sejumlah tetap pertanyaan berturutan (saiz g).
- Memuratakan kelompok tersebut untuk mencipta satu pertanyaan proksi.
- Menjalankan pengindeks sekali sahaja pada proksi berbanding sekali bagi setiap pertanyaan asal.
- Memurnikan senarai calon proksi untuk setiap ahli dalam kelompok tersebut.
Pengiraan matematik menurun daripada O(L²) kepada O(L² / g). Dengan saiz kelompok lapan, pengindeks menjalankan larian imbasan penuh lapan kali lebih sedikit.
Dua mod operasi
- PIVOT-Refine mengekalkan ketepatan pengindeks padat (dense indexer) sambil memberikan peningkatan kelajuan kira-kira tiga kali ganda pada peringkat pengindeks.
- PIVOT-Reuse melonjakkan lagi kelajuan, dengan mengorbankan sedikit ketepatan demi keuntungan daya pemprosesan (throughput) yang maksimum.
Penanda aras pada model DeepSeek-V3.2 dan GLM-5.1 menunjukkan peningkatan kelajuan pengindeks sebanyak empat kali ganda yang konsisten dan pengurangan latensi hujung-ke-hujung sebanyak 1.6× apabila PIVOT digunakan semasa inferens.
Implementasi "plug-and-play"
Teknik ini hadir sebagai implementasi rujukan yang boleh dimasukkan ke dalam mana-mana saluran paip (pipeline) Dynamic Sparse Attention (DSA) yang sedia ada. Ia tidak memerlukan sebarang perubahan pemberat, jadi model yang dilatih dengan resipi sparse-attention standard akan berfungsi tanpa perubahan. Satu-satunya kekangan ialah kod rujukan tersebut berjalan pada kernel GPU generik; penggunaan pengeluaran (production) akan memerlukan kernel Triton atau CUDA yang ditala secara manual untuk mencapai potensi kelajuan penuh.
Gambaran tentang imbangan (trade-offs)
Kelebihan kelajuan PIVOT-Reuse datang dengan sedikit penurunan dalam kualiti perhatian, yang mungkin penting bagi tugas yang sangat sensitif terhadap pemilihan token yang tepat. Pasukan mesti menimbang kerugian tersebut berbanding bajet latensi mereka. Selain itu, keperluan untuk kernel tersuai menambah beban kejuruteraan bagi organisasi yang tidak mempunyai kepakaran kernel GPU.
Apa yang perlu diperhatikan seterusnya
PIVOT menunjukkan bahawa penyusunan semula kerja yang bijak—mengelompokkan pertanyaan dan berkongsi imbasan proksi—boleh menghidupkan semula janji sparse attention untuk konteks yang benar-benar panjang, memberikan peningkatan kelajuan yang nyata tanpa kos latihan semula.
