PIVOT، یک ترفند جدید در زمان استنتاج برای مدلهای توجه پراکنده (sparse-attention)، هزینه ایندکسر را تا چهار برابر کاهش میدهد و تأخیر کلی را تقریباً ۱.۶ برابر کم میکند، بدون اینکه نیازی به تغییر وزنهای مدل باشد. این روش با گروهبندی پرسوجوها (queries) و اجازه دادن به یک پرسوجوی «جایگزین» (proxy) برای انجام کارهای سنگین عمل میکند.
چرا توجه پراکنده در ۱۰۰ هزار توکن متوقف میشود
هدف از توجه پراکنده این بود که به ترنسفورمرها اجازه دهد توالیهای بسیار طولانی — مثلاً ۱۰۰ هزار توکن یا بیشتر — را بررسی کنند و در عین حال هزینهی محاسباتی را مقرونبهصرفه نگه دارند. در عمل، سرعتبخشیِ وعدهدادهشده زمانی که طول توالی از چند ده هزار توکن فراتر میرود، از بین میرود. مقصر اصلی، ایندکسر است که هر توکن را در برابر هر پرسوجو امتیازدهی میکند تا تصمیم بگیرد کدام توکنها متعلق به الگوی پراکنده هستند. کار ایندکسر با مقیاس $O(L^2)$ (که در آن $L$ طول توالی است) افزایش مییابد، بنابراین در ۱۰۰ هزار توکن، ایندکسر به تنهایی زمان اجرا را تسخیر کرده و هرگونه مزیتی که از پراکندگی حاصل میشود را از بین میبرد.
دو مشاهدهی پشت PIVOT
محققان دریافتند که پرسوجوهای مجاور تقریباً همیشه همان توکنهای top-k یکسان را انتخاب میکنند — با حدود ۹۰٪ همپوشانی. این بدان معناست که یک پرسوجوی نمایندهی واحد میتواند جایگزین یک دستهی کامل از همسایگان خود شود و همچنان مجموعهای مفید از کاندیداها را ارائه دهد. PIVOT با انجام کارهای زیر از این ویژگی بهره میبرد:
۱. گروهبندی تعداد مشخصی از پرسوجوهای متوالی (با اندازه $g$). ۲. میانگینگیری از گروه برای ایجاد یک پرسوجوی جایگزین (proxy). ۳. اجرای ایندکسر تنها یک بار روی پرسوجوی جایگزین، به جای اجرای آن برای هر پرسوجوی اصلی. ۴. اصلاح لیست کاندیداهای پرسوجوی جایگزین برای هر عضو گروه.
محاسبات ریاضی از $O(L^2)$ به $O(L^2/g)$ کاهش مییابد. با اندازه گروه هشت، ایندکسر هشت برابر کمتر اسکن کامل انجام میدهد.
دو حالت عملیاتی
- PIVOT-Refine دقت ایندکسر متراکم را حفظ میکند و در عین حال حدود سه برابر افزایش سرعت در مرحلهی ایندکسر ارائه میدهد.
- PIVOT-Reuse سرعت را حتی بیشتر میکند و برای دستیابی به حداکثر افزایش توان عملیاتی، مقدار کمی از دقت را فدا میکند.
بنچمارکها روی مدلهای DeepSeek-V3.2 و GLM-5.1 نشان میدهند که وقتی PIVOT در طول استنتاج اعمال میشود، سرعت ایندکسر بهطور مداوم چهار برابر افزایش یافته و تأخیر سرتاسری (end-to-end) ۱.۶ برابر کاهش مییابد.
پیادهسازی آمادهی استفاده (Plug-and-play)
این تکنیک به صورت یک پیادهسازی مرجع ارائه شده است که میتواند در هر خط لوله (pipeline) موجودِ Dynamic Sparse Attention (DSA) قرار گیرد. این روش نیازی به تغییر وزنها ندارد، بنابراین مدلهایی که با دستورالعملهای استاندارد توجه پراکنده آموزش دیدهاند، بدون تغییر کار میکنند. تنها نکته این است که کد مرجع روی کرنلهای عمومی GPU اجرا میشود؛ برای استقرار در محیطهای عملیاتی، جهت رسیدن به پتانسیل کامل سرعت، به کرنلهای تنظیمشدهی دستی Triton یا CUDA نیاز خواهد بود.
موازنهها چگونه هستند
مزیت سرعت در PIVOT-Reuse با کاهش اندکی در کیفیت توجه همراه است که ممکن است برای وظایفی که نسبت به انتخاب دقیق توکن بسیار حساس هستند، اهمیت داشته باشد. تیمها باید این کاهش را در برابر بودجهی تأخیر خود بسنجند. علاوه بر این، نیاز به کرنلهای سفارشی، بار مهندسی اضافی را برای سازمانهایی که فاقد تخصص در زمینه کرنلهای GPU هستند، اضافه میکند.
آنچه در آینده باید منتظر آن بود
PIVOT نشان میدهد که یک بازآرایی هوشمندانه در ترتیب انجام کارها — یعنی گروهبندی پرسوجوها و اشتراکگذاری یک اسکن جایگزین — میتواند نوید توجه پراکنده را برای بافتهای (contexts) واقعاً طولانی احیا کند و بدون هزینهی بازآموزی، افزایش سرعت ملموسی را ارائه دهد.
