PIVOT، یک ترفند جدید در زمان استنتاج برای مدل‌های توجه پراکنده (sparse-attention)، هزینه ایندکسر را تا چهار برابر کاهش می‌دهد و تأخیر کلی را تقریباً ۱.۶ برابر کم می‌کند، بدون اینکه نیازی به تغییر وزن‌های مدل باشد. این روش با گروه‌بندی پرس‌وجوها (queries) و اجازه دادن به یک پرس‌وجوی «جایگزین» (proxy) برای انجام کارهای سنگین عمل می‌کند.

چرا توجه پراکنده در ۱۰۰ هزار توکن متوقف می‌شود

هدف از توجه پراکنده این بود که به ترنسفورمرها اجازه دهد توالی‌های بسیار طولانی — مثلاً ۱۰۰ هزار توکن یا بیشتر — را بررسی کنند و در عین حال هزینه‌ی محاسباتی را مقرون‌به‌صرفه نگه دارند. در عمل، سرعت‌بخشیِ وعده‌داده‌شده زمانی که طول توالی از چند ده هزار توکن فراتر می‌رود، از بین می‌رود. مقصر اصلی، ایندکسر است که هر توکن را در برابر هر پرس‌وجو امتیازدهی می‌کند تا تصمیم بگیرد کدام توکن‌ها متعلق به الگوی پراکنده هستند. کار ایندکسر با مقیاس $O(L^2)$ (که در آن $L$ طول توالی است) افزایش می‌یابد، بنابراین در ۱۰۰ هزار توکن، ایندکسر به تنهایی زمان اجرا را تسخیر کرده و هرگونه مزیتی که از پراکندگی حاصل می‌شود را از بین می‌برد.

دو مشاهده‌ی پشت PIVOT

محققان دریافتند که پرس‌وجوهای مجاور تقریباً همیشه همان توکن‌های top-k یکسان را انتخاب می‌کنند — با حدود ۹۰٪ هم‌پوشانی. این بدان معناست که یک پرس‌وجوی نماینده‌ی واحد می‌تواند جایگزین یک دسته‌ی کامل از همسایگان خود شود و همچنان مجموعه‌ای مفید از کاندیداها را ارائه دهد. PIVOT با انجام کارهای زیر از این ویژگی بهره می‌برد:

۱. گروه‌بندی تعداد مشخصی از پرس‌وجوهای متوالی (با اندازه $g$). ۲. میانگین‌گیری از گروه برای ایجاد یک پرس‌وجوی جایگزین (proxy). ۳. اجرای ایندکسر تنها یک بار روی پرس‌وجوی جایگزین، به جای اجرای آن برای هر پرس‌وجوی اصلی. ۴. اصلاح لیست کاندیداهای پرس‌وجوی جایگزین برای هر عضو گروه.

محاسبات ریاضی از $O(L^2)$ به $O(L^2/g)$ کاهش می‌یابد. با اندازه گروه هشت، ایندکسر هشت برابر کمتر اسکن کامل انجام می‌دهد.

دو حالت عملیاتی

  • PIVOT-Refine دقت ایندکسر متراکم را حفظ می‌کند و در عین حال حدود سه برابر افزایش سرعت در مرحله‌ی ایندکسر ارائه می‌دهد.
  • PIVOT-Reuse سرعت را حتی بیشتر می‌کند و برای دستیابی به حداکثر افزایش توان عملیاتی، مقدار کمی از دقت را فدا می‌کند.

بنچمارک‌ها روی مدل‌های DeepSeek-V3.2 و GLM-5.1 نشان می‌دهند که وقتی PIVOT در طول استنتاج اعمال می‌شود، سرعت ایندکسر به‌طور مداوم چهار برابر افزایش یافته و تأخیر سرتاسری (end-to-end) ۱.۶ برابر کاهش می‌یابد.

پیاده‌سازی آماده‌ی استفاده (Plug-and-play)

این تکنیک به صورت یک پیاده‌سازی مرجع ارائه شده است که می‌تواند در هر خط لوله (pipeline) موجودِ Dynamic Sparse Attention (DSA) قرار گیرد. این روش نیازی به تغییر وزن‌ها ندارد، بنابراین مدل‌هایی که با دستورالعمل‌های استاندارد توجه پراکنده آموزش دیده‌اند، بدون تغییر کار می‌کنند. تنها نکته این است که کد مرجع روی کرنل‌های عمومی GPU اجرا می‌شود؛ برای استقرار در محیط‌های عملیاتی، جهت رسیدن به پتانسیل کامل سرعت، به کرنل‌های تنظیم‌شده‌ی دستی Triton یا CUDA نیاز خواهد بود.

موازنه‌ها چگونه هستند

مزیت سرعت در PIVOT-Reuse با کاهش اندکی در کیفیت توجه همراه است که ممکن است برای وظایفی که نسبت به انتخاب دقیق توکن بسیار حساس هستند، اهمیت داشته باشد. تیم‌ها باید این کاهش را در برابر بودجه‌ی تأخیر خود بسنجند. علاوه بر این، نیاز به کرنل‌های سفارشی، بار مهندسی اضافی را برای سازمان‌هایی که فاقد تخصص در زمینه کرنل‌های GPU هستند، اضافه می‌کند.

آنچه در آینده باید منتظر آن بود

PIVOT نشان می‌دهد که یک بازآرایی هوشمندانه در ترتیب انجام کارها — یعنی گروه‌بندی پرس‌وجوها و اشتراک‌گذاری یک اسکن جایگزین — می‌تواند نوید توجه پراکنده را برای بافت‌های (contexts) واقعاً طولانی احیا کند و بدون هزینه‌ی بازآموزی، افزایش سرعت ملموسی را ارائه دهد.