PIVOT เทคนิคใหม่ในช่วงการอนุมาน (inference-time) สำหรับโมเดลแบบ sparse-attention ช่วยลดต้นทุนของ indexer ลงได้ถึงสี่เท่า และลดความหน่วง (latency) โดยรวมลงได้ประมาณ 1.6 เท่า โดยไม่ต้องแตะต้องน้ำหนัก (weights) ของโมเดลเลย เทคนิคนี้ทำงานโดยการจัดกลุ่ม query และให้ query ตัวแทน (proxy query) เพียงตัวเดียวทำหน้าที่หลักแทน
ทำไม sparse attention ถึงติดขัดที่ 100K tokens
Sparse attention ถูกออกแบบมาเพื่อให้ transformer สามารถประมวลผลลำดับข้อมูลที่ยาวมากได้ เช่น 100K tokens หรือมากกว่านั้น ในขณะที่ยังรักษาความคุ้มค่าในการประมวลผลไว้ แต่ในทางปฏิบัติ ความเร็วที่สัญญาไว้กลับหายไปเมื่อลำดับข้อมูลยาวเกินกว่าไม่กี่หมื่น tokens ตัวการสำคัญคือ indexer ซึ่งทำหน้าที่ให้คะแนนทุก token เทียบกับทุก query เพื่อตัดสินว่า token ใดควรอยู่ในรูปแบบ sparse โดยงานของมันมีสเกลเป็น O(L²) (L = ความยาวลำดับ) ดังนั้นที่ 100K tokens ลำพังแค่ indexer ก็กินเวลาประมวลผลส่วนใหญ่และทำลายประโยชน์ที่ได้รับจากความสามารถแบบ sparsity ไปจนหมด
สองข้อสังเกตเบื้องหลัง PIVOT
นักวิจัยพบว่า query ที่อยู่ติดกันมักจะเลือก top-k tokens ชุดเดียวกันเสมอ โดยมีความซ้อนทับกัน (overlap) ประมาณ 90% นั่นหมายความว่า query ตัวแทนเพียงตัวเดียวสามารถทำหน้าที่แทนกลุ่มของ query ข้างเคียงทั้งหมด และยังคงสามารถค้นหาชุดตัวเลือก (candidate set) ที่มีประโยชน์ได้ PIVOT ใช้ประโยชน์จากสิ่งนี้โดย:
- การจัดกลุ่ม (Grouping) query ที่เรียงต่อกันตามจำนวนที่กำหนด (ขนาด g)
- การหาค่าเฉลี่ย (Averaging) ของกลุ่มเพื่อสร้าง proxy query
- การรัน indexer เพียงครั้งเดียว บน proxy แทนที่จะรันหนึ่งครั้งต่อหนึ่ง query เดิม
- การปรับปรุง (Refining) รายการตัวเลือกของ proxy สำหรับสมาชิกแต่ละตัวในกลุ่ม
การคำนวณจะลดลงจาก O(L²) เป็น O(L²/g) หากใช้ขนาดกลุ่มเป็นแปด indexer จะทำการสแกนแบบเต็มรูปแบบ (full scans) น้อยลงถึงแปดเท่า
โหมดการทำงานสองรูปแบบ
- PIVOT-Refine รักษาความแม่นยำของ dense indexer ไว้ ในขณะที่ช่วยเพิ่มความเร็วในขั้นตอน indexer ได้ประมาณสามเท่า
- PIVOT-Reuse ผลักดันความเร็วให้สูงขึ้นไปอีก โดยยอมเสียความแม่นยำไปเล็กน้อยเพื่อแลกกับ throughput ที่เพิ่มขึ้นสูงสุด
ผลการทดสอบประสิทธิภาพ (Benchmarks) บนโมเดล DeepSeek-V3.2 และ GLM-5.1 แสดงให้เห็นถึงการเพิ่มความเร็วของ indexer ขึ้นสี่เท่าอย่างสม่ำเสมอ และลดความหน่วงแบบ end-to-end ลง 1.6 เท่า เมื่อใช้ PIVOT ในระหว่างการอนุมาน
การนำไปใช้งานแบบ plug-and-play
เทคนิคนี้มาในรูปแบบของ reference implementation ที่สามารถนำไปใส่ใน pipeline ของ Dynamic Sparse Attention (DSA) ที่มีอยู่เดิมได้ทันที โดยไม่จำเป็นต้องเปลี่ยนน้ำหนักของโมเดล ดังนั้นโมเดลที่ฝึกด้วยสูตร sparse-attention มาตรฐานจึงสามารถใช้งานได้โดยไม่ต้องแก้ไข ข้อควรระวังเพียงอย่างเดียวคือโค้ดอ้างอิงนี้ทำงานบน GPU kernel ทั่วไป สำหรับการใช้งานจริงในระดับ production จะต้องใช้ Triton หรือ CUDA kernel ที่ปรับแต่งด้วยมือเพื่อให้ได้ประสิทธิภาพความเร็วสูงสุด
สิ่งที่ต้องแลก (Trade-offs)
ข้อได้เปรียบด้านความเร็วของ PIVOT-Reuse มาพร้อมกับการลดลงเล็กน้อยของคุณภาพ attention ซึ่งอาจมีความสำคัญสำหรับงานที่อ่อนไหวสูงต่อการเลือก token ที่แม่นยำ ทีมงานต้องชั่งน้ำหนักความสูญเสียนั้นกับงบประมาณความหน่วง (latency budget) ที่มี นอกจากนี้ ความจำเป็นในการใช้ custom kernel ยังเพิ่มภาระงานด้านวิศวกรรมสำหรับองค์กรที่ไม่มีความเชี่ยวชาญด้าน GPU kernel
สิ่งที่น่าจับตามองต่อไป
PIVOT แสดงให้เห็นว่าการจัดลำดับงานใหม่ที่ชาญฉลาด—การจัดกลุ่ม query และการใช้การสแกนผ่าน proxy ร่วมกัน—สามารถคืนความหวังให้กับ sparse attention สำหรับบริบทที่ยาวมากจริงๆ ได้ โดยให้ความเร็วที่เพิ่มขึ้นอย่างเห็นได้ชัดโดยไม่ต้องเสียต้นทุนในการฝึกฝนโมเดลใหม่ (retraining)
