新聞 7 / 12

研究突破

RBS-Attention:半徑限制稀疏預填充技術加速長上下文大語言模型推理

RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models

RBS-Attention:半徑限制稀疏預填充技術加速長上下文大語言模型推理

arXiv cs.AI · 2026-09-22

摘要

針對長上下文大語言模型推理中預填充階段計算成本過高的問題,研究提出 RBS-Attention 方法。該技術透過結合平均相關性與最大鍵塊半徑的雙分支選擇機制,有效解決傳統稀疏區塊選擇可能遺漏關鍵資訊的缺陷,在 H100 GPU 上實現顯著的速度提升。

針對長上下文大語言模型推理中預填充階段因密集自注意力機制處理完整提示而導致的計算瓶頸,研究提出 RBS-Attention 方法。該技術旨在解決傳統稀疏區塊選擇中可能出現的「平均稀釋」(mean dilution)問題,即區塊質心可能掩蓋了與高度相關但數量較少的 token。

RBS-Attention 是一種無需訓練的稀疏預填充方法,採用兩個互補的選擇分支:一個基於質心的分支用於捕捉平均相關性,另一個救援分支則利用最大鍵塊半徑及其依賴於提示、層和頭部的分佈,來識別可能被低估的區塊。透過獨立閾值處理這兩個分支並結合其遮罩,該方法在控制救援區塊貢獻的同時,保留了常規區塊稀疏 FlashAttention 的執行效率。

在 H100 GPU 上的實驗顯示,在 Qwen3-30B-A3B-Instruct-2507-FP8 模型於 128K 上下文長度下,RBS-Attention 實現了 20.65 倍的獨立預填充注意力加速、11.92 倍的 vLLM 預填充注意力加速,以及 5.97 倍的端到端首 token 時間加速。在密集 Qwen3-32B 模型上,其整體 RULER 準確率為 88.65,與密集注意力的 89.52 相比僅有微小差距,並透過 LongBench-v2、InfiniteBench 和 Video-MME 進行了額外品質評估。

開發者:可關注此訓練-free 稀疏預填充技術以優化長文本處理效能

投資人:AI 基礎設施與推理優化領域值得留意

一般用戶:長上下文 AI 服務回應速度有望提升

重要性評分

67/100

🟠 值得關注

長上下文大語言模型稀疏注意力推理優化RBS-Attention
原文出處
上一則MCP 協議更新:轉向無狀態架構以支援 AI Agent 基礎設施擴展下一則StepKV:針對 LLM Agent 的步驟感知 KV Cache 壓縮技術

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。