新聞 8 / 12

研究突破

StepKV:針對 LLM Agent 的步驟感知 KV Cache 壓縮技術

StepKV: Step-Aware KV Cache Compression for LLM Agents

StepKV:針對 LLM Agent 的步驟感知 KV Cache 壓縮技術

arXiv cs.LG · 2026-09-22

摘要

研究提出 StepKV 演算法,解決大型語言模型(LLM)在執行多步驟 Agent 任務時,KV Cache 隨上下文線性增長導致的儲存與解碼成本問題。現有方法多將快取視為扁平的 token 序列,StepKV 則根據推理步驟的結構進行壓縮,更精準地保留對後續決策至關重要的資訊,提升 Agent 運行的效率。

這篇由 Boyu Feng 與 Jiahong Liu、Yifan Li、Wenhao Yu、Zexuan Qiu、Yuliang Sun、Ming Shen、Xiang Li、Quanyu Dai、Irwin King 等十位作者共同撰寫的研究,於 2026 年 8 月 26 日提交至 arXiv,編號為 2609.22158,歸類於機器學習領域。研究針對大型語言模型在多步驟 Agent 任務中,KV Cache 隨上下文線性增長所導致的儲存與解碼成本問題,提出 StepKV 演算法。

現有剪枝方法將快取視為扁平的 token 序列,並根據近期性或注意力顯著性對 token 進行排名。這種做法導致壓縮單位與推理單位不匹配,因為多步驟 Agent 的查詢會擴展為包含推理、工具互動和檢索觀察的軌跡。研究指出,有用的資訊通常組織在推理步驟中,具有不均衡且延遲的重要性。早期觀察或中間決策可能因近期注意力較低而被移除,儘管它們對於後續的證據綜合至關重要,研究將此失效模式稱為「推理連續性」。

StepKV 將推理步驟視為首要的保留單位,解決上述問題。該演算法將快取條目與其生成的步驟關聯,利用軌跡衍生的信號來估計步驟效用,並將此效用與 token 層級的顯著性結合。透過這種方式,StepKV 對可剪枝的 token 進行全局排名,並在目標預算下保留得分最高的條目,提供以步驟為中心的 Agent KV 快取壓縮視角。

在多跳問答與長視角網頁推理任務中,StepKV 在低 KV 預算下能維持準確率,而 token 層級的基準方法在此類情況下準確率會急劇下降。這顯示 StepKV 為多步驟 Agent 推理提供了更強健的效率與準確率取捨,確保在資源受限的情況下仍能保留對決策至關關鍵的結構化資訊。

開發者:可關注此技術以優化 LLM Agent 的推理成本與效能

投資人:AI Agent 基礎設施與效能優化領域值得留意

一般用戶:未來使用 AI Agent 服務時可能獲得更快速且低延遲的體驗

重要性評分

67/100

🟠 值得關注

LLM AgentKV Cache壓縮技術推理效率arXiv
原文出處
上一則RBS-Attention:半徑限制稀疏預填充技術加速長上下文大語言模型推理下一則Mean Velocity Matching:重新思考 Diffusion 模型的生成動力學

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。