新聞 5 / 12

研究突破

高效能邊緣 RAG:在 Snapdragon X Elite 的行動 NPU 上實現端到端部署

Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite

高效能邊緣 RAG:在 Snapdragon X Elite 的行動 NPU 上實現端到端部署

arXiv cs.CL · 2026-06-11

摘要

研究團隊在高通 Snapdragon X Elite 晶片的 Hexagon NPU 上首次實現完整的 RAG(檢索增強生成)管道,涵蓋 embedding、reranking 和 LLM 生成全流程。相比 CPU 執行,NPU 加速方案在 embedding 吞吐量提升 9.1 倍、系統能耗降低 12.3 倍,LLM prefilling 快 18.1 倍,整體查詢延遲和能耗均降低 4 倍,展示邊緣 AI 推理的巨大潛力。

研究團隊在 Qualcomm Snapdragon X Elite 晶片的 Hexagon NPU 上,首次實現了涵蓋 embedding、reranking 與 LLM 生成全流程的端到端 RAG 管道。這項研究針對 Dell XPS 13 筆電進行效能分析,將 NPU 加速方案與 CPU 及 OpenCL/Adreno GPU 基線進行對比,解決了 CPU 推理導致的高能耗問題。

在索引(indexing)階段,NPU 的 embedding 吞吐量比 CPU 高出 9.1 倍,且系統能耗降低 12.3 倍。針對包含 120 個查詢的 Wikipedia-passage 基準測試,NPU 的 LLM prefilling 速度比 CPU 快 18.1 倍,整體查詢延遲降低 4.0 倍,系統能耗同樣降低 4.0 倍。相比之下,整合式 GPU 在相同工作負載下比 CPU 慢 1.7 倍,且能耗是 NPU 的 6.5 倍。

在答案品質方面,GPT-4.1 LLM-as-judge 評估顯示,NPU 生成的答案品質與 CPU 和 GPU 相當,三者評分均值分別為 9.32、8.95 與 9.03(滿分 10 分)。數據顯示,86.7% 的查詢在所有三個後端獲得了相同的評分,證明在 Snapdragon X Elite 上實現高效能 RAG 不會導致品質下降。研究團隊預期此方法可推廣至 Apple Neural Engine、Intel NPU 及 MediaTek APU 等具備軟體堆疊成熟度的行動 NPU 平台。

開發者:可評估在行動設備上部署本地 RAG 應用的可行性,NPU 加速為低功耗推理提供新方向

投資人:邊緣計算和 NPU 加速晶片市場前景看好,行動 AI 性能躍進將推動應用落地

一般用戶:筆電和手機上將支援離線、低延遲的 RAG 應用,隱私保護更完善

重要性評分

76/100

🟠 值得關注

邊緣計算RAGNPU加速
原文出處
上一則Lung-R1:知識圖譜引導的肺部診斷推理 LLM下一則Amazon 融資 17.5 億美元銀行貸款,AI 支出持續攀升

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。