←新聞 10 / 12→

研究突破

COMPASS:在語言模型中定位推理能力的關鍵位置

COMPASS: Finding Where Reasoning Lives in Language Models

COMPASS:在語言模型中定位推理能力的關鍵位置

arxiv.org · 2026-10-08

摘要

研究團隊提出 COMPASS 方法,透過分析模型直接回答的正確性,成功識別出負責數學推理的特定注意力頭(attention heads)。這種推論時期的引導技術無需複雜的提示工程或對比學習,僅憑簡單的激活統計即可顯著提升大型語言模型的數學解題表現。這項突破為理解與增強 AI 推理能力提供了更直觀且高效的技術路徑。

簡化正確判斷 識別模型內部推理樞紐

一項新研究提出 COMPASS 方法,透過分析語言模型直接回答問題的對錯,找出負責推理的特定注意力頭。這種推論時期的引導技術僅需各注意力頭的激活統計,即可提升模型的數學解題表現。

無需外部指導的推理信號

傳統方法要求預先定義推理的樣貌──透過鏈式思考(CoT)提示設計、對比式鏈式思考方向,或從稀疏自動編碼器(SAE)提取特徵。COMPASS 則發現,對於具有可驗證答案的數學推理,一個更簡單的信號就足夠:模型直接作答的正確性本身。

研究團隊在一組數學問題上執行單次直接回答提示,並記錄每次生成前、每個注意力頭在最後提示詞位置的激活狀態。通過比較正確與錯誤答案的激活平均值,他們計算出每個注意力頭的「正確性方向」。這個方向無需鏈式思考範例、預定義的推理特徵或成對對比提示,完全從模型自身的表現標籤中推導而來。

從可解碼性到因果效應

正確性資訊可以從許多注意力頭的激活中解碼,但解碼能力本身並不保證能有效改變模型輸出。研究團隊發現,只有少數注意力頭真正對生成結果產生因果影響。

COMPASS 利用歸因評分來識別這些關鍵頭。方法是將正確與錯誤答案對應的首個生成詞彙的分佈差異映射到層輸入空間,然後評估每個注意力頭對這個目標方向的對齊程度。得分最高的注意力頭被選中進行干預。

效能與效率的突破

在 Llama-3.1-8B、Qwen3-4B 和 Gemma4-12B 三個模型系列上測試,COMPASS 在多個數學基準上優於現有激活引導方法。在 GSM8K 基準上,準確率平均提升 16 個百分點。例如 Llama-3.1-8B 的準確率從 66.8% 提至 83.7%,Qwen3-4B 從 76.2% 提至 89.8%。

與鏈式思考相比,COMPASS 用更少的生成詞彙達成接近的準確率。Qwen3-4B 在 SVAMP 基準上生成 68 個詞彙相對於鏈式思考的 224 個詞彙,準確率仍達 90.7% 對比 91.7%。

集中在極少數頭部的效應

研究顯示,干預效應高度集中在為數不多的注意力頭內。在 Llama-3.1-8B GSM8K 任務上,當僅保留單一最高評分的注意力頭時,模型仍保留了 +10.0 個百分點的改進(相對於 +18.7 個總改進)。

消融實驗證實,正確性方向和干預位置缺一不可。在 MATH-500 上,隨機選擇注意力頭時準確率為 41.1%,與 40.8% 的基準相差不到 1/3 個百分點;隨機選擇方向則為 39.7%,低於基準。當反轉正確性方向的符號時,模型準確率甚至跌至無干預時的基準以下,確認該方向是朝向正確性的有符號方向,而非任意的變異軸。

跨數據集的遷移能力

在未見過的基準上測試遷移能力時,從 GSM8K 擬合的方向、注意力頭選擇和干預強度直接應用於 GSM-Plus,無需重新調整。Llama-3.1-8B 準確率從 60.4% 升至 71.1%,Qwen3-4B 從 65.6% 升至 80.4%。在更難的 HARP 競賽級基準上,Qwen3-4B 準確率從 35.4% 提升至 49.1%。這表明所識別的干預策略捕捉的是模型的內在性質,而非對特定數據集的過擬合。

內部控制的簡潔性

與需要訓練輔助模型的 SAE 方法不同,COMPASS 只需計算各注意力頭在正確和錯誤樣本上分別的平均激活。整個過程僅需單次前向傳播,無需複雜的輔助模組或額外的訓練步驟,使其部署成本低廉且高效。

●開發者:可關注推論時期的激活引導技術,優化模型推理效能

●投資人:AI 推理能力突破可能加速垂直領域應用落地

●一般用戶:未來 AI 助手在數學與邏輯任務上的準確度將大幅提升

重要性評分

77/100

🟠 值得關注

大型語言模型推理能力注意力機制推論引導數學解題
原文出處
上一則← 使用 LLM 將 TypeScript 編譯器、檢查器與 LSP 移植至 Rust下一則Biohub 擴資至 18 億美元,推動 AI 模擬人類細胞願景 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。