←新聞 5 / 12→

研究突破

Reading Between the Dots: 解碼填充詞元中的隱藏計算

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

Reading Between the Dots: 解碼填充詞元中的隱藏計算

arXiv cs.CL · 2026-07-07

摘要

研究發現前沿 LLM 可在看似無意義的填充詞元(如點號或計數序列)上進行多步推理,產生正確答案但無可見的思考鏈。研究團隊通過分析 DeepSeek V3 和 Kimi K2 等開源模型的隱藏狀態,揭示了模型如何在這些填充區域中以結構化方式進行計算,包括注意力路由、事實組合過程和因果關係驗證,為模型解釋性和可監督性研究提供了新的視角。

前沿大型語言模型(Frontier LLMs)能夠在無內容的填充詞元(filler tokens),例如點號或計數序列上執行多步推理,並產生正確答案,且過程中不顯示可見的思維鏈(Chain-of-Thought, CoT)。這構成了行為監督的一個極限案例,因為表面詞元不攜帶任何關於底層推理的資訊。然而,隱藏在輸出背後並不等同於對研究者隱藏。

研究團隊針對四個任務類別——事實檢索(fact retrieval)、平行數值組合(parallel numeric composition)、字串操作(string manipulation)以及上下文計算(in-context computation)——分析了兩個開源權重的前沿模型:DeepSeek V3 和 Kimi K2。分析顯示,這些模型以結構化且可解讀的方式在填充詞元上進行計算:注意力機制將問題路由至填充區域以獲取答案;Logit-lens 讀取顯示事實檢索在早期層級浮現,而組合過程在後期層級確立;此外,在填充位置進行的 KV-cache 移植(transplants)能因果性地交換不同範例的輸出。

研究團隊提出了一種無監督解碼管道(unsupervised decoding pipeline),僅以隱藏狀態為輸入,無需真實標籤或訓練,即可在兩個模型及所有四個任務中,以 80-95% 的準確率(最佳 LLM 評審)恢復中間數值。這表明,能夠規避行為 CoT 監控的隱藏計算,可直接從殘餘流(residual stream)中讀取,意味著可監督性(monitorability)是模型完整計算軌跡的屬性,而不僅限於表面詞元。

●開發者:可深入理解 LLM 內部推理機制,改進模型解釋性工具

●投資人:推動 AI 安全性和可解釋性技術發展方向

●一般用戶:助力開發更透明、可控的 AI 系統

重要性評分

76/100

🟠 值得關注

LLM 解釋性隱藏推理模型監督
原文出處
上一則← 美國首批自主無人地面車輛在烏克蘭參與戰鬥下一則審計的審計:基準有效性審計中的五種失敗模式 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。