←新聞 6 / 10→

研究突破

最弱環節:透過最壞情況約束強化學習蒸餾 LLM 推理能力

The Weakest Link: Distilling LLM Reasoning with Worst-Case Constrained Reinforcement Learning

最弱環節:透過最壞情況約束強化學習蒸餾 LLM 推理能力

arxiv.org · 2026-10-03

摘要

研究指出,將大型語言模型(LLM)的推理能力蒸餾至小型模型時,傳統方法容易因獎勵欺騙或過度正規化而導致邏輯缺陷。新提出的方法將此過程視為約束強化學習問題,強制要求推理鏈的每個步驟都必須符合最壞情況下的約束,以確保推理過程的嚴謹性與有效性。

破解軟性正則化的邏輯缺陷

要把大型語言模型(LLM)的推理能力蒸餾到小型模型,才能做到高效部署,但這件事很難。現有方法卡在兩難:只優化可驗證的任務獎勵(例如用 GRPO 演算法),學生模型容易「獎勵欺騙」,也就是靠有缺陷的中間邏輯,湊出正確的最終答案。反過來,用基於 KL 散度的軟性正則化限制學生與教師模型的差異,會稀釋任務表現,而且學生可以拿其他步驟的高教師一致性,去抵銷單一步驟的嚴重邏輯違規。研究指出,這種取平均的評估方式不符合推理的本質,因為思維鏈是否嚴謹,取決於最薄弱的那一環。

最壞情況約束強化學習框架

針對這個問題,研究團隊把推理蒸餾重新表述為約束強化學習問題。這個方法要求推理軌跡中每一個前綴的平均成本都不能超過特定閾值,藉此確保推理過程嚴謹。具體來說,每步成本定義為學生輸出在教師分佈下的負對數似然。傳統方法通常約束累積成本總和,會因序列長度不同而產生偏差,而且軟性約束讓模型可以生成大量高機率的安全詞彙,掩蓋局部的邏輯錯誤。新方法改用最壞情況平均約束,確保在任何生成階段,局部邏輯偏差都不會超出允許範圍,模型也就無法用「補償機制」蓋掉錯誤。

消除狀態增強與測試時依賴

標準的約束強化學習方法通常依賴拉格朗日對偶優化或狀態增強技術(如 Saute 演算法)。前者在 LLM 規模下計算成本高,也不穩定;後者需要在每個生成步驟追蹤剩餘預算,代表測試時必須存取教師模型,違背蒸餾的初衷。本研究利用 LLM 策略的歷史條件結構,推導出不需要狀態增強的約束馬可夫決策過程。最壞情況約束具有前綴單調性,只要某個前綴違反約束,整條軌跡就視為不可行,並進入吸收狀態。因此,剩餘預算可以視為生成歷史的確定性函數,不必當作額外的狀態變數處理,學生模型在測試時也就完全不需要教師模型。

低方差策略梯度分解

為了穩定優化過程,研究人員開發了一種低方差策略梯度分解方法。在約束情況下,標準的 REINFORCE 估計器方差極高,因為單一詞彙的選擇可能讓整個未來軌跡受到巨大懲罰。這個方法把梯度分解為單步項和長期項:單步項利用教師模型的單次前向傳播,解析計算期望獎勵,消除該步驟的採樣方差;長期項則保留蒙特卡洛估計,用於信用分配。這種分解提供詞彙層級的中間訊號,引導學生模型沿著合法的推理路徑走,同時在理論上保證約束幾乎必然被滿足。

數學與程式碼任務的實證表現

研究在 MATH、GSM-Symbolic 和 GSM8K 等數學推理資料集,以及 MBPP 和 APPS 等程式碼生成任務上做了大量實驗。結果顯示,該方法打破了準確率與忠實度之間的帕累托前沿。在 Qwen2.5-1.5B 蒸餾自 Qwen2.5-Math-7B-Instruct 的設定中,新方法的最終答案正確率(FAC)與純 RL 方法相當,約束滿足率(CS)和推理成功率(RSR)則明顯更高。相較之下,軟性正則化基線(GKD-GRPO)在提高準確率時,往往伴隨約束滿足率崩潰;在提高忠實度時,則嚴重犧牲準確率。LLM-as-a-Judge 的評估進一步證實,新方法生成的推理步驟在邏輯嚴謹性上優於其他基線,有效避免獎勵欺騙造成的邏輯漏洞。

●開發者:可關注基於最壞情況約束的強化學習演算法,以改善模型推理的可靠性

●投資人:AI 基礎設施與模型優化領域值得留意,特別是提升推理效率的技術突破

●一般用戶:未來可能體驗到更準確、邏輯更嚴謹的 AI 服務

重要性評分

67/100

🟠 值得關注

LLM強化學習模型蒸餾推理能力約束優化
原文出處
上一則← Redis 創始人推出 ds4,支援本地端執行 LLM下一則利用 Gemini Enterprise Agent Platform 建構零信任 AI Agent 的動態治理策略 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。