←新聞 8 / 9→

研究突破

DEEPO:雙重熵增強策略優化,解決多模態大語言模型的幻覺問題

DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

DEEPO:雙重熵增強策略優化,解決多模態大語言模型的幻覺問題

arXiv cs.AI · 2026-09-25

摘要

研究指出,強化學習在提升多模態大語言模型(MLLMs)推理能力時,對減少幻覺的效果並不穩定。研究團隊提出 DEEPO 演算法,透過結合語義熵觸發的專家前綴與梯度預條件技術,解決高風險查詢中優勢值歸零及錯誤預測難以更新的問題,從而更有效地抑制幻覺產生。

研究團隊指出,強化學習在提升多模態大語言模型推理能力時,對減少幻覺的效果並不穩定,根源在於從獎勵到參數更新的修正鏈存在兩個弱點。在 rollout 層級,高語義熵的困難查詢經常產生全數錯誤的樣本組,導致群組相對優勢值歸零,這正是幻覺風險最高的時刻。在優化層級,自信但錯誤的 token 呈現梯度不可見狀態,由於分類策略的預期分數梯度範數隨分佈銳化而消失,使得最需要修正的預測反而獲得最弱的更新。

為此,研究提出雙重熵增強策略優化(DEEPO)演算法,結合信號變異數正則化與梯度預條件技術。透過語義熵觸發的專家前綴,在高度不確定的查詢中注入接地續接,提供直接監督並恢復優勢變異數;同時採用優勢符號感知的 Renyi 預條件技術,抵銷對數層級的飽和現象,使修正能到達操作信心區間內的自信錯誤。

實驗結果顯示,DEEPO 的兩個分支各自優於 GRPO,且兩者的交互作用在 VideoMMMU 評估套件中最複雜的長程任務上具有統計顯著性,效能提升 +4.0(95% CI [1.1, 6.9]),在其他任務上則呈現加性效果。該方法在降低幻覺的同時,保持了準確率與訓練穩定性。

●開發者:可關注 DEEPO 演算法在強化學習中的應用,以改善模型推理的準確性

●投資人:多模態 AI 基礎設施與演算法優化領域值得留意

●一般用戶:未來使用的 AI 助手在處理複雜多模態任務時,產生錯誤資訊的機率有望降低

重要性評分

67/100

🟠 值得關注

多模態大語言模型幻覺問題強化學習DEEPO策略優化
原文出處
上一則← 一家公司成為多起 rogue AI 攻擊事件的核心源頭下一則Astra 與 Opus 通過圖靈測試的另一項挑戰 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。