研究突破
DEEPO:雙重熵增強策略優化,解決多模態大語言模型的幻覺問題
DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

arXiv cs.AI · 2026-09-25
摘要
研究指出,強化學習在提升多模態大語言模型(MLLMs)推理能力時,對減少幻覺的效果並不穩定。研究團隊提出 DEEPO 演算法,透過結合語義熵觸發的專家前綴與梯度預條件技術,解決高風險查詢中優勢值歸零及錯誤預測難以更新的問題,從而更有效地抑制幻覺產生。
研究團隊指出,強化學習在提升多模態大語言模型推理能力時,對減少幻覺的效果並不穩定,根源在於從獎勵到參數更新的修正鏈存在兩個弱點。在 rollout 層級,高語義熵的困難查詢經常產生全數錯誤的樣本組,導致群組相對優勢值歸零,這正是幻覺風險最高的時刻。在優化層級,自信但錯誤的 token 呈現梯度不可見狀態,由於分類策略的預期分數梯度範數隨分佈銳化而消失,使得最需要修正的預測反而獲得最弱的更新。
為此,研究提出雙重熵增強策略優化(DEEPO)演算法,結合信號變異數正則化與梯度預條件技術。透過語義熵觸發的專家前綴,在高度不確定的查詢中注入接地續接,提供直接監督並恢復優勢變異數;同時採用優勢符號感知的 Renyi 預條件技術,抵銷對數層級的飽和現象,使修正能到達操作信心區間內的自信錯誤。
實驗結果顯示,DEEPO 的兩個分支各自優於 GRPO,且兩者的交互作用在 VideoMMMU 評估套件中最複雜的長程任務上具有統計顯著性,效能提升 +4.0(95% CI [1.1, 6.9]),在其他任務上則呈現加性效果。該方法在降低幻覺的同時,保持了準確率與訓練穩定性。
●開發者:可關注 DEEPO 演算法在強化學習中的應用,以改善模型推理的準確性
●投資人:多模態 AI 基礎設施與演算法優化領域值得留意
●一般用戶:未來使用的 AI 助手在處理複雜多模態任務時,產生錯誤資訊的機率有望降低
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

Laya 開源決策模型中文實測:零樣本 53 題判斷題結果
Laya 是 Apache 2.0 的開源決策模型,不生成文字、只做選擇題。我們用 53 題中文長文判斷題零樣本實測,記錄結果、設定陷阱與使用建議。
閱讀指南 →
AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →
ChatGPT 小型企業工具集(Small Business Collection):16 個官方工具怎麼用、台灣店家該注意什麼
OpenAI 官方 ChatGPT 小型企業工具集共 16 個外掛,我們逐一核對官方目錄頁與工具詳情頁,整理成台灣店家看得懂的用法與注意事項——包含最容易被忽略的 Mercury 銀行外掛,以及方案、地區限制官方沒有講清楚的地方。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。