研究突破
Mean Velocity Matching:重新思考 Diffusion 模型的生成動力學
Mean Velocity Matching: Rethinking Generative Dynamics in Diffusion Models

arxiv.org · 2026-09-23
摘要
研究團隊提出 Mean Velocity Matching (MVM),一種新的參數化方法用於擴散模型的隨機生成動力學。MVM 的核心創新是允許單一學習場直接支持隨機反向過程,無需額外估計或重構分數資訊,同時通過構造高斯擾動過程解決傳統速度迴歸在 t=0 附近發散的問題。這項工作簡化了生成模型的架構設計,對提升擴散模型的效率和靈活性具有重要意義。
由 Yunhong Zhang、Changjie Cao、Zhihua Zhang 及另外六位研究者組成的團隊,最近在機器學習領域提出一種新的參數化方法,稱為 Mean Velocity Matching(MVM),用來改進擴散模型中隨機生成過程的設計。這項研究已於 2026 年 9 月 21 日提交至 arXiv。
核心問題與解決方案
現有的速度基礎生成模型雖然只需學習單一傳輸場、設計簡潔,但標準形式本質上是確定性的。當模型要擴展到隨機設定時,通常得依賴額外的分數資訊,或是進行速度轉換為分數的中間重構步驟。
MVM 的作法是保留單一場預測的優勢,同時直接支持隨機反向動力學,做法是構造高斯擾動過程。在這個過程中,一個面向修復的速度——即 $(x_0-x_t)/t$——的條件期望,直接構成反向隨機微分方程(reverse-SDE)的漂移項。這樣一來,單一學習的場就足以參數化隨機反向過程,不需要額外估計或重構分數。
克服技術挑戰
研究團隊發現,直接對這種速度做迴歸,在接近時間 $t=0$ 時會出現無界的問題。為了解決這點,MVM 引入 $\sqrt{t}$ 縮放的參數化方法,這樣能保持反向動力學完整,同時讓訓練目標變成有界。
此外,這個學習場還會誘導出一個確定性的概率流 ODE,讓隨機和確定性採樣可以在同一個框架下研究。
實驗成果
研究團隊採用基於 Transformer 的生成模型做實驗驗證。在 ImageNet $32\times32$ 資料集上,MVM 在一定數量的函數評估下達成相應的 FID 分數;在解析度更高的 ImageNet $256\times256$ 資料集上也取得對應的性能指標。
研究團隊也做了受控的 SDE 與 ODE 比較,發現:函數評估數量極少時,ODE 表現較好;函數評估數量足夠多時,隨機反向過程則能達到更低的 FID 分數。
意義與應用
這些結果顯示,MVM 提供隨機反向動力學的直接單場參數化,同時維持具競爭力的生成品質。
●開發者:可採用 MVM 框架簡化擴散模型實現,減少計算複雜度
●投資人:生成模型基礎研究的性能突破可能加速商業化應用
●一般用戶:更高效的擴散模型可能帶來更快的圖像生成和內容創作工具
重要性評分
🔴 高度重要
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →
ChatGPT 小型企業工具集(Small Business Collection):16 個官方工具怎麼用、台灣店家該注意什麼
OpenAI 官方 ChatGPT 小型企業工具集共 16 個外掛,我們逐一核對官方目錄頁與工具詳情頁,整理成台灣店家看得懂的用法與注意事項——包含最容易被忽略的 Mercury 銀行外掛,以及方案、地區限制官方沒有講清楚的地方。
閱讀指南 →
TypeSafe Jev 實際上手:三個真實情境,看「只做判斷的 AI」能替你省掉哪些 if
拿到帳號後,我們用日報管線的真實資料把 TypeSafe Jev 跑了一輪:新聞分類、社群選題、讀者來信路由,外加幾個它做不到的邊界測試。附每一題的實際機率、422 拒絕原文,以及三個必須自己補的坑。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。