←新聞 9 / 12→

研究突破

透過 On-Policy Context Distillation 將 Agent 經驗內化至 Diffusion Model 權重

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

透過 On-Policy Context Distillation 將 Agent 經驗內化至 Diffusion Model 權重

arxiv.org · 2026-10-07

摘要

研究提出 D-OPCD 技術,將原本依賴外部 Agent 框架(如記憶、工作流協調)所產生的優化提示詞知識,蒸餾並內化到 Diffusion Model 的權重中。這意味著模型在僅接收原始查詢時,也能直接生成高品質影像,無需再依賴複雜的外部 Agent 輔助,大幅簡化了生成流程並提升了效率。

一項新研究提出名為「Diffusion On-Policy Context Distillation」(D-OPCD)的技術,目標是將文生圖 Agent 框架積累的知識轉移到擴散模型本身,讓生成模型僅憑原始查詢,就能保留部分 Agent 框架的效益。

解決的核心問題

傳統的文生圖 Agent 架構透過記憶、技能、工作流協調與迭代精煉等機制不斷優化提示詞,藉此改善生成效果。但這些改進只存在於外部框架中,每次推理都得重新調用完整的 Agent 系統,帶來兩項主要成本:一是隨著記憶與技能累積,要檢索相關指導愈來愈困難;二是每次請求都得重複執行推理、驗證與影像生成的運算。

研究團隊提出的 D-OPCD 要解決的就是這個瓶頸,把 Agent 發現的知識內化到生成模型的權重中,讓模型只收到原始查詢時,也能保留部分 Agent 的優勢。

技術方案:非對稱師生蒸餾

D-OPCD 採用自蒸餾框架,核心機制是不對稱的條件設定:

- 教師模型:同時接收原始查詢與 Agent 產生的優化提示詞 - 學生模型:只接收原始查詢 - 訓練信號:兩者在學生自身去噪軌跡上的預測差異

和先前方法不同,D-OPCD 把 Agent 生成的文字提示詞當作特權資訊交給教師,而不是依賴目標影像。這種設計避開離策略失配問題,直接對準「把 Agent 輔助生成轉移成只從原始查詢生成」的目標。

自演進技能提取機制

研究團隊開發了「Auto Skill Evolver」(ASE),作為測試時學習機制,把經驗組織成三層結構:

1. 事件(Episodes):Agent 在單一任務上的完整執行軌跡與反饋 2. 洞察(Insights):從事件中提取、可轉移的精煉方法 3. 技能(Skills):把多個洞察整合成可重複使用的指導

ASE 在每個批次後,由洞察管理員維護洞察庫;當洞察成熟(支持計數達到閾值 τ)時,再由技能管理員將其整合為新的技能庫版本,產生 successive harness versions。

實驗結果

研究在四個基準測試上評估:GenEval、GenEval2、WISE 與 R2I-Bench,初始生成模型為 Z-Image-Turbo。

### 直接生成性能提升

D-OPCD 讓無 Agent 輔助的直接生成平均得分從 60.52 提升到 65.09(提升 4.57 分),四個基準都有進步:

- GenEval:提升 3.06 分 - GenEval2:提升 4.10 分 - WISE:提升 7.14 分 - R2I-Bench:提升 3.96 分

### Agent 內化效果

把 D-OPCD 更新後的生成模型與無技能 Agent 框架配對,平均得分為 82.33 分,略高於原本配備進化技能的 Agent 的 81.83 分,簽名內化差 δ 為 +0.50。這表明 Agent 習得的大部分優勢已內化到模型權重中。

### 持續共同演進

模型吸收技能後,研究團隊重置技能庫並重新執行 ASE,得到新的進化技能。結果顯示,新技能在三個基準上進一步提升表現,平均達 84.16 分,超過更新後的無技能 Agent 與原始技能 Agent。只有 R2I-Bench 出現下降,研究團隊認為可能是該基準上無技能 Agent 的得分已經很高,留給新技能的改進空間有限。

對比基準測試

與其他方法對比,D-OPCD 在四個基準的平均得分上領先:

- Vanilla SFT:63.38(領先 1.71 分) - Diffusion-DPO:62.18 - D-OPSD:62.75

在 WISE 上,D-OPCD 比基礎生成模型高出 7.14 分。

方法設計探索

研究進一步檢視教師條件的重要性。相較於只提供優化提示詞,或提供無關任務的提示詞,把原始查詢與對應的 Agent 提示詞一併交給教師時,性能最好(65.09 分);打亂提示詞配對則使所有基準的得分下降,凸顯任務匹配的教師提示詞的價值。

針對訓練資料的上下文屬性,研究比較了三種設置:預設設置、只保留驗證相提升的配對,以及增加提示詞表達多樣性的適配器。多樣性適配器雖然增加了字符層級的變異,四基準平均得分卻略微下降,顯示哪些 Agent 上下文最有利於模型學習,仍是開放問題。

域外泛化

研究在保留的 T2I-CompBench++ 七個類別上評估域外性能,GenEval 與 GenEval2 訓練檢查點表現較好。例如 GenEval 檢查點在顏色類別從基礎生成的 77.45 提升到 81.61,2D 空間類別從 32.32 提升到 36.19。WISE 與 R2I-Bench 訓練檢查點則接近基礎模型。

已知局限

研究團隊在附錄中指出,內化技能演進經驗帶來的收益相對有限:D-OPCD 的直接生成與原始 Agent 的 81.83 分仍有差距。可能原因是技能演進產生的提示詞雖然在框架使用時有效,但可能與擴散模型的潛在空間對齊不佳,不利於僅從原始查詢學習相同的行為。此外,研究目前只評估了一個基礎生成模型,以及一輪 D-OPCD 更新後的單輪技能重新演進,尚未測試多個更新與重置循環的長期效果。

研究程式碼已公開發佈。

●開發者:可關注模型權重蒸餾與 Agent 整合的新架構

●投資人:AI 影像生成基礎設施的技術壁壘可能因效率提升而改變

●一般用戶:未來使用 AI 繪圖工具時,可能無需複雜設定即可獲得更精準結果

重要性評分

77/100

🟠 值得關注

Diffusion ModelAgentKnowledge DistillationText-to-ImageOn-Policy
原文出處
上一則← ReviewBench:開源 AI 程式碼審查基準測試下一則前 Ramp 工程師籌得 2000 萬美元,打造 Melius 創意生成平台 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。