研究突破
透過 On-Policy Context Distillation 將 Agent 經驗內化至 Diffusion Model 權重
Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

arxiv.org · 2026-10-07
摘要
研究提出 D-OPCD 技術,將原本依賴外部 Agent 框架(如記憶、工作流協調)所產生的優化提示詞知識,蒸餾並內化到 Diffusion Model 的權重中。這意味著模型在僅接收原始查詢時,也能直接生成高品質影像,無需再依賴複雜的外部 Agent 輔助,大幅簡化了生成流程並提升了效率。
一項新研究提出名為「Diffusion On-Policy Context Distillation」(D-OPCD)的技術,目標是將文生圖 Agent 框架積累的知識轉移到擴散模型本身,讓生成模型僅憑原始查詢,就能保留部分 Agent 框架的效益。
解決的核心問題
傳統的文生圖 Agent 架構透過記憶、技能、工作流協調與迭代精煉等機制不斷優化提示詞,藉此改善生成效果。但這些改進只存在於外部框架中,每次推理都得重新調用完整的 Agent 系統,帶來兩項主要成本:一是隨著記憶與技能累積,要檢索相關指導愈來愈困難;二是每次請求都得重複執行推理、驗證與影像生成的運算。
研究團隊提出的 D-OPCD 要解決的就是這個瓶頸,把 Agent 發現的知識內化到生成模型的權重中,讓模型只收到原始查詢時,也能保留部分 Agent 的優勢。
技術方案:非對稱師生蒸餾
D-OPCD 採用自蒸餾框架,核心機制是不對稱的條件設定:
- 教師模型:同時接收原始查詢與 Agent 產生的優化提示詞 - 學生模型:只接收原始查詢 - 訓練信號:兩者在學生自身去噪軌跡上的預測差異
和先前方法不同,D-OPCD 把 Agent 生成的文字提示詞當作特權資訊交給教師,而不是依賴目標影像。這種設計避開離策略失配問題,直接對準「把 Agent 輔助生成轉移成只從原始查詢生成」的目標。
自演進技能提取機制
研究團隊開發了「Auto Skill Evolver」(ASE),作為測試時學習機制,把經驗組織成三層結構:
1. 事件(Episodes):Agent 在單一任務上的完整執行軌跡與反饋 2. 洞察(Insights):從事件中提取、可轉移的精煉方法 3. 技能(Skills):把多個洞察整合成可重複使用的指導
ASE 在每個批次後,由洞察管理員維護洞察庫;當洞察成熟(支持計數達到閾值 τ)時,再由技能管理員將其整合為新的技能庫版本,產生 successive harness versions。
實驗結果
研究在四個基準測試上評估:GenEval、GenEval2、WISE 與 R2I-Bench,初始生成模型為 Z-Image-Turbo。
### 直接生成性能提升
D-OPCD 讓無 Agent 輔助的直接生成平均得分從 60.52 提升到 65.09(提升 4.57 分),四個基準都有進步:
- GenEval:提升 3.06 分 - GenEval2:提升 4.10 分 - WISE:提升 7.14 分 - R2I-Bench:提升 3.96 分
### Agent 內化效果
把 D-OPCD 更新後的生成模型與無技能 Agent 框架配對,平均得分為 82.33 分,略高於原本配備進化技能的 Agent 的 81.83 分,簽名內化差 δ 為 +0.50。這表明 Agent 習得的大部分優勢已內化到模型權重中。
### 持續共同演進
模型吸收技能後,研究團隊重置技能庫並重新執行 ASE,得到新的進化技能。結果顯示,新技能在三個基準上進一步提升表現,平均達 84.16 分,超過更新後的無技能 Agent 與原始技能 Agent。只有 R2I-Bench 出現下降,研究團隊認為可能是該基準上無技能 Agent 的得分已經很高,留給新技能的改進空間有限。
對比基準測試
與其他方法對比,D-OPCD 在四個基準的平均得分上領先:
- Vanilla SFT:63.38(領先 1.71 分) - Diffusion-DPO:62.18 - D-OPSD:62.75
在 WISE 上,D-OPCD 比基礎生成模型高出 7.14 分。
方法設計探索
研究進一步檢視教師條件的重要性。相較於只提供優化提示詞,或提供無關任務的提示詞,把原始查詢與對應的 Agent 提示詞一併交給教師時,性能最好(65.09 分);打亂提示詞配對則使所有基準的得分下降,凸顯任務匹配的教師提示詞的價值。
針對訓練資料的上下文屬性,研究比較了三種設置:預設設置、只保留驗證相提升的配對,以及增加提示詞表達多樣性的適配器。多樣性適配器雖然增加了字符層級的變異,四基準平均得分卻略微下降,顯示哪些 Agent 上下文最有利於模型學習,仍是開放問題。
域外泛化
研究在保留的 T2I-CompBench++ 七個類別上評估域外性能,GenEval 與 GenEval2 訓練檢查點表現較好。例如 GenEval 檢查點在顏色類別從基礎生成的 77.45 提升到 81.61,2D 空間類別從 32.32 提升到 36.19。WISE 與 R2I-Bench 訓練檢查點則接近基礎模型。
已知局限
研究團隊在附錄中指出,內化技能演進經驗帶來的收益相對有限:D-OPCD 的直接生成與原始 Agent 的 81.83 分仍有差距。可能原因是技能演進產生的提示詞雖然在框架使用時有效,但可能與擴散模型的潛在空間對齊不佳,不利於僅從原始查詢學習相同的行為。此外,研究目前只評估了一個基礎生成模型,以及一輪 D-OPCD 更新後的單輪技能重新演進,尚未測試多個更新與重置循環的長期效果。
研究程式碼已公開發佈。
●開發者:可關注模型權重蒸餾與 Agent 整合的新架構
●投資人:AI 影像生成基礎設施的技術壁壘可能因效率提升而改變
●一般用戶:未來使用 AI 繪圖工具時,可能無需複雜設定即可獲得更精準結果
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

agents-cli 教學:繁中完整上手指南(功能、定價、實測)
本文提供 agents-cli 教學,詳解 agents-cli 是什麼、怎麼用。涵蓋安裝步驟、中文介面設定、免費方案與實測功能,助您快速上手 AI 代理工具。
閱讀指南 →
AI Agent 是什麼?怎麼用?2026 白話文入門完整說明
AI Agent 是什麼?跟普通 ChatGPT 有何不同?本文用白話文解釋 AI 代理人的概念、怎麼讓 AI 自主完成多步驟任務,以及 2026 年最實用的 AI Agent 應用場景。
閱讀指南 →
2026 AI Agent 開發全攻略:從 Claude Code CLI 到 Agent SDK 深度解析
探索 2026 年 AI Agent 開發核心,深入解析 claude code cli 實戰應用與 claude agent sdk 架構。涵蓋 subagents 策略、開發流程及產業趨勢,提供從入門到進階的完整指南。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。