安全倫理
Cyclic Denoising 攻擊揭露 Diffusion 模型中的超穩定記憶
Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

arXiv cs.LG · 2026-06-24
摘要
研究人員發現一種名為 Cyclic Denoising 的新型提取攻擊方法,能透過重複的前向與反向擴散過程來露出圖像擴散模型中隱藏的訓練資料。這些「超穩定吸引子」能在經歷大幅損壞後自我重構,並在數千個去噪循環中持續存在,其中許多對應於被記憶的訓練圖像、品牌浮水印和網路爬蟲成品。該攻擊方法無需梯度、權重檢查或先驗知識,只需採樣器層級的控制,對 AI 模型的隱私與訓練資料安全構成重大威脅。
研究人員提出一種名為 Cyclic Denoising 的新型提取攻擊方法,透過在受控噪聲幅度下重複執行前向與反向擴散過程,來揭露圖像擴散模型中隱藏的訓練資料。這種方法受無序固體中隨機組織的啟發,能暴露標準採樣難以接觸的學習分佈區域,其動力學機制將樣本驅向具有廣泛穩定光譜的吸引子。其中最深層的吸引子被定義為超穩定(ultrastable),它們能在經歷近乎完全損壞後自我重構,並在數千個去噪循環中持續存在。
這些超穩定吸引子中許多對應於被記憶的訓練圖像,具體包括庫存照片(stock photographs)、品牌浮水印(brand watermarks)以及網路爬蟲產生的殘留物(web-crawl artifacts)。該攻擊僅需要採樣器層級的控制,不需要梯度、權重檢查、提示詞(prompts)、標題(captions)或對訓練資料的先驗知識。與依賴大規模提示生成及事後相似性或成員資格推斷過濾的生成與過濾攻擊(generate-and-filter attacks)不同,此主要協議是完全無條件的(fully unconditioned)。
研究人員在 Stable Diffusion v1.4 和像素空間 DDPM 中展示了該現象,證實了潛在空間與像素空間擴散模型之間的一致性行為。在不同噪聲幅度下,觀察到類似屈服(yielding-like)的過渡:低幅度循環產生平凡的吸收固定點或極限循環,而較大幅度則誘發重排、盆地跳躍(basin hopping)以及在結構化記憶吸引子盆地中的長期捕獲。此外,研究還觀察到分層部分吸收(hierarchical partial absorption)、提示穩定盆地(prompt-stabilized basins)以及恢復吸引子集跨初始條件的普遍性。結果顯示,Cyclic Denoising 既是生成景觀的物理啟發探針,也是記憶審查的實用工具,對隱私、版權合規及模型指紋識別具有影響。
●開發者:需要重新評估擴散模型的隱私保護機制,考慮在模型設計階段加入防禦措施
●投資人:模型安全性問題可能影響生成 AI 企業的商業價值與合規成本
●一般用戶:訓練資料洩露風險提升,未來使用生成 AI 服務時需更加謹慎個人資料
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →
ChatGPT 小型企業工具集(Small Business Collection):16 個官方工具怎麼用、台灣店家該注意什麼
OpenAI 官方 ChatGPT 小型企業工具集共 16 個外掛,我們逐一核對官方目錄頁與工具詳情頁,整理成台灣店家看得懂的用法與注意事項——包含最容易被忽略的 Mercury 銀行外掛,以及方案、地區限制官方沒有講清楚的地方。
閱讀指南 →
TypeSafe Jev 實際上手:三個真實情境,看「只做判斷的 AI」能替你省掉哪些 if
拿到帳號後,我們用日報管線的真實資料把 TypeSafe Jev 跑了一輪:新聞分類、社群選題、讀者來信路由,外加幾個它做不到的邊界測試。附每一題的實際機率、422 拒絕原文,以及三個必須自己補的坑。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。