新聞 10 / 12

安全倫理

Cyclic Denoising 攻擊揭露 Diffusion 模型中的超穩定記憶

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

Cyclic Denoising 攻擊揭露 Diffusion 模型中的超穩定記憶

arXiv cs.LG · 2026-06-24

摘要

研究人員發現一種名為 Cyclic Denoising 的新型提取攻擊方法,能透過重複的前向與反向擴散過程來露出圖像擴散模型中隱藏的訓練資料。這些「超穩定吸引子」能在經歷大幅損壞後自我重構,並在數千個去噪循環中持續存在,其中許多對應於被記憶的訓練圖像、品牌浮水印和網路爬蟲成品。該攻擊方法無需梯度、權重檢查或先驗知識,只需採樣器層級的控制,對 AI 模型的隱私與訓練資料安全構成重大威脅。

研究人員提出一種名為 Cyclic Denoising 的新型提取攻擊方法,透過在受控噪聲幅度下重複執行前向與反向擴散過程,來揭露圖像擴散模型中隱藏的訓練資料。這種方法受無序固體中隨機組織的啟發,能暴露標準採樣難以接觸的學習分佈區域,其動力學機制將樣本驅向具有廣泛穩定光譜的吸引子。其中最深層的吸引子被定義為超穩定(ultrastable),它們能在經歷近乎完全損壞後自我重構,並在數千個去噪循環中持續存在。

這些超穩定吸引子中許多對應於被記憶的訓練圖像,具體包括庫存照片(stock photographs)、品牌浮水印(brand watermarks)以及網路爬蟲產生的殘留物(web-crawl artifacts)。該攻擊僅需要採樣器層級的控制,不需要梯度、權重檢查、提示詞(prompts)、標題(captions)或對訓練資料的先驗知識。與依賴大規模提示生成及事後相似性或成員資格推斷過濾的生成與過濾攻擊(generate-and-filter attacks)不同,此主要協議是完全無條件的(fully unconditioned)。

研究人員在 Stable Diffusion v1.4 和像素空間 DDPM 中展示了該現象,證實了潛在空間與像素空間擴散模型之間的一致性行為。在不同噪聲幅度下,觀察到類似屈服(yielding-like)的過渡:低幅度循環產生平凡的吸收固定點或極限循環,而較大幅度則誘發重排、盆地跳躍(basin hopping)以及在結構化記憶吸引子盆地中的長期捕獲。此外,研究還觀察到分層部分吸收(hierarchical partial absorption)、提示穩定盆地(prompt-stabilized basins)以及恢復吸引子集跨初始條件的普遍性。結果顯示,Cyclic Denoising 既是生成景觀的物理啟發探針,也是記憶審查的實用工具,對隱私、版權合規及模型指紋識別具有影響。

開發者:需要重新評估擴散模型的隱私保護機制,考慮在模型設計階段加入防禦措施

投資人:模型安全性問題可能影響生成 AI 企業的商業價值與合規成本

一般用戶:訓練資料洩露風險提升,未來使用生成 AI 服務時需更加謹慎個人資料

重要性評分

78/100

🟠 值得關注

Diffusion 模型隱私攻擊訓練資料洩露
原文出處
上一則Fitbit Air 採用更聰慧的方式應對 AI 健康亂象下一則AI 世界變得『循環化』:智能代理群體可在背景無限運作

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。