[论文解读] VillanDiffusion: A Unified Backdoor Attack Framework for Diffusion Models
VillanDiffusion 是一种统一的后门攻击框架,适用于扩散模型,可泛化至去噪型和基于梯度的扩散模型、多种无训练采样器(如 DPM-Solver、DEIS),以及无条件与条件(文本到图像)生成。该框架通过图像或文本触发实现有效的后门攻击,无需修改采样器,证明即使未修改的文本编码器也可通过提示空间后门被利用,且在多种模型配置下均表现出强大成功率,同时可规避推理时防御机制。
Diffusion Models (DMs) are state-of-the-art generative models that learn a reversible corruption process from iterative noise addition and denoising. They are the backbone of many generative AI applications, such as text-to-image conditional generation. However, recent studies have shown that basic unconditional DMs (e.g., DDPM and DDIM) are vulnerable to backdoor injection, a type of output manipulation attack triggered by a maliciously embedded pattern at model input. This paper presents a unified backdoor attack framework (VillanDiffusion) to expand the current scope of backdoor analysis for DMs. Our framework covers mainstream unconditional and conditional DMs (denoising-based and score-based) and various training-free samplers for holistic evaluations. Experiments show that our unified framework facilitates the backdoor analysis of different DM configurations and provides new insights into caption-based backdoor attacks on DMs. Our code is available on GitHub: \url{https://github.com/IBM/villandiffusion}
研究动机与目标
- 为弥合扩散模型后门攻击研究中的空白,覆盖比以往工作更广泛的架构和推理方法。
- 通过在文本到图像模型的提示空间中注入触发,证明即使文本编码器未被修改,后门攻击依然有效。
- 评估现有防御机制(如推理时剪枝)在新型攻击设置下的鲁棒性,包括先进采样器和新型模型类型。
- 提供一个全面的后门分析框架,可泛化至主流的无条件与条件扩散模型及其推理流程。
提出的方法
- 该框架根据调度器(内容与噪声)、采样器(SDE 和 ODE 变体)以及生成类型(条件/无条件)对扩散模型进行分类,实现系统化的攻击覆盖。
- 推导生成采样的反向时间 SDE 和 ODE,识别出 ODE 中系数 1/2 导致先前方法(如 BadDiffusion)在 ODE 采样器上失效。
- 通过输入级扰动实施后门触发——无条件生成使用图像触发,文本到图像模型使用图像字幕触发——无需修改模型或采样器。
- 支持基于去噪的模型(如 DDPM)和基于梯度的模型(如 NCSN),实现在不同训练范式下的统一后门注入。
- 攻击设计为无训练且兼容现成采样器,确保在真实部署中的实际适用性。
- 在梯度更新中引入校正项,以保持在不同采样调度和噪声水平下的攻击有效性。
实验结果
研究问题
- RQ1后门攻击能否在具有不同调度器和噪声水平的去噪型与基于梯度的扩散模型之间实现泛化?
- RQ2后门攻击在先进、现成的无训练采样器(如 DPM-Solver、DEIS、UniPC)上的有效性如何?
- RQ3即使文本编码器未被修改,是否仍可通过提示空间对文本到图像扩散模型实施后门攻击?
- RQ4推理时剪枝防御在现代、多样化的扩散模型配置中是否仍对后门攻击有效?
- RQ5不同噪声调度和采样方法对后门攻击的成功率和隐蔽性有何影响?
主要发现
- 该框架在多个采样器和触发下实现近乎完美的攻击成功率,SSIM 值达到 0.999 或更高,表明后门生成质量极高。
- 在 CIFAR-10 上使用停车标志触发,VillanDiffusion 将 FID 从 BadDiffusion 的 26.62 降低至 DDIM 下 20% 污染率时的 18.16 和 50% 污染率时的 18.88,证明攻击效率更优。
- 该方法成功绕过推理时剪枝防御,当触发嵌入提示空间或使用 ODE 采样器时,该防御无法缓解攻击。
- 对于文本到图像模型,VillanDiffusion 即使在文本编码器冻结的情况下仍实现高攻击成功率(SSIM > 0.99),证明提示空间后门极为有效。
- 该框架在多种采样器(包括 DPM-Solver、DEIS、UniPC)上表现一致,多数配置下 MSE 值低于 5e-4,SSIM 值高于 0.99。
- 在高随机性(η=1.0)条件下,攻击依然有效,而 BadDiffusion 失效,表明 VillanDiffusion 在随机采样变化下具有更强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。