[论文解读] Denoising Diffusion Probabilistic Models as a Defense against Adversarial Attacks
本文提出使用去噪扩散概率模型(DDPMs)作为防御方法,通过添加噪声并进行反向去噪来净化对抗性样本。在PatchCamelyon数据集上,该方法将原始模型准确率提升至最高88%,显著优于原始模型和基线防御方法,同时仅需40步低噪声水平($ t^* = 0.04 $)即可实现快速推理。
Neural Networks are infamously sensitive to small perturbations in their inputs, making them vulnerable to adversarial attacks. This project evaluates the performance of Denoising Diffusion Probabilistic Models (DDPM) as a purification technique to defend against adversarial attacks. This works by adding noise to an adversarial example before removing it through the reverse process of the diffusion model. We evaluate the approach on the PatchCamelyon data set for histopathologic scans of lymph node sections and find an improvement of the robust accuracy by up to 88\% of the original model's accuracy, constituting a considerable improvement over the vanilla model and our baselines. The project code is located at https://github.com/ankile/Adversarial-Diffusion.
研究动机与目标
- 评估DDPMs作为通用防御方法在医学图像分类中对抗性攻击的防御效果。
- 应对生物医学人工智能中的鲁棒性挑战,其中微小扰动可能表示关键病理特征(如转移性组织)。
- 通过利用扩散模型的生成能力,在无需模型特定微调的情况下净化对抗性输入,从而超越现有防御方法。
- 通过使用低噪声水平($ t^* = 0.04 $)和仅40步反向过程,降低推理时间,使该方法在实际部署中更具可行性。
- 证明基于扩散的净化方法可在保持高标准准确率的同时,显著提升在敏感医学数据集上的鲁棒准确率。
提出的方法
- 应用前向扩散过程,使用学习到的噪声调度 $ \beta_t $ 和累积噪声水平 $ \bar{\alpha}_t $,向对抗性输入添加高斯噪声。
- 使用由神经网络 $ \mu_\theta(x_t, t) $ 参数化的反向扩散过程,从噪声输入中重建原始图像。
- 通过最大化证据下界(ELBO)训练DDPM,使模型学习反向去噪过程,从而恢复干净数据分布。
- 将训练好的DDPM作为分类器(如ResNet101)之前的预处理器,在推理阶段应用净化,无需微调分类器。
- 使用低噪声水平 $ t^* = 0.04 $,仅通过40步反向过程实现快速推理,相比先前工作显著降低计算成本。
- 使用投影梯度下降法生成自适应 $ \ell_\infty $-有界对抗性扰动,用于评估。
实验结果
研究问题
- RQ1在小扰动具有诊断意义的医学影像场景中,DDPM能否有效净化对抗性样本?
- RQ2在PatchCamelyon数据集上,基于DDPM的防御方法在鲁棒准确率方面与原始模型及对抗训练基线相比表现如何?
- RQ3低噪声、低步数的扩散过程在保持高标准准确率的同时,能在多大程度上提升鲁棒性?
- RQ4扩散模型重建图像与原始分布一致的能力,是否能转化为对对抗性输入的更好泛化性能?
- RQ5鉴于其模型无关的特性,该防御方法是否能无需重训练即可泛化至未见过的攻击类型?
主要发现
- 基于DDPM的防御在PatchCamelyon数据集上将鲁棒准确率提升至原始模型标准准确率的88%,显著优于原始模型和基线防御方法。
- 净化后方法保持了与原始模型相当的高标准准确率,表明扩散过程保留了具有诊断意义的特征。
- 在自适应 $ \ell_\infty $ 攻击下,鲁棒准确率达到75%,证明即使在对微小扰动敏感的数据上,该防御仍具有强大性能。
- 使用低噪声水平 $ t^* = 0.04 $ 仅需40步反向过程即可实现快速推理,相比先前基于扩散的防御方法计算效率更高。
- 该防御无需模型特定适配即可生效,得益于扩散模型的随机性和分布感知特性,展现出对未见攻击的强大泛化能力。
- 该方法优于对抗训练,后者在敏感的PatchCamelyon数据集上面临模型崩溃和高计算成本的问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。