QUICK REVIEW
[论文解读] Guided Diffusion Model for Adversarial Purification from Random Noise
Quanlin Wu, Hang Ye|arXiv (Cornell University)|Jun 22, 2022
Adversarial Robustness in Machine Learning被引用 16
一句话总结
本文提出一种引导式去噪扩散模型,通过从随机噪声开始反向执行扩散过程,并利用扰动输入进行引导,从而净化对抗样本。该方法在CIFAR-10数据集上对PGD-ℓ∞攻击(ε=8/255)实现了89.62%的鲁棒准确率,并建立了无引导扩散去噪与随机平滑之间的理论联系,使基于扩散的平滑方法能够实现比基线方法更优的认证鲁棒性半径。
ABSTRACT
In this paper, we propose a novel guided diffusion purification approach to provide a strong defense against adversarial attacks. Our model achieves 89.62% robust accuracy under PGD-L_inf attack (eps = 8/255) on the CIFAR-10 dataset. We first explore the essential correlations between unguided diffusion models and randomized smoothing, enabling us to apply the models to certified robustness. The empirical results show that our models outperform randomized smoothing by 5% when the certified L2 radius r is larger than 0.5.
研究动机与目标
- 开发一种更高效且具备认证能力的对抗攻击防御方法,利用扩散模型实现防御。
- 探索无引导扩散去噪与随机平滑之间的理论联系,以实现认证鲁棒性。
- 通过利用对抗样本作为引导,从随机噪声出发引导扩散过程,提升对抗样本去噪的鲁棒性与效率。
- 分析在DDIM框架下,基于扩散的去噪过程中推理速度与鲁棒性之间的权衡。
- 证明引导式扩散去噪在认证鲁棒性方面优于现有方法,尤其在较大的ℓ2半径下表现更优。
提出的方法
- 该方法使用去噪扩散概率模型(DDPM)来逆转一个逐步向干净图像添加高斯噪声的前向扩散过程。
- 提出一种引导式反向过程,其中去噪网络以对抗输入为条件,使模型能够从随机噪声中恢复出干净图像,同时保留输入的语义结构。
- 反向过程被建模为一个马尔可夫链,其均值和方差由学习得到,其中均值由参数为θ的神经网络预测。
- 该方法利用DDIM加速推理,采用非马尔可夫反向过程并固定噪声调度,将步骤数从1000步减少至50步。
- 理论分析表明,无引导扩散过程近似于局部平滑,从而可推导出认证鲁棒性保证。
- 通过将扩散过程视为一种随机平滑机制,建立认证鲁棒性,其认证ℓ2半径由模型对噪声的容忍度推导得出。
实验结果
研究问题
- RQ1从随机噪声出发的引导式扩散去噪是否能在认证鲁棒性方面优于无引导扩散和随机平滑?
- RQ2无引导扩散去噪与随机平滑之间存在何种理论关系?
- RQ3引导式扩散过程如何影响认证鲁棒性半径与测试准确率?
- RQ4在基于扩散的对抗样本去噪中,使用DDIM时推理速度与鲁棒性之间的权衡关系如何?
- RQ5扩散模型能否提供强于现有基于生成模型方法的认证防御?
主要发现
- 所提出的引导式扩散模型在CIFAR-10上对PGD-ℓ∞攻击(ε=8/255)实现了89.62%的鲁棒准确率,优于标准对抗训练基线方法。
- 该方法通过将扩散过程视为一种局部平滑形式,实现了认证鲁棒性,可对对抗扰动提供可证明的防御保证。
- 对于认证ℓ2半径r > 0.5的情况,该方法在测试准确率上比随机平滑高出5%,展现出更优的认证鲁棒性。
- 与无引导扩散相比,从随机噪声出发的引导式去噪显著提升了鲁棒性,因为引导机制帮助模型更专注地从噪声中恢复干净图像。
- 使用DDIM将每张32×32图像的推理时间缩短至约0.92秒(50步反向过程),相比标准DDPM显著提升了效率。
- 理论分析证实,无引导扩散过程近似于局部平滑,从而为认证防御提供了理论依据;然而,引导设置下的更紧边界仍为开放挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。