[论文解读] Improved Image Wasserstein Attacks and Defenses
本文提出了一种修正且更强的基于Wasserstein的距离对抗性威胁模型,适用于所有图像,解决了先前公式中的缺陷。该方法引入了受限Sinkhorn迭代,实现Wasserstein和ℓ∞球内的安全投影,从而支持更有效的攻击与防御;新攻击方法打破了先前的鲁棒模型,作者训练出一种在新旧攻击下均表现最优的鲁棒模型。
Robustness against image perturbations bounded by a $\ell_p$ ball have been well-studied in recent literature. Perturbations in the real-world, however, rarely exhibit the pixel independence that $\ell_p$ threat models assume. A recently proposed Wasserstein distance-bounded threat model is a promising alternative that limits the perturbation to pixel mass movements. We point out and rectify flaws in previous definition of the Wasserstein threat model and explore stronger attacks and defenses under our better-defined framework. Lastly, we discuss the inability of current Wasserstein-robust models in defending against perturbations seen in the real world. Our code and trained models are available at https://github.com/edwardjhu/improved_wasserstein .
研究动机与目标
- 识别并修正先前Wasserstein威胁模型中的关键缺陷,这些缺陷导致对抗性样本违反定义的扰动边界。
- 开发一种鲁棒、安全且高效的生成对抗性样本的方法,确保在明确定义的Wasserstein距离约束下进行。
- 通过修改PGD步骤,设计更强的对抗性攻击,提升对先前训练的鲁棒模型的攻击成功率。
- 训练一种新型对抗性鲁棒模型,使其在新攻击和先前攻击下均保持强性能,同时对真实世界扰动也保持有效性。
- 评估当前Wasserstein鲁棒模型在防御自然、平滑扰动(如平移、旋转和模糊)方面的局限性。
提出的方法
- 重新表述Wasserstein威胁模型,使其适用于任意维度的所有图像,而不仅限于归一化图像,确保数学一致性。
- 提出一种受限Sinkhorn迭代,将图像投影到Wasserstein球与ℓ∞球的交集中,确保同时满足两种约束。
- 在PGD中使用梯度ℓ2范数的最速下降步长,以增强攻击效果,超越标准PGD步骤。
- 将改进后的攻击方法整合到对抗性训练中,生成一种能跨多种威胁模型泛化的新型鲁棒模型。
- 应用运行时优化以抵消受限投影带来的计算开销,实现实际部署。
- 将受限Sinkhorn框架用作多功能工具,用于在未来的威胁模型中编码额外约束,如平滑性。
实验结果
研究问题
- RQ1如何为所有图像(而不仅是归一化图像)正确定义Wasserstein威胁模型,以避免生成无效的对抗性样本?
- RQ2是否存在一种计算高效且数学上严谨的方法,可将扰动同时投影到Wasserstein球和ℓ∞球内?
- RQ3通过修改PGD步长和方向,能否构建更强的对抗性攻击?其对先前模型鲁棒性的影响如何?
- RQ4以新攻击方法训练的模型在多大程度上能同时保持对新攻击和旧攻击的鲁棒性,包括对真实世界扰动的鲁棒性?
- RQ5能否利用所提出的受限Sinkhorn框架,有意义地将额外约束(如平滑性)整合到威胁模型中?
主要发现
- 所提出的受限Sinkhorn投影确保所有对抗性样本均保持在指定的Wasserstein和ℓ∞边界内,修复了先前工作中存在的关键缺陷。
- 新攻击方法的攻击成功率显著高于先前方法:在MNIST上,当ε×n_pixel = 100时,鲁棒准确率从94%降至39%;在CIFAR-10上,从82%降至20%。
- 经过对抗性训练的模型实现了最先进的鲁棒性,在干净数据上MNIST准确率达92.8%,CIFAR-10达84.4%,同时对先前攻击保持鲁棒。
- 尽管鲁棒性提升,新模型在防御大尺度真实世界扰动(如20°旋转,MNIST上准确率为79.1%;7像素高斯模糊,MNIST上准确率为58.4%)方面仍显不足,表明防御能力存在差距。
- 受限Sinkhorn方法具有可扩展性,可进一步扩展以整合如平滑性等额外约束,为未来威胁模型设计提供灵活基础。
- 本研究指出,当前的Wasserstein鲁棒模型在应对自然、感知对齐的扰动方面仍显不足,提示需要更表达力强的威胁模型与防御机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。