Skip to main content
QUICK REVIEW

[论文解读] Second Order Optimization for Adversarial Robustness and Interpretability

Theodoros Tsiligkaridis, Jay Roberts|arXiv (Cornell University)|Sep 10, 2020
Adversarial Robustness in Machine Learning参考文献 23被引用 6
一句话总结

本文提出 SCORPIO,一种二阶优化方法,通过使用 Frank-Wolfe 迭代对对抗风险进行二次逼近,以提升对抗鲁棒性与模型可解释性。该方法在显著减少训练时间的同时,实现了与对抗训练相当的鲁棒性,且梯度混淆更少,同时生成更高质量、人类可理解的显著性图,用于模型解释。

ABSTRACT

Deep neural networks are easily fooled by small perturbations known as adversarial attacks. Adversarial Training (AT) is a technique aimed at learning features robust to such attacks and is widely regarded as a very effective defense. However, the computational cost of such training can be prohibitive as the network size and input dimensions grow. Inspired by the relationship between robustness and curvature, we propose a novel regularizer which incorporates first and second order information via a quadratic approximation to the adversarial loss. The worst case quadratic loss is approximated via an iterative scheme. It is shown that using only a single iteration in our regularizer achieves stronger robustness than prior gradient and curvature regularization schemes, avoids gradient obfuscation, and, with additional iterations, achieves strong robustness with significantly lower training time than AT. Further, it retains the interesting facet of AT that networks learn features which are well-aligned with human perception. We demonstrate experimentally that our method produces higher quality human-interpretable features than other geometric regularization techniques. These robust features are then used to provide human-friendly explanations to model predictions.

研究动机与目标

  • 为解决对抗训练(AT)的高计算成本问题,同时保持对对抗攻击的强鲁棒性。
  • 通过在训练过程中引入曲率信息,减少对抗训练中常见的梯度混淆问题。
  • 通过学习鲁棒且与人类对齐的特征,提升模型可解释性,支持对比性解释。
  • 开发一种正则化器,利用相关正负特征高效生成高质量显著性图,用于模型预测解释。
  • 证明对抗攻击中的二阶信息可带来更可靠、更具可解释性的鲁棒模型。

提出的方法

  • 基于对抗风险的局部二次逼近,提出一种正则化器,利用一阶与二阶梯度信息,建模数据点附近的最坏情况损失。
  • 采用无投影的 Frank-Wolfe 迭代方法求解近似对抗攻击问题,避免昂贵的投影操作,减少超参数调优。
  • 使用有限差分近似高效计算曲率信息,实现比标准 AT 更快的训练,且额外计算量极小。
  • 将二次逼近的对抗损失整合到训练目标中作为正则化项,促进损失曲面的平滑性。
  • 开发基于扰动 δ_max 和 δ_min 的对比性解释框架,用于识别相关正负特征,实现人类友好的模型解释。
  • 将该方法应用于 L² 与 L∞ 鲁棒性,均在不同对抗范数下表现出一致的性能提升。

实验结果

研究问题

  • RQ1与标准对抗训练相比,对抗风险的二阶逼近是否能在保持鲁棒性的同时显著减少训练时间?
  • RQ2与基于梯度的正则化或对抗训练相比,将曲率信息纳入攻击近似是否能有效减少梯度混淆?
  • RQ3所得到的鲁棒模型是否能生成比现有几何正则化技术更高质量、人类可解释的显著性图?
  • RQ4与标准 PGD 攻击相比,二次逼近攻击在识别 SCORPIO 训练模型中的对抗样本方面是否同样有效?
  • RQ5SCORPIO 学习到的鲁棒特征在支持有意义的、反事实的模型预测解释方面,其有效性如何?

主要发现

  • SCORPIO 在仅使用一次 Frank-Wolfe 迭代的情况下,实现了与标准对抗训练几乎相当的对抗鲁棒性,但训练时间显著减少。
  • 与对抗训练相比,该方法遭受的梯度混淆更少,强黑盒攻击在 SCORPIO 正则化模型上仍能成功,验证了这一点。
  • 二次逼近攻击在寻找 SCORPIO 训练模型的对抗样本方面,效果与 PGD 攻击相当,证实了该近似的有效性。
  • 与先前的几何正则化方法相比,SCORPIO 生成的显著性图质量更高,相关正负特征更清晰、语义更明确。
  • 基于 δ_min 和 δ_max 的对比性解释框架成功识别出影响正确与错误预测的关键特征,例如图像误分类中缺少桅杆或翅膀等特征。
  • 该方法在 L² 与 L∞ 鲁棒性上均具有泛化能力,在不同对抗范数下均一致提升了鲁棒性与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。