Skip to main content
QUICK REVIEW

[论文解读] Learning Adversarially Robust Representations via Worst-Case Mutual Information Maximization

Sicheng Zhu, Xiao Zhang|arXiv (Cornell University)|Feb 26, 2020
Adversarial Robustness in Machine Learning参考文献 41被引用 9
一句话总结

本文提出了一种新颖的方法,通过在对抗扰动下最大化输入与表示之间的最坏情况互信息,学习对抗鲁棒表示。通过将表示鲁棒性形式化为最坏情况互信息,并使用正则化目标进行训练,该方法在CIFAR-10上实现了显著提升的对抗准确率(最高达31.5%),优于标准表示,并接近完全监督的对抗训练效果,同时在某些设置下也提升了自然准确率。

ABSTRACT

Training machine learning models that are robust against adversarial inputs poses seemingly insurmountable challenges. To better understand adversarial robustness, we consider the underlying problem of learning robust representations. We develop a notion of representation vulnerability that captures the maximum change of mutual information between the input and output distributions, under the worst-case input perturbation. Then, we prove a theorem that establishes a lower bound on the minimum adversarial risk that can be achieved for any downstream classifier based on its representation vulnerability. We propose an unsupervised learning method for obtaining intrinsically robust representations by maximizing the worst-case mutual information between the input and output distributions. Experiments on downstream classification tasks support the robustness of the representations found using unsupervised learning with our training principle.

研究动机与目标

  • 为解决下游模型在经过鲁棒训练后仍失效的根本性挑战,即学习对对抗扰动鲁棒的表示。
  • 基于最坏情况输入扰动下互信息的最大变化,定义一个理论基础坚实的表示脆弱性概念。
  • 建立基于表示脆弱性的对抗风险理论下界,将表示鲁棒性与下游分类器性能联系起来。
  • 开发一种无监督训练方法,通过最大化最坏情况互信息来诱导鲁棒表示,从而在表示学习阶段无需标签数据。
  • 通过实证验证,基于该原理学习到的表示可使下游分类器更具鲁棒性,并生成更具可解释性的显著性图。

提出的方法

  • 将表示脆弱性定义为在ℓ∞-Wasserstein球内扰动下,输入与表示之间互信息的最坏情况变化。
  • 提出一种训练目标,通过在表示脆弱性正则化下最大化输入与表示之间的最坏情况互信息,以促进鲁棒性。
  • 采用启发式算法,利用基于梯度的扰动和互信息估计来估计表示脆弱性。
  • 使用对比学习与对比损失,在无监督条件下训练编码器网络,并在表示脆弱性上添加正则化项。
  • 使用在学习到的表示上进行正常或对抗性训练的下游分类器头,以评估鲁棒性。
  • 通过基于梯度的归因方法可视化显著性图,以评估可解释性及与输入特征的一致性。

实验结果

研究问题

  • RQ1能否在对抗扰动下,通过最坏情况互信息形式化定义表示鲁棒性?
  • RQ2表示脆弱性与下游分类器可达到的最小对抗风险之间存在何种理论关系?
  • RQ3最坏情况互信息最大化能否产生使下游分类器更具鲁棒性的表示?
  • RQ4与标准表示学习相比,该方法是否同时提升了对抗准确率和自然准确率?
  • RQ5该方法学习到的表示是否更具可解释性,如显著性图质量所示?

主要发现

  • 当与下游分类器的对抗训练结合时,该方法在CIFAR-10上实现了31.5%的对抗准确率,显著优于基线标准表示(14.1%的对抗准确率)。
  • 在CIFAR-10上,使用该方法表示的下游分类器自然准确率达到62.5%,超过基线的58.8%。
  • 在MNIST上,该方法未提升自然准确率,表明泛化效果具有数据集依赖性。
  • 通过最坏情况互信息最大化学习到的表示的显著性图噪声更少,且与输入图像对齐更好,表明特征学习更具可解释性。
  • 消融实验表明,在标准(非鲁棒)表示上进行分类器鲁棒训练会导致自然准确率低于30%,证实鲁棒性必须嵌入表示本身。
  • 从表示脆弱性导出的对抗风险理论下界,为任何下游分类器可实现的鲁棒性设定了根本性极限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。