Skip to main content
QUICK REVIEW

[论文解读] Monge blunts Bayes: Hardness Results for Adversarial Training

Zac Cranko, Aditya Krishna Menon|arXiv (Cornell University)|Jun 8, 2018
Adversarial Robustness in Machine Learning被引用 3
一句话总结

本文提出一个形式化框架,通过将积分概率度量推广为‘有害性’度量 γ,识别在对抗训练中严重降低学习性能的对手。研究表明,对于利普希茨连续分类器,最优传输可实现高效、与损失无关的对手,其通过压缩类别边际实现;实验验证表明,此类对手虽降低标准准确率,但能提升模型鲁棒性,从而改善泛化性能。

ABSTRACT

The last few years have seen a staggering number of empirical studies of the robustness of neural networks in a model of adversarial perturbations of their inputs. Most rely on an adversary which carries out local modifications within prescribed balls. None however has so far questioned the broader picture: how to frame a resource-bounded adversary so that it can be severely detrimental to learning, a non-trivial problem which entails at a minimum the choice of loss and classifiers. We suggest a formal answer for losses that satisfy the minimal statistical requirement of being proper. We pin down a simple sufficient property for any given class of adversaries to be detrimental to learning, involving a central measure of "harmfulness" which generalizes the well-known class of integral probability metrics. A key feature of our result is that it holds for all proper losses, and for a popular subset of these, the optimisation of this central measure appears to be independent of the loss. When classifiers are Lipschitz -- a now popular approach in adversarial training --, this optimisation resorts to optimal transport to make a low-budget compression of class marginals. Toy experiments reveal a finding recently separately observed: training against a sufficiently budgeted adversary of this kind improves generalization.

研究动机与目标

  • 形式化资源受限对手在对抗训练中对学习造成严重损害的条件。
  • 通过广义度量 γ 识别对抗损害的充分条件,该度量扩展了积分概率度量和最大均值差异。
  • 分析利普希茨连续分类器在通过最优传输实现高效、与损失无关的对手中的作用。
  • 证明通过最优传输压缩类别边际设计的对手可改善泛化性能,即使损害标准准确率。
  • 提供理论与实证依据,表明常见对抗训练技术隐式使用了所提出有害对手的代理。

提出的方法

  • 引入广义度量 γ,用于量化对手的‘有害性’,扩展积分概率度量,并与最大均值差异建立联系。
  • 证明对于适当损失(如对数损失、平方损失和松本损失),γ 的优化与损失函数无关,从而实现与损失无关的对手设计。
  • 应用最优传输理论,建模在利普希茨约束下最小化 γ 的对手,实现对类别边际的低预算压缩。
  • 采用两阶段框架:首先计算最优传输计划,将干净数据分布映射为对抗性分布;其次在变换后的数据上进行训练。
  • 使用无梯度优化和线性规划,在图像像素的 L1 预算约束下计算 Monge 类型对手。
  • 在 1D 合成数据和 USPS 手写数字(1 对 3)上验证方法,采用逻辑回归和 mixup 类似对手。

实验结果

研究问题

  • RQ1在损失为适当损失的情况下,资源受限对手在何种条件下可被严格证明对学习具有破坏性?
  • RQ2对手的有害性能否独立于损失函数进行量化?若可,其一般形式为何?
  • RQ3分类器的利普希茨连续性如何影响对抗攻击在最优传输框架下的结构与效率?
  • RQ4常用对抗训练技术在多大程度上隐式依赖于通过最优传输压缩类别边际的对手?
  • RQ5针对此类基于最优传输的对手进行训练,是否能改善泛化性能,即使以牺牲标准准确率为代价?

主要发现

  • 本文证明,对抗损害的充分条件是优化广义度量 γ,该度量扩展了积分概率度量,并对一大类适当损失与损失函数无关。
  • 对于利普希茨分类器,最优对手对应于通过最优传输对类别边际进行低预算压缩,形式化了对手如何‘缩小类别间差距’。
  • 在 1D 简化实验中,mixup 对手在 α → 1 时达到损失 ℓ₀,证实对手可迫使模型收敛至 50% 准确率(即随机猜测水平)。
  • 在 USPS 数字数据集上,Monge 对手成功将数字 1 和 3 转换为在不断增加预算(α/d = 0.15 至 0.6)下可信的对抗样本,展示了平滑且可控的扰动。
  • 实证结果表明,使用此类对手扰动的数据进行训练可改善泛化性能,与 Tsipras 等人(2019)和 Zhang 等人(2018)的先前观察一致。
  • 本研究提供了理论与实证依据,表明常见对抗训练方法隐式使用了所提出最优传输对手的代理,提示其成功背后存在统一原理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。