Skip to main content
QUICK REVIEW

[论文解读] Over-parameterized Adversarial Training: An Analysis Overcoming the Curse of Dimensionality

Yi Zhang, Orestis Plevrakis|arXiv (Cornell University)|Feb 16, 2020
Adversarial Robustness in Machine Learning参考文献 25被引用 7
一句话总结

该论文首次提供了理论分析,表明使用ReLU网络进行对抗训练时,仅需多项式量级的宽度和迭代次数即可实现低鲁棒训练损失,从而克服了先前工作中所需的指数级过参数化。论文证明,在一个自然的数据可分性假设下,接近随机高斯初始化的两层ReLU网络可在多项式时间(d, n/ε)和宽度内实现对训练数据的鲁棒拟合,其核心是基于对阶跃函数的新型近似结果。

ABSTRACT

Adversarial training is a popular method to give neural nets robustness against adversarial perturbations. In practice adversarial training leads to low robust training loss. However, a rigorous explanation for why this happens under natural conditions is still missing. Recently a convergence theory for standard (non-adversarial) supervised training was developed by various groups for {\em very overparametrized} nets. It is unclear how to extend these results to adversarial training because of the min-max objective. Recently, a first step towards this direction was made by Gao et al. using tools from online learning, but they require the width of the net to be \emph{exponential} in input dimension $d$, and with an unnatural activation function. Our work proves convergence to low robust training loss for \emph{polynomial} width instead of exponential, under natural assumptions and with the ReLU activation. Key element of our proof is showing that ReLU networks near initialization can approximate the step function, which may be of independent interest.

研究动机与目标

  • 为理解为何对抗训练在存在极小-极大目标和非凸性的情况下仍能高效找到鲁棒模型,填补理论空白。
  • 克服先前工作中所需的指数级过参数化,此前其规模为(1/ε)^Ω(d)以实现鲁棒损失ε。
  • 在合理假设下,建立多项式宽度和多项式时间的对抗训练可实现低鲁棒损失。
  • 证明一个全新的近似理论结果:在初始化附近,ReLU网络可用多项式宽度近似阶跃函数。

提出的方法

  • 引入了一种类数据可分性假设,即训练样本之间的距离大于对抗扰动半径,该假设在CIFAR-10等真实数据集中成立。
  • 构建了一个接近随机高斯初始化的两层ReLU网络,其宽度为poly(d, n/ε),可鲁棒地拟合所有训练数据。
  • 提出一种新颖的近似论证,表明ReLU网络可通过接近初始化的权重近似阶跃函数,其理论基础为大数定律和高斯尾部概率不等式。
  • 通过梯度下降分析对抗训练的动力学,证明其在poly(d, n/ε)次迭代内收敛至鲁棒解。
  • 采用基于扰动的分析方法,研究输入扰动下网络输出的变化,利用指示函数和浓度不等式来界定ReLU激活值的变化差异。
  • 应用切尔诺夫不等式和对随机权重的联合界,控制在小扰动下激活符号发生变化的神经元数量。

实验结果

研究问题

  • RQ1能否仅使用多项式宽度和时间,而非指数级规模,实现ReLU网络对抗训练的低鲁棒训练损失?
  • RQ2在自然数据假设下,能否从理论上解释对抗训练的实证成功?
  • RQ3在随机初始化附近,ReLU网络能否用多项式宽度近似阶跃函数?
  • RQ4在标准过参数化设置下,对抗训练中的极小-极大目标是否能收敛至鲁棒解?

主要发现

  • 在自然数据可分性假设下,存在一个宽度为poly(d, n/ε)的两层ReLU网络,其接近高斯初始化,可实现ε的鲁棒训练损失。
  • 通过梯度下降进行的对抗训练可在poly(d, n/ε)次迭代内收敛至该网络,避免了对输入维度d的指数依赖。
  • 该网络的鲁棒性源于ReLU网络对阶跃函数的新型近似,且权重接近初始化,该结果本身具有独立的理论价值。
  • 分析表明,以高概率仅有O(√m)个神经元的激活符号在小扰动下发生变化,从而支持稳定的梯度更新。
  • 证明依赖于高斯向量的浓度测度和尾部概率不等式,确保在对抗扰动下大多数神经元保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。