Skip to main content
QUICK REVIEW

[论文解读] Adversarial Rademacher Complexity of Deep Neural Networks

Jiancong Xiao, Yanbo Fan|arXiv (Cornell University)|Nov 27, 2022
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文首次利用覆盖数方法,针对经过鲁棒化处理的函数类,提出了深度神经网络对抗Rademacher复杂度(ARC)的理论界。通过分析深度神经网络中的权重范数与间隔,建立了泛化界,解释了对抗泛化性能差的原因,并验证了权重衰减在提升鲁棒性方面的作用。

ABSTRACT

Deep neural networks are vulnerable to adversarial attacks. Ideally, a robust model shall perform well on both the perturbed training data and the unseen perturbed test data. It is found empirically that fitting perturbed training data is not hard, but generalizing to perturbed test data is quite difficult. To better understand adversarial generalization, it is of great interest to study the adversarial Rademacher complexity (ARC) of deep neural networks. However, how to bound ARC in multi-layers cases is largely unclear due to the difficulty of analyzing adversarial loss in the definition of ARC. There have been two types of attempts of ARC. One is to provide the upper bound of ARC in linear and one-hidden layer cases. However, these approaches seem hard to extend to multi-layer cases. Another is to modify the adversarial loss and provide upper bounds of Rademacher complexity on such surrogate loss in multi-layer cases. However, such variants of Rademacher complexity are not guaranteed to be bounds for meaningful robust generalization gaps (RGG). In this paper, we provide a solution to this unsolved problem. Specifically, we provide the first bound of adversarial Rademacher complexity of deep neural networks. Our approach is based on covering numbers. We provide a method to handle the robustify function classes of DNNs such that we can calculate the covering numbers. Finally, we provide experiments to study the empirical implication of our bounds and provide an analysis of poor adversarial generalization.

研究动机与目标

  • 为解决深度神经网络(DNNs)中对抗Rademacher复杂度(ARC)缺乏理论界的问题,特别是针对多层架构的挑战。
  • 解决ARC定义中最大值操作分析的难题,该问题阻碍了标准技术如逐层剥离法和覆盖数方法的应用。
  • 为DNNs提供一个严格的ARC上界,可用于理解并量化鲁棒泛化差距。
  • 通过分析权重范数、间隔以及正则化(如权重衰减)对对抗泛化的影响,对理论洞见进行实证验证。

提出的方法

  • 提出一种新颖方法,利用覆盖数为鲁棒化函数类的DNN对抗Rademacher复杂度建立上界。
  • 引入一种处理ARC定义中最大值操作的技术,通过分析DNN的权重矩阵范数和激活函数结构来实现。
  • 推导出一个依赖于层间权重范数乘积(如Frobenius范数或1,∞-范数)和训练数据间隔的ARC上界。
  • 利用该上界分析鲁棒泛化差距,并将其与正则化(尤其是权重衰减)联系起来。
  • 在CIFAR-10和CIFAR-100上进行实验,比较标准训练与对抗训练,测量权重范数、间隔和泛化差距。
  • 通过实证验证理论框架:对抗训练模型的权重范数乘积更大,鲁棒泛化差距更高,而这些现象可通过权重衰减有效缓解。

实验结果

研究问题

  • RQ1我们能否为具有多层结构的深度神经网络提供对抗Rademacher复杂度的理论上的上界?
  • RQ2深度网络的结构——特别是权重范数与间隔——如何影响对抗泛化性能?
  • RQ3权重衰减在多大程度上通过控制权重范数来正则化对抗泛化差距?
  • RQ4为何对抗训练尽管在训练集上达到高鲁棒准确率,却仍导致泛化性能差?
  • RQ5在实践中,权重范数乘积与数据间隔如何与鲁棒泛化差距相关联?

主要发现

  • 本工作首次利用覆盖数方法,为深度神经网络的对抗Rademacher复杂度提供了理论界,解决了长期存在的开放性问题。
  • 该上界表明,鲁棒泛化差距与层间权重范数乘积(如Frobenius范数或1,∞-范数)成正比,与数据间隔成反比,从而解释了对抗训练中泛化性能差的原因。
  • 在VGG-16和VGG-19上的实验表明,对抗训练模型的权重范数乘积显著高于标准训练模型(例如,~6e12 vs. ~1.9e12),且与更大的泛化差距密切相关。
  • 采用权重衰减的对抗训练可同时降低权重范数乘积和鲁棒泛化差距,最优权重衰减范围为[1e-3, 5e-3]。
  • 在CIFAR-100上,使用50,000个样本的对抗训练仅达到约20%的鲁棒准确率,且权重范数乘积仍显著高于标准训练,表明泛化问题持续存在。
  • 消融研究证实,训练集中的间隔对上界的影响较小,主导因素是权重范数乘积,而非间隔大小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。