Skip to main content
QUICK REVIEW

[论文解读] Sparsity Winning Twice: Better Robust Generalization from More Efficient Training

Tianlong Chen, Zhenyu Zhang|arXiv (Cornell University)|Feb 20, 2022
Adversarial Robustness in Machine Learning被引用 8
一句话总结

本论文提出了一种基于两种方法的稀疏对抗训练:通过早期鸟(Robust Bird)票选实现的静态稀疏性,以及通过飞行鸟(Flying Bird, FB)和FB+实现的动态稀疏性,以同时减小鲁棒泛化差距并降低训练成本。在ResNet-18上对CIFAR-100进行训练时,该方法将鲁棒泛化差距缩小了34.44%,训练FLOP减少87.83%,同时保持或提升了鲁棒准确率和标准准确率。

ABSTRACT

Recent studies demonstrate that deep networks, even robustified by the state-of-the-art adversarial training (AT), still suffer from large robust generalization gaps, in addition to the much more expensive training costs than standard training. In this paper, we investigate this intriguing problem from a new perspective, i.e., injecting appropriate forms of sparsity during adversarial training. We introduce two alternatives for sparse adversarial training: (i) static sparsity, by leveraging recent results from the lottery ticket hypothesis to identify critical sparse subnetworks arising from the early training; (ii) dynamic sparsity, by allowing the sparse subnetwork to adaptively adjust its connectivity pattern (while sticking to the same sparsity ratio) throughout training. We find both static and dynamic sparse methods to yield win-win: substantially shrinking the robust generalization gap and alleviating the robust overfitting, meanwhile significantly saving training and inference FLOPs. Extensive experiments validate our proposals with multiple network architectures on diverse datasets, including CIFAR-10/100 and Tiny-ImageNet. For example, our methods reduce robust generalization gap and overfitting by 34.44% and 4.02%, with comparable robust/standard accuracy boosts and 87.83%/87.82% training/inference FLOPs savings on CIFAR-100 with ResNet-18. Besides, our approaches can be organically combined with existing regularizers, establishing new state-of-the-art results in AT. Codes are available in https://github.com/VITA-Group/Sparsity-Win-Robust-Generalization.

研究动机与目标

  • 解决标准训练和对抗训练(AT)中鲁棒泛化差距大和计算成本高的问题。
  • 探究在对抗训练中引入结构化稀疏性是否能改善鲁棒泛化能力和训练效率。
  • 探索基于彩票假设(Lottery Ticket Hypothesis)存在的稀疏子网络(胜出票选)在对抗训练中的存在性与实用性。
  • 开发可在训练过程中动态调整连接模式但保持固定稀疏率的动态稀疏性训练方法。
  • 证明稀疏性可作为正则化手段,缓解鲁棒过拟合并提升泛化能力,而无需牺牲准确率。

提出的方法

  • 在标准训练的几个训练周期后,通过一次性剪枝识别关键稀疏子网络(鲁棒鸟票选,Robust Bird tickets),避免迭代剪枝。
  • 将这些预先识别出的稀疏子网络应用于对抗训练,实现高效且鲁棒的模型训练。
  • 提出飞行鸟(Flying Bird, FB)方法,联合优化权重和连接模式,同时保持固定的稀疏率。
  • 提出飞行鸟+(FB+),在训练过程中自适应调整网络容量(稀疏率),以优化鲁棒泛化性能。
  • 在动态稀疏性训练期间,使用基于大小的剪枝和基于梯度的连接增长,以维持低损失和快速收敛。
  • 将所提方法与现有正则化器及对抗训练框架(如PGD-AT、TRADES)集成,以进一步提升性能。

实验结果

研究问题

  • RQ1在对抗训练中引入结构化稀疏性是否能在不降低鲁棒或标准准确率的前提下减小鲁棒泛化差距?
  • RQ2通过彩票假设(早期鸟票选)识别出的稀疏子网络在对抗训练中是否仍能保持鲁棒性?
  • RQ3与静态稀疏性相比,动态稀疏性训练(飞行鸟)是否能进一步减小鲁棒泛化差距?
  • RQ4自适应稀疏性调整(飞行鸟+)是否优于固定稀疏性或密集模型,实现更好的鲁棒泛化?
  • RQ5所提出的稀疏训练方法是否能与现有正则化器或高效训练技术(如Free AT)有效结合,实现进一步的效率提升?

主要发现

  • 在CIFAR-100上使用ResNet-18时,所提方法将鲁棒泛化差距缩小了34.44%,鲁棒过拟合降低了4.02%。
  • 在80%稀疏率下,FB+在训练和推理阶段分别实现了87.83%和87.82%的FLOP节省,同时在WideResNet-34-10上将鲁棒泛化差距缩小了13.14%。
  • 与基于OMP的剪枝相比,FB+将鲁棒泛化差距缩小了4.49%,鲁棒准确率提高了1.54%,训练FLOP减少了87.58%。
  • 鲁棒鸟票选(Robust Bird tickets)仅通过标准训练的几个训练周期即可生成,使对抗训练的计算成本显著降低,同时提升了鲁棒泛化能力。
  • 与密集的PGD-AT基线相比,所提方法在大幅降低FLOP的前提下,仍能保持或提升鲁棒和标准准确率。
  • 所提方法与Free对抗训练正交,可与之结合使用,在不依赖外部数据或辅助输入的前提下进一步提升训练效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。