Skip to main content
QUICK REVIEW

[论文解读] MeanSparse: Post-Training Robustness Enhancement Through Mean-Centered Feature Sparsification

Sajjad Amini, Mohammadreza Teymoorianfard|arXiv (Cornell University)|Jun 9, 2024
Machine Learning and Data Classification被引用 4
一句话总结

MeanSparse 通过稀疏化均值中心化的特征激活,提升了微调后 ConvNets 的对抗鲁棒性,在不降低干净准确率的前提下减少了非鲁棒特征的方差。该方法在 CIFAR-10(AutoAttack 准确率为 72.08%)和 ImageNet-1K(59.64%)上取得了新的 SOTA 成绩,推理成本极低。

ABSTRACT

We present a simple yet effective method to improve the robustness of both Convolutional and attention-based Neural Networks against adversarial examples by post-processing an adversarially trained model. Our technique, MeanSparse, cascades the activation functions of a trained model with novel operators that sparsify mean-centered feature vectors. This is equivalent to reducing feature variations around the mean, and we show that such reduced variations merely affect the model's utility, yet they strongly attenuate the adversarial perturbations and decrease the attacker's success rate. Our experiments show that, when applied to the top models in the RobustBench leaderboard, MeanSparse achieves a new robustness record of 75.28% (from 73.71%), 44.78% (from 42.67%) and 62.12% (from 59.56%) on CIFAR-10, CIFAR-100 and ImageNet, respectively, in terms of AutoAttack accuracy. Code is available at https://github.com/SPIN-UMass/MeanSparse

研究动机与目标

  • 在不重新训练的前提下提升对抗训练 CNN 的鲁棒性。
  • 解决尽管经过训练,AT 模型中仍存在非鲁棒特征的问题。
  • 探索激活函数设计作为提升对抗鲁棒性的补充路径。
  • 开发一种后训练、即插即用的方法,在几乎不增加准确率成本的前提下提升鲁棒性。

提出的方法

  • 提出基于均值的稀疏化:在从训练集计算均值后,对特征图应用稀疏化算子。
  • 使用超参数 α 定义围绕均值的范围,在此范围内的特征值被置为零,从而有效阻断高概率但信息量低的变异。
  • 将稀疏化算子作为可微、可学习的类似激活层,应用于训练后模型中每个卷积块之后。
  • 采用邻近算子公式计算稀疏化,最小化 ℓ₀ 类似正则化,同时保持鲁棒性。
  • 在对抗训练后应用该方法,无需重新训练或修改网络结构。
  • 使用训练集中的通道级均值和标准差估计来计算稀疏化阈值。

实验结果

研究问题

  • RQ1在后训练设置中对均值中心化特征进行稀疏化,能否提升对抗鲁棒性?
  • RQ2该方法是否在不同激活函数和模型架构上具有泛化能力?
  • RQ3均值中心化稀疏化能否在不降低干净准确率的前提下减少非鲁棒特征的影响?
  • RQ4该方法在不同攻击类型(ℓ∞、ℓ2)和对抗训练方法下的表现如何?
  • RQ5性能提升是源于均值中心化本身,还是稀疏化机制本身?

主要发现

  • 将 MeanSparse 应用于顶级 RobustBench 模型后,CIFAR-10 的 AutoAttack 准确率从 71.07% 提升至 72.08%,创下新的 SOTA 成绩。
  • 在 ImageNet-1K 上,该方法将第三名模型的 AutoAttack 准确率从 59.56% 提升至 59.64%,超过排名第一的模型。
  • CIFAR-10 上的干净准确率几乎不变,为 93.24%(原为 93.27%),表明实用成本极低。
  • 该方法在多种激活函数(包括 ReLU 和 Swish)上均有效,表明鲁棒性不依赖于激活函数的选择。
  • MeanSparse 在 ℓ∞ 和 ℓ2 攻击下均提升鲁棒性,即使模型仅针对 ℓ∞ 鲁棒性进行训练。
  • 性能对通道级均值和方差估计敏感;使用全局统计量无法获得相同提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。