Skip to main content
QUICK REVIEW

[論文レビュー] MeanSparse: Post-Training Robustness Enhancement Through Mean-Centered Feature Sparsification

Sajjad Amini, Mohammadreza Teymoorianfard|arXiv (Cornell University)|Jun 9, 2024
Machine Learning and Data Classification被引用数 4
ひとこと要約

MeanSparse は、平均中心化された特徴マップのスパarsity化により、微調整済みの ConvNet の adversarial robustness を向上させ、非ロバスト特徴の分散を低下させつつ、クリーンな精度を損なわず、CIFAR-10(AutoAttack 精度 72.08%)および ImageNet-1K(59.64%)で新たな SOTA を達成した。推論コストは最小限に抑えられる。

ABSTRACT

We present a simple yet effective method to improve the robustness of both Convolutional and attention-based Neural Networks against adversarial examples by post-processing an adversarially trained model. Our technique, MeanSparse, cascades the activation functions of a trained model with novel operators that sparsify mean-centered feature vectors. This is equivalent to reducing feature variations around the mean, and we show that such reduced variations merely affect the model's utility, yet they strongly attenuate the adversarial perturbations and decrease the attacker's success rate. Our experiments show that, when applied to the top models in the RobustBench leaderboard, MeanSparse achieves a new robustness record of 75.28% (from 73.71%), 44.78% (from 42.67%) and 62.12% (from 59.56%) on CIFAR-10, CIFAR-100 and ImageNet, respectively, in terms of AutoAttack accuracy. Code is available at https://github.com/SPIN-UMass/MeanSparse

研究の動機と目的

  • 再トレーニングを伴わず、 adversarially trained CNN の robustness を向上させること。
  • トレーニングを経ても依然として残存する non-robust 特徴の問題に取り組むこと。
  • adversarial robustness の補完的ルートとして、活性化関数設計を検討すること。
  • 再トレーニングやアーキテクチャ変更なしに、推論コストをほとんど増やさずに robustness を向上させる post-training で即座に適用可能な手法を開発すること。

提案手法

  • トレーニングセットにわたる平均値を引いた後、特徴マップにスパarsity 演算子を適用する mean-based sparsification を導入する。
  • ハイパーパrameter α を用いて、平均値の周囲で特徴値をゼロに設定する範囲を定義し、高確率で低情報量の変動をブロックする。
  • 学習可能な活性化関数に類似した微分可能で可微分な層として、トレーニング済みモデルの各畳み込みブロックの後にスパarsity 演算子を適用する。
  • スパarsity化を計算するために、ℓ₀ に類似した正則化を最小化しつつ robustness を保持するため、proximal 演算子の定式化を採用する。
  • adversarial training の後に適用するため、再トレーニングやアーキテクチャ変更が不要である。
  • スパarsity化の閾値を計算するために、トレーニングセットからのチャネル単位の平均および標準偏差の推定値を用いる。

実験結果

リサーチクエスチョン

  • RQ1post-training 時に平均中心化された特徴をスパarsity化することで、adversarial robustness が向上するか?
  • RQ2この手法は、異なる活性化関数やモデルアーキテクチャに一般化可能か?
  • RQ3平均中心化スパarsity化は、クリーン精度を損なわず、non-robust 特徴の影響を低減できるか?
  • RQ4異なる攻撃タイプ(ℓ∞、ℓ2)および adversarial training 方法に対して、この手法はどのように性能を発揮するか?
  • RQ5性能向上の主な要因は、平均中心化そのものか、それともスパarsity 機構そのものか?

主な発見

  • MeanSparse をトップの RobustBench モデルに適用したところ、CIFAR-10 における AutoAttack 精度が 71.07% から 72.08% に向上し、新たな SOTA を樹立した。
  • ImageNet-1K では、3位のモデルの AutoAttack 精度が 59.56% から 59.64% に上昇し、1位のモデルを上回った。
  • CIFAR-10 におけるクリーン精度は 93.27% から 93.24% にほとんど変化せず、最小限のコストで実用性が維持された。
  • ReLU や Swish など複数の活性化関数に対して有効であり、robustness が活性化関数の選択に依存しないことが示された。
  • MeanSparse は、ℓ∞ 攻撃だけでなく ℓ2 攻撃に対しても robustness を向上させ、モデルが ℓ∞ にのみ対応してトレーニングされた場合でも有効であった。
  • チャネルごとの平均および分散推定に敏感であり、グローバル統計では同様の向上が得られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。