Skip to main content
QUICK REVIEW

[論文レビュー] Regularizers for Single-step Adversarial Training

B S Vivek, R. Venkatesh Babu|arXiv (Cornell University)|Feb 3, 2020
Adversarial Robustness in Machine Learning参考文献 35被引用数 5
ひとこと要約

本稿では、勾配マスキングを軽減し、計算コストの高い反復的アドバーシャル訓練に匹敵する頑健性を達成できる、単段階のアドバーシャル訓練に向けた3つの新しい正則化項を提案する。勾配安定性と表面滑らかさ——頑健なモデルの特徴である重要な性質——を強制することで、正則化項は効率的な1段階のFGSMベースの訓練を可能にし、反復的および非反復的攻撃の両方に対して頑健なモデルを生成する。

ABSTRACT

The progress in the last decade has enabled machine learning models to achieve impressive performance across a wide range of tasks in Computer Vision. However, a plethora of works have demonstrated the susceptibility of these models to adversarial samples. Adversarial training procedure has been proposed to defend against such adversarial attacks. Adversarial training methods augment mini-batches with adversarial samples, and typically single-step (non-iterative) methods are used for generating these adversarial samples. However, models trained using single-step adversarial training converge to degenerative minima where the model merely appears to be robust. The pseudo robustness of these models is due to the gradient masking effect. Although multi-step adversarial training helps to learn robust models, they are hard to scale due to the use of iterative methods for generating adversarial samples. To address these issues, we propose three different types of regularizers that help to learn robust models using single-step adversarial training methods. The proposed regularizers mitigate the effect of gradient masking by harnessing on properties that differentiate a robust model from that of a pseudo robust model. Performance of models trained using the proposed regularizers is on par with models trained using computationally expensive multi-step adversarial training methods.

研究の動機と目的

  • 勾配マスキングにより退化した最小値に収束してしまう単段階のアドバーシャル訓練の限界を解消すること。
  • 単段階手法による頑健性を実現することで、頑健性と計算コストのトレードオフを克服すること。
  • 頑健なモデルの内在的特性(例:損失の単調性、滑らかな損失表面)を識別し、正則化信号として活用すること。
  • 反復的なアドバーシャルサンプル生成を必要とせず、訓練速度を維持する効率的な正則化項を開発すること。
  • PGD や TRADES などの反復的アドバーシャル訓練と同等の頑健性を達成しつつ、単段階手法の効率性を保つこと。

提案手法

  • 単段階のアドバーシャル訓練に頑健性を誘導するインダクティブバイアスを組み込む3つの異なる正則化項、SAT-R1、SAT-R2、SAT-R3を提案する。
  • SAT-R1 は、バッチごとに1つのサンプルに対して反復的FGSM(IFGSM)を用い、勾配安定性を強化し、マスキングを低減する。
  • SAT-R2 は、ランダム化された摂動方向を用いた変更版FGSM(R-FGSM)を適用し、反復ステップを必要とせずに頑健性を向上させる。
  • SAT-R3 は、2つの異なる摂動の大きさ(ε_low と ε_high)を用いて訓練し、勾配の符号が同一であるという事実を活用して計算量を削減する。
  • すべての正則化項は、標準的なFGSMベースのアドバーシャル訓練に統合されており、1アドバーシャルサンプルあたりの前向きバックプロパゲーション(FBP)コストを維持する。
  • 正則化項は、摂動下での一貫した損失挙動を促進することで、損失の単調性と滑らかさを強制し、勾配マスキングを是正する。

実験結果

リサーチクエスチョン

  • RQ1反復的な勾配計算を伴わず、単段階のアドバーシャル訓練が反復的手法と同等の頑健性を達成できるか?
  • RQ2頑健なモデルの具体的な特性(例:損失の単調性、表面滑らかさ)は、正則化信号としてどのように活用できるか?
  • RQ3効率的で反復的でない正則化項を用いて、単段階アドバーシャル訓練における勾配マスキングをどのように軽減できるか?
  • RQ4頑健なモデルの構造的特性を強制する正則化項は、非反復的および反復的攻撃の両方に対する一般化を向上させられるか?
  • RQ5異なる正則化項設計を用いた場合、頑健性と訓練効率のトレードオフはどのように変化するか?

主な発見

  • 提案された正則化項(SAT-R1、SAT-R2、SAT-R3)を用いて訓練されたモデルは、PGD-AT や TRADES といった計算コストの高い反復的手法で訓練されたモデルと同等の頑健性を達成する。
  • SAT-R1 と SAT-R2 は、PGD-40 および PGD-100 攻撃に対して特に優れた頑健性を示し、勾配マスキングに対するより強い正則化効果がある。
  • SAT-R3 は3つのうち計算コストが最も低く、1アドバーシャルサンプルあたり1回のFBPで済むため、大規模な訓練に適している。
  • SAT-R3 モデルを数エポックにわたり、SAT-R1/SAT-R2 で微調整または事前学習することで、頑健性が顕著に向上する。これは正則化信号の転送可能性を示している。
  • 損失表面のプロットから、正則化項を用いて訓練されたモデルは滑らかで振動のない挙動を示し、鋭さが低減され一般化性能が向上していることが確認された。
  • MNIST、CIFAR-10、ImageNetサブセットの全データセットで、FGSMおよびPGD攻撃に対して一貫した頑健性が得られたことから、正則化項が勾配マスキングを効果的に軽減していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。