Skip to main content
QUICK REVIEW

[論文レビュー] Towards Rapid and Robust Adversarial Training with One-Step Attacks

Leo Schwinn, René Raab|arXiv (Cornell University)|Feb 24, 2020
Adversarial Robustness in Machine Learning参考文献 32被引用数 5
ひとこと要約

本稿では、ノイズ注入によって強化された1ステップのFGSM攻撃を用いた、高速かつ頑健な adversarial training 法を提案する。入力データに一様ノイズを追加し、可学習なピクセル単位ノイズ注入層(PNIL)を導入することで、勾配の遮断を防ぎ、PGDベースの訓練と同等またはそれ以上の頑健性を達成しつつ、計算コストを著しく削減する。

ABSTRACT

Adversarial training is the most successful empirical method for increasing the robustness of neural networks against adversarial attacks. However, the most effective approaches, like training with Projected Gradient Descent (PGD) are accompanied by high computational complexity. In this paper, we present two ideas that, in combination, enable adversarial training with the computationally less expensive Fast Gradient Sign Method (FGSM). First, we add uniform noise to the initial data point of the FGSM attack, which creates a wider variety of adversaries, thus prohibiting overfitting to one particular perturbation bound. Further, we add a learnable regularization step prior to the neural network, which we call Pixelwise Noise Injection Layer (PNIL). Inputs propagated trough the PNIL are resampled from a learned Gaussian distribution. The regularization induced by the PNIL prevents the model form learning to obfuscate its gradients, a factor that hindered prior approaches from successfully applying one-step methods for adversarial training. We show that noise injection in conjunction with FGSM-based adversarial training achieves comparable results to adversarial training with PGD while being considerably faster. Moreover, we outperform PGD-based adversarial training by combining noise injection and PNIL.

研究の動機と目的

  • PGDベースの adversarial training の高い計算コストが実用的導入を制限する問題に対処する。
  • 勾配の遮断により、標準的なFGSMベースの訓練がより強い攻撃に対して一般化に失敗する問題を克服する。
  • 可学習なノイズ注入による入力レベルのデータ拡張を導入することで、1ステップ adversarial training の頑健性を向上させる。
  • PGD性能を同等または上回りつつ、訓練時間を短縮する安定的かつ効果的なFGSMベースの訓練を可能にする。

提案手法

  • FGSM攻撃の前に入力に一様ノイズを追加することで、摂動の多様性を高め、特定の摂動バウンダリーへの過適合を軽減する、ノイズ強化FGSM(NFGSM)を導入する。
  • 再パラメータライゼーションテクニックを用いて、学習可能なガウス分布から入力特徴を再サンプリングする可学習層であるピクセル単位ノイズ注入層(PNIL)を提案する。
  • PNILをバックプロパゲーションを用いてエンドツーエンドで学習させ、ネットワークが頑健性を向上させる最適な入力分散分布を学習できるようにする。
  • PNILをネットワークの最初の層として使用し、摂動がネットワーク内を伝播する前に入力を正則化し、敵対的摂動を弱める。
  • NFGSMとPNILを組み合わせることで、FGSMベースの訓練の安定化と、従来の1ステップ手法の主な失敗モードである勾配の遮断を防止する。
  • VAEと同様にKLダイバージェンス損失を用いない。代わりに、ネットワークの分類損失に依存してPNILのパラメータ学習を誘導する。

実験結果

リサーチクエスチョン

  • RQ1入力レベルのデータ拡張を施した1ステップFGSMベースの adversarial training は、多段階PGD訓練と同等の頑健性を達成できるか?
  • RQ2入力空間におけるノイズ注入は、FGSMベースの訓練の失敗の主な要因である勾配の遮断を防げるか?
  • RQ3可学習で微分可能なノイズ層(PNIL)は、推論の複雑さを増さずに一般化性と頑健性を向上させられるか?
  • RQ4NFGSMとPNILの組み合わせは、標準的なPGDベースの訓練と比較して、頑健性と訓練効率の両面で優れているか?
  • RQ5PNILが学習した分散分布は、関連する特徴を保持すると同時に、背景ノイズを抑制するようになるか?これは標的攻撃に対する頑健性の向上に寄与するか?

主な発見

  • 入力ノイズを用いたNFGSMベースの訓練は、さまざまな摂動バウンダリーにおいて、標準的なRFGSMよりもわずかに高い頑健性を達成する。特に弱い攻撃に対して顕著である。
  • PNILは、通常FGSMで訓練されたモデルが破壊されやすい勾配フリー攻撃(例:SPSA)に対して顕著に頑健性を向上させる。
  • PNILとNFGSMで訓練されたモデルは、1ステップ攻撃に依存しているにもかかわらず、PGDベースの adversarial training よりも高い頑健性を示す。
  • PNILは、背景領域に対して高い分散を割り当て、フォアグラウンドオブジェクトに対しては低い分散を割り当てることで、重要領域の敵対的ノイズを効果的にフィルタリングする。
  • PGDに比べて訓練時間を桁違いに短縮でき、1ステップのFGSM攻撃に加え、最小限の計算オーバーヘッドで実現される。
  • PNILにより、ネットワークが勾配マスキングを悪用できなくなるため、勾配の遮断が防止され、より信頼性が高く一般化可能な頑健性が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。