Skip to main content
QUICK REVIEW

[論文レビュー] ReabsNet: Detecting and Revising Adversarial Examples

Jiefeng Chen, Zihang Meng|arXiv (Cornell University)|Dec 21, 2017
Adversarial Robustness in Machine Learning参考文献 19被引用数 6
ひとこと要約

ReabsNetは、ガーディアンネットワークを用いて adversarial examples を検出し、それらを元のラベルに回復させる、革新的な防御フレームワークである。これは、さまざまな攻撃に対して、特にε=0.3を超える摂動バウンド下でも、Madryらのロバストモデルを凌駕する性能を示している。

ABSTRACT

Though deep neural network has hit a huge success in recent studies and applica- tions, it still remains vulnerable to adversarial perturbations which are imperceptible to humans. To address this problem, we propose a novel network called ReabsNet to achieve high classification accuracy in the face of various attacks. The approach is to augment an existing classification network with a guardian network to detect if a sample is natural or has been adversarially perturbed. Critically, instead of simply rejecting adversarial examples, we revise them to get their true labels. We exploit the observation that a sample containing adversarial perturbations has a possibility of returning to its true class after revision. We demonstrate that our ReabsNet outperforms the state-of-the-art defense method under various adversarial attacks.

研究の動機と目的

  • 分類を誤導する目に見えない adversarial perturbations による深層ニューラルネットワークの脆弱性に対処する。
  • 誤検出により自然画像を拒否してしまう、従来の「検出して破棄」型防御の限界を克服する。
  • adversarial examples の検出に加え、それらの修正を通じて真のラベルを回復させる防御メカニズムを開発する。
  • DeepFoolという1つの攻撃タイプでガーディアンおよびモディファイヤーを訓練することで、未知の攻撃に対しても堅牢な分類を可能にする。

提案手法

  • 分類用のマスターネットワーク、adversarial 検出用のガーディアンネットワーク、adversarial 入力を繰り返し修正するモディファイヤーネットワークからなる3部構成のアーキテクチャを導入する。
  • DeepFoolを用いて生成された adversarial examples を用いて、ガーディアンネットワークを自然画像と adversarial 画像を区別できるように訓練する。
  • 攻撃メカニズム(例:DeepFool)に基づく画像修正法を用い、検出された adversarial examples を繰り返し修正する。
  • 繰り返し修正によって、adversarial 入力をガーディアンネットワークが自然と分類するよう変換し、マスターネットワークによる正しい分類を可能にする。
  • 検出と修正の両目的を統合した共同損失関数を用いて、システム全体をエンドツーエンドで訓練する。
  • adversarial examples が標的の摂動を逆転させることで元のクラスに回復できることに着目し、生理的再吸収を模倣する。

実験結果

リサーチクエスチョン

  • RQ1攻撃タイプに関する事前知識に依存せずに、ガーディアンネットワークが adversarial examples を効果的に検出できるか?
  • RQ2繰り返しの修正によって、adversarial examples が元の自然な形に成功裏に回復できるか?
  • RQ3adversarial 入力を修正する防御システムは、従来の「検出して破棄」型またはロバストトレーニング手法を上回る性能を示せるか?
  • RQ4ReabsNetフレームワークは、さまざまな adversarial 攻撃タイプや摂動スケールに一般化できるか?
  • RQ5強力で多様な攻撃に対して防御を行う一方で、自然画像の精度を高い水準で維持できるか?

主な発見

  • ReabsNetは自然なMNIST画像において99.05%の分類精度を達成し、マスターネットワーク単体と同等の性能を示した。
  • ε < 0.3のFGSMおよびDeepFool攻撃下では、ReabsNetは100%の防御成功率を達成し、同条件でのMadryのモデルを上回った。
  • 摂動バウンドがε < 0.6に拡大した場合、ReabsNetはFGSM攻撃で95%、CW $L_{∞}$ の標的攻撃で97.3%の防御成功率を維持し、Madryのモデルを著しく上回った。
  • ReabsNetの防御成功率は、CW $L_2$ および $L_∞$ の未標的・標的攻撃を含む6つの攻撃タイプすべてで一貫して高い水準を維持した。
  • フレームワークは良好に一般化された:DeepFoolによって生成された adversarial examples のみで訓練したにもかかわらず、他の攻撃タイプに対しても効果的な検出と修正が可能であった。
  • モディファイヤーネットワークは、adversarial examples を元のクラスに成功裏に回復させ、攻撃メカニズムに適合した修正によって adversarial 摂動を逆転させる可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。