Skip to main content
QUICK REVIEW

[論文レビュー] GanDef: A GAN based Adversarial Training Defense for Neural Network Classifier

Guanxiong Liu, Issa Khalil|arXiv (Cornell University)|Mar 6, 2019
Adversarial Robustness in Machine Learning参考文献 22被引用数 5
ひとこと要約

GanDefは、敵対的例に対する耐性とクリーンデータ上の精度の間で動的かつ柔軟にトレードオフを可能にするGANベースの敵対的防御を提案する。特徴学習の正則化にディスクライマを用いることで、敵対的例におけるテスト精度が最先端水準に達し、敵対的例の割合が41.7%を超える状況では、その変種GanDef-Combにより既存の防御手法を上回る性能を発揮する。

ABSTRACT

Machine learning models, especially neural network (NN) classifiers, are widely used in many applications including natural language processing, computer vision and cybersecurity. They provide high accuracy under the assumption of attack-free scenarios. However, this assumption has been defied by the introduction of adversarial examples -- carefully perturbed samples of input that are usually misclassified. Many researchers have tried to develop a defense against adversarial examples; however, we are still far from achieving that goal. In this paper, we design a Generative Adversarial Net (GAN) based adversarial training defense, dubbed GanDef, which utilizes a competition game to regulate the feature selection during the training. We analytically show that GanDef can train a classifier so it can defend against adversarial examples. Through extensive evaluation on different white-box adversarial examples, the classifier trained by GanDef shows the same level of test accuracy as those trained by state-of-the-art adversarial training defenses. More importantly, GanDef-Comb, a variant of GanDef, could utilize the discriminator to achieve a dynamic trade-off between correctly classifying original and adversarial examples. As a result, it achieves the highest overall test accuracy when the ratio of adversarial examples exceeds 41.7%.

研究の動機と目的

  • 微小で人間が認識できない摂動によってモデルを誤導される神経ネットワーク分類器の脆弱性に対処すること。
  • クリーンデータ上の高いテスト精度を維持しつつ、敵対的攻撃に対する耐性を高める防御メカニズムを開発すること。
  • 特にリスクが高く、誤動作が深刻な影響を及える環境において、元の例と敵対的例の分類の間で動的かつ柔軟なトレードオフを可能にすること。
  • GanDefにおけるミニマックスゲームが、摂動に不変な特徴を利用する分類器を導く数学的証明を行うこと。
  • 複数のデータセットおよび攻撃タイプにおいて、最先端の敵対的訓練防御手法と比較してGanDefの性能を実証的に検証すること。

提案手法

  • GanDefは、分類器とディスクライマの間でミニマックスゲームを定式化し、ディスクライマが特徴選択を指導することで耐性を向上させる。
  • 分類器はクリーンデータ上の交差エントロピー損失を最小化するように学習され、ディスクライマは実際の特徴と敵対的に摂動を加えた特徴を区別するように学習される。
  • 重要な要素として、分類器が不確実性を示す際に、ディスクライマを二次的防御として活用し、敵対的入力を特定する。
  • GanDef-Combは、分類器とディスクライマの出力をしきい値に基づく意思決定ルールで統合し、クリーンデータと敵対的例の両方における性能を動的にバランスさせる。
  • 訓練中にFGSM、BIM、PGD攻撃を用いた標準的な敵対的訓練を採用し、摂動を生成する。
  • クリーンデータと敵対的例の性能のトレードオフは、ディスクライマのしきい値を調整することで制御され、実行時における柔軟な適合性が可能になる。

実験結果

リサーチクエスチョン

  • RQ1GANベースのフレームワークは、クリーンデータ上の精度を損なうことなく敵対的耐性を向上させることができるか?
  • RQ2敵対的訓練にディスクライマを組み込むことで、元の例と敵対的例の分類の間で動的かつ柔軟なトレードオフが実現可能か?
  • RQ3攻撃タイプや敵対的例の比率が変化する状況下で、GanDefは最先端の敵対的訓練防御手法と比較してテスト精度で優れているか?
  • RQ4GanDef-Combはどのような条件下で、既存の防御手法よりも高い全体的なテスト精度を達成するか?
  • RQ5GanDefにおけるミニマックスゲームは、摂動に不変な特徴に依存する分類器を導く数学的証明が可能か?

主な発見

  • GanDefは、Pure PGD、Mix PGD、Logit Pairingといった最先端の防御手法と同等またはそれ以上の敵対的例におけるテスト精度を達成する。
  • CIFAR10データセットにおいて、GanDef-CombはPGD-2攻撃に対して、最先端の防御手法と比較して少なくとも25.23%のテスト精度向上を達成する。
  • 敵対的例の割合が41.7%を超えると、GanDef-Combは全体のテスト精度が最高となり、リスク感受性の高い環境でも既存の防御手法を上回る。
  • MNISTでは、GanDef-Combは元の例およびFGSM/BIM攻撃に対して、GanDefと同等のテスト精度を維持し、PGD-1およびPGD-2攻撃では0.3%未満の低下にとどまる。
  • GanDefの分類器は、摂動に不変な特徴を利用する解に数学的に収束することが証明されている。
  • GanDef-Combにおけるディスクライマは、しきい値の調整によって性能をチューニング可能な動的制御を可能にし、想定される敵対的例の比率に応じて性能を最適化できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。