Skip to main content
QUICK REVIEW

[論文レビュー] AutoGAN: Robust Classifier Against Adversarial Attacks

Blerta Lindqvist, Shridatt Sugrim|arXiv (Cornell University)|Dec 8, 2018
Adversarial Robustness in Machine Learning参考文献 23被引用数 4
ひとこと要約

AutoGAN は、敵対的訓練データを必要とせず、自己符号化器生成器と分類用ディスクラミネーターを用いてデータ多様体を強化する GAN ベースの分類器であり、敵対的攻撃に対して防御する。FGSM で摂動された MNIST 画像において 89% の精度を達成し、FGSM の 1% を上回る。摂動された入力を洗練された頑健な多様体上に射影することで、攻撃タイプや摂動の大きさにかかわらず優れた一般化性能を示している。

ABSTRACT

Classifiers fail to classify correctly input images that have been purposefully and imperceptibly perturbed to cause misclassification. This susceptability has been shown to be consistent across classifiers, regardless of their type, architecture or parameters. Common defenses against adversarial attacks modify the classifer boundary by training on additional adversarial examples created in various ways. In this paper, we introduce AutoGAN, which counters adversarial attacks by enhancing the lower-dimensional manifold defined by the training data and by projecting perturbed data points onto it. AutoGAN mitigates the need for knowing the attack type and magnitude as well as the need for having adversarial samples of the attack. Our approach uses a Generative Adversarial Network (GAN) with an autoencoder generator and a discriminator that also serves as a classifier. We test AutoGAN against adversarial samples generated with state-of-the-art Fast Gradient Sign Method (FGSM) as well as samples generated with random Gaussian noise, both using the MNIST dataset. For different magnitudes of perturbation in training and testing, AutoGAN can surpass the accuracy of FGSM method by up to 25\% points on samples perturbed using FGSM. Without an augmented training dataset, AutoGAN achieves an accuracy of 89\% compared to 1\% achieved by FGSM method on FGSM testing adversarial samples.

研究の動機と目的

  • 安全上の重要な応用分野における深層ニューラルネットワークの、目に見えない敵対的摂動に対する脆弱性を是正すること。
  • 攻撃タイプ、摂動の大きさ、または敵対的訓練サンプルへの事前知識を必要とする既存の防御の限界を克服すること。
  • データ拡張なしで、多様な敵対的攻撃や摂動レベルに一般化可能な頑健な分類器を開発すること。
  • 生成器とディスクラミネーターの両方に分類論理を埋め込むことで、攻撃者への露出を最小限に抑えることによる防御の耐性を確保すること。

提案手法

  • 自己符号化器を生成器とする GAN アーキテクチャを用い、元のデータ多様体を再構築および強化する。
  • 入力の分類と同時に、偽物のサンプルと誤分類された敵対的ポイントを区別するディスクラミネーターを採用する。
  • 訓練済みの生成器を通じて摂動されたテスト画像を射影し、洗練されたクリーンなデータ多様体上にマッピングすることで、敵対的影響を低減する。
  • 敵対的例を追加しない自然なデータのみでモデルをエンドツーエンドに訓練し、多様体学習に依存して頑健性を確保する。
  • 自然画像は低次元の多様体上に存在すること、敵対的例はしばしば多様体のギャップや高カーブチュア領域に位置することを利用する。
  • 自己符号化器のボトルネックを用いて、入力を真のデータ分布に近づけることで、コンactかつ構造的な表現を強制する。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練データを一切使用せずに、分類器が敵対的攻撃に対して頑健性を示せるか。
  • RQ2GAN ベースの自己符号化器による多様体強化は、摂動の大きさが異なる条件下でも一般化性能をどのように向上させるか。
  • RQ3生成器とディスクラミネーターの共同学習が、単一のコンponent を使用する場合と比較して、防御の頑健性にどの程度寄与するか。
  • RQ4データ拡張なしで、AutoGAN はターゲット付き FGSM 攻撃およびランダムなガウスノイズ摂動に対してどの程度の性能を示すか。
  • RQ5訓練とテストの摂動の大きさが異なる場合でも、モデルは高い精度を維持できるか。

主な発見

  • 敵対的サンプルを一切使用しない訓練条件下で、AutoGAN は FGSM で摂動された MNIST テストデータに対して 89% の精度を達成した。これは、ベースラインの FGSM 法がたった 1% の精度しか得られないのと対照的である。
  • 敵対的例を用いたデータ拡張がなされた場合、AutoGAN は FGSM の精度を最大で 25 パーセンテージポイント上回り、摂動レベルの変動に対しても優れた一般化性能を示した。
  • 敵対的データ拡張なしでも、AutoGAN はランダムなガウスノイズ摂動付き画像に対して高い性能を維持し、デフォルトの分類器と比較して最大で 49 パーセンテージポイントの精度向上を達成した。
  • 射影実験の結果、AutoGAN は元のデータ多様体を強化していることが確認された。射影された摂動付き画像はもはや MNIST ディジットに類似しておらず、効果的な多様体正則化が行われていることが示された。
  • AutoGAN のディスクラミネーターをデフォルトの分類器に置き換えると、性能が著しく低下する(例:0.1 の FGSM 摂動で 50% の精度)。生成器とディスクラミネーターの両方が防御に不可欠であることが証明された。
  • 攻撃タイプや摂動の大きさの変化に対しても防御機構が頑健であることが確認され、AutoGAN は多様な FGSM およびガウスノイズ摂動レベルにおいて高い精度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。