Skip to main content
QUICK REVIEW

[論文レビュー] Featurized Bidirectional GAN: Adversarial Defense via Adversarially Learned Semantic Inference

Ruying Bao, Sihang Liang|arXiv (Cornell University)|May 21, 2018
Adversarial Robustness in Machine Learning参考文献 21被引用数 12
ひとこと要約

本稿では、データと低次元の意味的潜在空間との間で敵対的学習された双方向マッピングを用い、ロバストな特徴を抽出し、敵対的入力から綺麗な画像を再構築する防御手法であるFeaturized Bidirectional GAN (FBGAN) を提案する。潜在コードと生成画像の相互情報量を最大化することで、意味的特徴を分離し、白색ボックスおよび GRAYBOX 攻撃に対して効果的なノイズ除去が可能となり、MNIST では ε=0.3 時に 82%、FMNIST では 44% の精度を達成する。

ABSTRACT

Deep neural networks have been demonstrated to be vulnerable to adversarial attacks, where small perturbations intentionally added to the original inputs can fool the classifier. In this paper, we propose a defense method, Featurized Bidirectional Generative Adversarial Networks (FBGAN), to extract the semantic features of the input and filter the non-semantic perturbation. FBGAN is pre-trained on the clean dataset in an unsupervised manner, adversarially learning a bidirectional mapping between the high-dimensional data space and the low-dimensional semantic space; also mutual information is applied to disentangle the semantically meaningful features. After the bidirectional mapping, the adversarial data can be reconstructed to denoised data, which could be fed into any pre-trained classifier. We empirically show the quality of reconstruction images and the effectiveness of defense.

研究の動機と目的

  • 深層ニューラルネットワークが非意味的で低レベルの特徴を利用する敵対的攻撃に対して脆弱であるという問題に対処すること。
  • 分類器の再訓練を必要とせず、分類の前に入力をノイズ除去する防御メカニズムを開発すること。
  • 敵対的訓練や勾配マスキングといった既存の防御法の欠点(計算コストの高さや偽の安全性)を改善すること。
  • 生成モデルを活用して意味的特徴抽出と画像再構築を行うこと。これは人間の認識におけるロバストで高次の特徴の認識にインspireされている。
  • 相互情報正則化により、コンactな分離された潜在空間を用いて効果的な防御を達成すること。

提案手法

  • FBGAN はエンコーダ E、ジェネレータ G、ディスクライマー D を備えた双方向 GAN アーキテクチャを採用し、データ空間と潜在空間の間でエンドツーエンドのマッピングを可能にする。
  • モデルは、クリーンなデータ上で教師なしで事前学習され、入力画像とその潜在コードの同時分布を学習する。
  • 潜在コード z と生成画像 G(z) の間の相互情報量を最大化することで、意味的特徴を分離し、例えば数字のクラスや線の太さといった独立したコンポonentに分離する。
  • 敵対的入力からエンコーダ E を介して意味的コードを抽出し、G を用いて再構築画像を生成することで、非意味的摂動をフィルタリングする。
  • 白色ボックス防御のため、正則化を適用する:カテゴリカルコードには one-hot 表現を、連続コードにはクリッピングを用い、潜在表現の安定性を向上させる。
  • 再構築画像は任意の事前学習済み分類器に供給され、分類器のアーキテクチャを変更せずに防御が可能になる。

実験結果

リサーチクエスチョン

  • RQ1双方向マッピングと相互情報正則化を備えた生成モデルは、敵対的摂動に対してロバストな意味的特徴を効果的に抽出できるか?
  • RQ2相互情報量の最大化は、標準的な BiGAN と比較して、潜在空間における意味的特徴の分離をどの程度改善するか?
  • RQ3FBGAN は、意味的コンテンツを保持しつつ、敵対的入力から綺麗な画像をどの程度正確に再構築できるか?
  • RQ4FBGAN は、さまざまなデータセットにおいて白色ボックスおよび GRAYBOX 攻撃に対して、どの程度効果的に防御できるか?
  • RQ5FBGAN が MNIST や FMNIST では優れた性能を示すが、SVHN では劣化する理由は何か?これはデータのモード複雑性に起因するのだろうか?

主な発見

  • FBGAN は、白色ボックス攻撃(PGD、ε=0.3)下で MNIST で 82%、FMNIST で 44% の分類精度を達成し、強力な防御性能を示した。
  • モデルは、ノイズのような摂動を除去しながらも、数字のクラスや傾き角度といった意味的コンテンツを保持したまま、敵対的画像を効果的に再構築できた。
  • 相互情報正則化により、FBGAN は意味的特徴をコンパクトな潜在空間(10 個のカテゴリカルコード + 4 個の連続コード)に分離できたが、BiGAN は 128 個以上のコードを必要とし、エンタングルメントを示していた。
  • ヴァニラ BiGAN でさえも収束後も意味的特徴を分離できず、FBGAN における明示的な MI 正則化の必要性を示している。
  • SVHN での性能劣化は、高いモード複雑性と背景の変動に起因するとされ、データ分布の複雑さが再構築品質と防御のロバスト性に影響を与えることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。