Skip to main content
QUICK REVIEW

[論文レビュー] Double Backpropagation for Training Autoencoders against Adversarial Attack

Chengjin Sun, Sizhe Chen|arXiv (Cornell University)|Mar 4, 2020
Adversarial Robustness in Machine Learning参考文献 38被引用数 4
ひとこと要約

本稿では、入力摂動に対する再構成出力の勾配を制約することにより、敵対的攻撃に対して強靭性を高めるための二重バックプロパゲーション(DBP)を提案する。符号化器の勾配を滑らかにし、潜在空間でガウス・ミックスチャネル・モデル(GMM)を組み合わせることで、白ボックスおよびブラックボックスの敵対的攻撃に対しても耐性があり、高い再構成忠実度を維持するとともに、安定した画像遷移を実現する強靭なオートエンコーダーを達成する。

ABSTRACT

Deep learning, as widely known, is vulnerable to adversarial samples. This paper focuses on the adversarial attack on autoencoders. Safety of the autoencoders (AEs) is important because they are widely used as a compression scheme for data storage and transmission, however, the current autoencoders are easily attacked, i.e., one can slightly modify an input but has totally different codes. The vulnerability is rooted the sensitivity of the autoencoders and to enhance the robustness, we propose to adopt double backpropagation (DBP) to secure autoencoder such as VAE and DRAW. We restrict the gradient from the reconstruction image to the original one so that the autoencoder is not sensitive to trivial perturbation produced by the adversarial attack. After smoothing the gradient by DBP, we further smooth the label by Gaussian Mixture Model (GMM), aiming for accurate and robust classification. We demonstrate in MNIST, CelebA, SVHN that our method leads to a robust autoencoder resistant to attack and a robust classifier able for image transition and immune to adversarial attack if combined with GMM.

研究の動機と目的

  • 微小な入力摂動に対して著しく異なる再構成を生じる敵対的攻撃に対して脆弱なオートエンコーダーの問題を解決すること。
  • 二重バックプロパゲーション(DBP)が再構成出力の勾配を制御することにより、オートエンコーダーの入力摂動への感受性を低減できるかどうかを調査すること。
  • 潜在空間におけるガウス・ミックスチャネル・モデル(GMM)の使用により、分類器出力の安定化と滑らかさを図り、強靭性を向上させること。
  • DBP正則化オートエンコーダーを用いた際の画像遷移の転送可能性および敵対的条件下での強靭性を評価すること。
  • DBPとGMMを組み合わせることで、白ボックスおよびブラックボックスの敵対的攻撃に対して耐性を持つ分類器が得られることを実証すること。

提案手法

  • 入力摂動に対する再構成出力の勾配を制約するため、二重バックプロパゲーション(DBP)を適用し、特に ∂x′/∂x を制限して感受性を低減する。
  • トレーニング中に ∂x′/∂x の大きさを最小化する損失関数を導入し、二重バックプロパゲーション機構を用いて符号化器の大きな勾配を罰する。
  • VAEおよびDRAWオートエンコーダーにDBPを適用し、微小な入力摂動に対しても滑らかな潜在表現と安定した再構成を保証する。
  • 潜在コードの分布をガウス・ミックスチャネル・モデル(GMM)でモデル化し、潜在空間における滑らかで連続的な意思決定境界を提供する。
  • GMM正則化された潜在空間を用いて、分類器の勾配に従って潜在空間で画像遷移を実現し、一貫性があり意味のある変換を保証する。
  • MNISTおよびSVHNデータセット上で、FGSMおよびPGD攻撃に対する強靭性を評価し、標準分類器と比較してDBP+GMM分類器の精度を測定する。

実験結果

リサーチクエスチョン

  • RQ1二重バックプロパゲーションが、微小な入力摂動に対するオートエンコーダーの感受性を効果的に低減し、敵対的攻撃に対する強靭性を向上させることができるか?
  • RQ2潜在空間でDBPとGMMを組み合わせることで、白ボックスおよびブラックボックスの敵対的攻撃に対する分類器の強靭性が向上するか?
  • RQ3DBPを用いることで、敵対的攻撃に対する強靭性を向上させつつ、再構成品質をどの程度維持できるか?
  • RQ4GMMベースの分類を用いたDBP正則化オートエンコーダーを用いる場合、入力空間で安定的かつ一貫性のある画像遷移を実現できるか?
  • RQ5MNISTおよびSVHNにおいて、DBP+GMM分類器の性能は、標準的なディープニューラルネットワークと比べてどのように異なるか?

主な発見

  • DBP正則化オートエンコーダーは、PGDおよびFGSM攻撃に対しても敵対的攻撃に対して強靭であり、敵対的入力の再構成が元の入力に近く保たれる。
  • MNISTでは、DBP+GMM分類器はPGD攻撃下でも93.56%の精度を維持するが、LeNetではわずか8.12%、MLPでは56.64%にとどまるため、顕著な強靭性を示す。
  • SVHNでは、DBP+GMM分類器はPGD攻撃下で72.6%の精度を達成し、ベースラインのCvNetモデルの1.8%と比べて顕著に優れている。
  • DBP+GMMを備えた分類器はブラックボックス攻撃に対しても強靭であり、他のネットワークから生成された敵対的例を用いても、MNISTでは92.93%、SVHNでは88.77%の精度を達成する。
  • DBP+GMMモデルを用いた画像遷移は、入力空間で一貫性があり意味のある変換を生み出し、信頼度が上昇するにつれてターゲット画像の特徴が明確に現れる。
  • 再構成誤差が低く、MNIST、CelebA、SVHNの各データセットで安定した性能を示すなど、高い再構成忠実度を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。