Skip to main content
QUICK REVIEW

[論文レビュー] Generating Realistic Unrestricted Adversarial Inputs using Dual-Objective GAN Training.

Isaac Dunn, Tom Melham|arXiv (Cornell University)|May 7, 2019
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

この論文は、ターゲット分類器をだますように訓練されたジェネレータに加え、訓練データ分布に類似したサンプルを生成する共同訓練されたディスクライマーを用いて、現実的で制限のない adversarial 入力を生成する二目的 GAN フレームワークを提案する。人間による評価では、これらの adversarial 例が誤って「偽物」と識別される確率は約 50% にとどまり、中程度の現実性を示している。

ABSTRACT

The correctness of deep neural networks is well-known to be vulnerable to small, 'adversarial' perturbations of their inputs. Although studying these attacks is valuable, they do not necessarily conform to any real-world threat model. This has led to interest in the generation of (and robustness to) unrestricted adversarial inputs, which are not constructed as small perturbations of correctly-classified ground-truth inputs. We introduce a novel algorithm to generate realistic unrestricted adversarial inputs, in the sense that they cannot reliably be distinguished from the training dataset by a human. This is achieved by modifying generative adversarial networks: a generator neural network is trained to construct examples that deceive a fixed target network (so they are adversarial) while also deceiving the usual co-training discriminator network (so they are realistic). Our approach is demonstrated by the generation of unrestricted adversarial inputs for a trained image classifier that is robust to perturbation-based attacks. We find that human judges are unable to identify which image out of ten was generated by our method about 50 percent of the time, providing evidence that they are moderately realistic.

研究の動機と目的

  • 小さな目立たない摂動に依存する adversarial 攻撃の限界、すなわち現実世界の脅威モデルと一致しない点を解決すること。
  • ターゲットモデルによって誤分類されるだけでなく、人間にとって視覚的に現実的な制限のない adversarial 入力を生成すること。
  • 単なる摂動を超えて adversarial 例の現実性を向上させ、現実世界の回避シナリオをより的確に反映すること。
  • adversarial 成功とデータの現実性の両方を同時に最適化する、修正された GAN アーキテクチャを用いた訓練フレームワークの開発。

提案手法

  • ジェネレータネットワークは、固定されたターゲット分類器に対して adversarial な入力を生成するように訓練され、誤分類を保証する。
  • 同じジェネレータは、共同訓練されたディスクライマー ネットワークをだますようにも訓練され、学習データ分布に類似したサンプルの生成を保証する。
  • ジェネレータは、ターゲット分類器向けの adversarial 損失とデータディスクライマー向けの adversarial 損失を組み合わせた二目的損失関数によって最適化される。
  • ジェネレータの訓練中、ターゲット分類器は固定されたままにされ、生成された入力が特定の誤分類を引き起こすように設計される。
  • 訓練プロセスは標準的な GAN の訓練ダイナミクスを活用しているが、分類器をだますための信号とデータディスクライマーをだますための信号という二重の監視信号を導入している。
  • この手法により、制限のない adversarial 例(=クリーンな入力の小さな摂動に制限されない)の生成が可能となり、現実的な攻撃シナリオの範囲が拡大される。

実験結果

リサーチクエスチョン

  • RQ1人間の観察者にとって視覚的に現実的で、かつターゲット分類器をだますことができる adversarial 例を生成できるか?
  • RQ2GAN ベースのジェネレータは、実データと区別がつかない制限のない adversarial 入力をどの程度生成できるか?
  • RQ3二目的訓練方式は、標準的な adversarial 訓練と比較して、現実性と攻撃効果の両面でどのように異なるか?
  • RQ4人間の判断者が、この手法で生成された adversarial 例を信頼性高く検出できるか?これはその現実性を示唆する。
  • RQ5制限のない adversarial 例生成において、adversarial 成功とデータの現実性の間にはどのようなトレードオフがあるか?

主な発見

  • 人間の判断者が、10枚の画像の中から adversarial 例を正しく識別できたのは約 50% の頻度にとどまり、中程度の現実性が示された。
  • 生成された adversarial 例は、従来の摂動ベースの攻撃に対して頑健なターゲット分類器を効果的にだました。
  • 二目的訓練フレームワークは、adversarial 入力の生成と現実的なサンプルの生成の両方をうまくバランスさせた。
  • この手法により、クリーン画像の小さな摂動に制限されない制限のない adversarial 入力が生成され、現実的な攻撃シナリオの範囲が拡大された。
  • 共同訓練されたディスクライマーは、ジェネレータが学習データ分布に一致する視覚的に整合性のあるサンプルを生成するのを効果的に導いた。
  • 結果として、二重の監視信号を用いた修正された GAN アーキテクチャにより、現実的で制限のない adversarial 例を生成可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。