Skip to main content
QUICK REVIEW

[論文レビュー] Generalizable Adversarial Attacks with Latent Variable Perturbation Modelling

Avishek Joey Bose, Andre Cianflone|arXiv (Cornell University)|May 26, 2019
Adversarial Robustness in Machine Learning参考文献 37被引用数 5
ひとこと要約

本稿では、白箱攻撃のためのドメインに依存しない生成フレームワークGAALVを提案する。GAALVは、 adversarial perturbations を確率的潜在変数分布としてモデル化する。変分オートエンコーダーに類似した構造を持つエンコーダ・デコーダモデルを訓練することで、画像、テキスト、グラフのあらゆる分野において、効率的で多様性に富み、ゼロショットで一般化可能な攻撃を実現する。グラフ分野では最先端の成功確率を達成し、他の分野でも競争力のある性能を示した。

ABSTRACT

Adversarial attacks on deep neural networks traditionally rely on a constrained optimization paradigm, where an optimization procedure is used to obtain a single adversarial perturbation for a given input example. In this work we frame the problem as learning a distribution of adversarial perturbations, enabling us to generate diverse adversarial distributions given an unperturbed input. We show that this framework is domain-agnostic in that the same framework can be employed to attack different input domains with minimal modification. Across three diverse domains---images, text, and graphs---our approach generates whitebox attacks with success rates that are competitive with or superior to existing approaches, with a new state-of-the-art achieved in the graph domain. Finally, we demonstrate that our framework can efficiently generate a diverse set of attacks for a single given input, and is even capable of attacking extit{unseen} test instances in a zero-shot manner, exhibiting attack generalization.

研究の動機と目的

  • 制約付き最適化に基づく adversarial attack に起因する限界、すなわち非効率性、多様性の欠如、モダリティ間での一般化の困難さを解消すること。
  • 再最適化を伴わずに、未観測のテストインスタンスに対し効率的なゼロショット攻撃一般化を可能にすること。
  • 1つの入力に対して、摂動を学習可能な潜在分布としてモデル化することで、多様な adversarial perturbations を生成すること。
  • 画像、テキスト、グラフといった多様な入力ドメインを統一的に扱う1つのフレームワークを用い、最小限のアーキテクチャ変更で adversarial attack の生成を統一すること。
  • 効率的な推論と再サンプリングを可能にしつつ、最先端の手法と比較して競争的または優れた攻撃成功確率を達成すること。

提案手法

  • GAALVは、確率的潜在変数 z を持つエンコーダ・デコーダアーキテクチャを採用しており、エンコーダが入力 x を潜在コードにマッピングし、デコーダが z から adversarial perturbations δ を生成する。
  • 潜在空間が適切に構造化され、分離可能であるよう保証するため、変分オートエンコーダー(VAE)に類似した目的関数に、KLダイバージェンス正則化項を用いる。
  • Adversarial examples は x' = x + δ として生成され、δ はデコーダの出力分布からサンプリングされる。攻撃の目的は、摂動の大きさを最小限に抑えつつ、誤分類を最大化することである。
  • 再構成損失により、摂動を加えた入力が元の分布に近いまま保たれるようにし、分類損失により、モデル f による誤分類を促進する。
  • 再パrameterizationトリックを用いることで、エンド・ツー・エンドの学習が可能となり、アモアタイズド推論が実現される。学習後は、1回の順伝播で adversarial examples が生成可能である。
  • ゼロショット一般化のため、追加の最適化を伴わず、未学習のテスト入力に対しても adversarial examples を生成し、学習済みの潜在分布を活用する。

実験結果

リサーチクエスチョン

  • RQ1潜在変数モデリングに基づく統一的生成フレームワークは、画像、テキスト、グラフといった多様な入力ドメインにおいて、効果的な adversarial attack を実現できるか?
  • RQ2adversarial perturbations を分布としてモデル化することで、再最適化を伴わず未学習のテストインスタンスへの効率的ゼロショット一般化が可能になるか?
  • RQ3本フレームワークは、1つの入力に対して多様な adversarial examples を生成でき、攻撃に失敗した場合の再サンプリングを可能にするか?
  • RQ4制約付き最適化に基づく最先端の攻撃手法と比較して、攻撃成功確率と効率性の面で、本手法の性能はどのように評価されるか?
  • RQ5グラフ分野において、先行手法が大きな課題を抱える中、本フレームワークは最先端の結果を達成できるか?

主な発見

  • 直接攻撃において、Cora グラフデータセットで93%という新たな最先端の攻撃成功確率を達成し、Zugner(訓練時99%だが、テスト時は低い)を上回った。
  • CiteSeer データセットでは、直接攻撃で92%、インフルエンサー攻撃で54%の成功確率を達成し、先行の最先端手法(インフルエンサー攻撃時38%)を大きく上回った。
  • 画像分野では、CIFAR-10 テストセットで81%の攻撃成功確率を達成し、PGD や Carlini-Wagner 攻撃と同等の性能を示した。同時に、ゼロショット一般化を実現した。
  • IMDB テキストベンチマークでは、GAALV-Diff がテストセットで61%の成功確率を達成した。これは、フルテストセットに対してスケーラブルかつ高パフォーマンスな攻撃を実現した最初の例であり、最先端の性能を示した。
  • GAALVは強力なゼロショット一般化を示した。未学習のテストインスタンスに対して、追加の最適化を伴わず攻撃に成功し、Cora の直接攻撃において、ベースライン手法と比較して成功確率が最大61%向上した。
  • フレームワークは効率的な再サンプリングを可能にした。攻撃に失敗した場合の再サンプリングにおいて、IMDB で71%の成功確率を達成し、多様性の利点が顕著に現れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。