Skip to main content
QUICK REVIEW

[論文レビュー] Semantics Preserving Adversarial Learning

Ousmane Dia, Elnaz Barshan|arXiv (Cornell University)|Mar 10, 2019
Adversarial Robustness in Machine Learning参考文献 39被引用数 6
ひとこと要約

本稿は、変分推論を用いて入力の低次元幾何的多様体を学習し、グラム・シュミットに基づく不変性を用いて多様体内での摂動を施し、エンドツーエンドの adversarial 最適化を適用することで、意味を保った adversarial 例を生成する意味保持型 adversarial 攻撃フレームワークを提案する。この手法は、認証済みおよび非認証済みの防御に対して高い成功率を達成するとともに、画像およびテキストの両方において意味的整合性を保持する。

ABSTRACT

While progress has been made in crafting visually imperceptible adversarial examples, constructing semantically meaningful ones remains a challenge. In this paper, we propose a framework to generate semantics preserving adversarial examples. First, we present a manifold learning method to capture the semantics of the inputs. The motivating principle is to learn the low-dimensional geometric summaries of the inputs via statistical inference. Then, we perturb the elements of the learned manifold using the Gram-Schmidt process to induce the perturbed elements to remain in the manifold. To produce adversarial examples, we propose an efficient algorithm whereby we leverage the semantics of the inputs as a source of knowledge upon which we impose adversarial constraints. We apply our approach on toy data, images and text, and show its effectiveness in producing semantics preserving adversarial examples which evade existing defenses against adversarial attacks.

研究の動機と目的

  • 既存の攻撃手法における元の入力と adversarial 例の間の意味的一貫性の欠如に対処すること。
  • adversarial 例生成中に入力の意味を保持する手法を開発し、摂動が意味的に意味を持つままであることを保証すること。
  • 意味的および知覚的類似性が元の入力と高いまま強力な防御を回避できる adversarial 例を生成することで、耐性評価の改善を図ること。
  • 幾何的多様体制約を用いた潜在空間における効率的かつエンドツーエンドの adversarial 攻撃生成を可能にすること。

提案手法

  • 入力データの低次元幾何的要約(多様体)を、緩和されたガウス事前分布を用いた変分推論により学習し、強い分布仮定を必要とせずに意味を捉える。
  • グラム・シュミットに基づく摂動戦略を適用し、adversarial 摂動が学習済み多様体内に留まるように保証することで、幾何的および意味的構造を保持する。
  • 入力空間($\mathcal{X}$)ではなく潜在埋め込み空間($\mathcal{Z}$)で動作させることで、計算コストを低減し、意味的整合性を向上させる。
  • 白箱でエンドツーエンドの最適化フレームワークを用い、多様体要素への adversarial 制約を課し、分類損失を最大化するとともに多様体への所属を維持する。
  • 再構成に基づく正則化を可能にするために、デコーダ $p_\phi$ を持つ条件付き VAE に類似したアーキテクチャを採用する。
  • 多様体の内在的幾何を活用して、均一な $\ell_p$-ボール制約を回避する、制限のないトポロジーに配慮した探索空間を定義する。

実験結果

リサーチクエスチョン

  • RQ1強力な防御を回避しつつ、元の入力の意味的コンテンツを保持する adversarial 例を生成することは可能か?
  • RQ2入力データの幾何的構造をどのようにモデル化すれば、adversarial 摂動が意味的に一貫性を保つことができるか?
  • RQ3入力空間の攻撃と比較して、潜在多様体空間で動作させることで、認証済み防御に対する攻撃成功率が向上するか?
  • RQ4提案手法は、視覚および NLP タスクの両方において、意味的に妥当な adversarial 例をどの程度生成できるか?

主な発見

  • MNIST における 40 ステップ PGD ResNet に対して、本手法は人間評価で PGD や Song et al. [2018]、Zhao et al. [2018b] を上回り、100% の成功率を達成した。
  • MNIST では、人間による評価で意味的整合性が 100%(Q1: Yes)で、元の入力との類似度も 100%(Q2: Yes)であった。これは PGD の 66.8%(Q2)を大きく上回った。
  • 認証済み防御(Raghunathan et al. [2018] および Kolter & Wong [2017])に対して、本手法は 100% の成功率を達成し、Song et al. [2018] の 86.6% および 88.6% を上回った。
  • CelebA では、100% の人間評価者が adversarial 例を意味的に妥当(Q1: Yes)と評価し、97% が元の画像と類似していると評価した。
  • SNLI テキスト分類タスクでは、本手法は 83.7% の意味的整合性と 79.6% の類似度を達成し、Zhao et al. [2018b] の 60.4% および 56.3% を上回った。
  • 本手法は、認証済みおよび非認証済みの両方の防御を回避しながらも、高い意味的整合性を維持する adversarial 例を効果的に生成でき、モダリティをまたがる耐性と一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。