Skip to main content
QUICK REVIEW

[論文レビュー] Generating Semantic Adversarial Examples via Feature Manipulation

Shuo Wang, ‪Surya Nepal‬|arXiv (Cornell University)|Jan 6, 2020
Adversarial Robustness in Machine Learning参考文献 33被引用数 10
ひとこと要約

本稿では、変分オートエンコーダー(VAE)内の分離された潜在コードを操作することにより、意味的に意味のある、自然な見た目の摂動を生成する新しい敵対的攻撃を提案する。テーマに依存しない属性(例:フォントスタイルやサイズ)を標的にすることで、細かく制御可能で高い転送性を持つ敵対的例を生成し、ブラックボックス設定ですらも有効であることを示し、普遍的で画像に依存しない意味的敵対的例の存在を実証する。

ABSTRACT

The vulnerability of deep neural networks to adversarial attacks has been widely demonstrated (e.g., adversarial example attacks). Traditional attacks perform unstructured pixel-wise perturbation to fool the classifier. An alternative approach is to have perturbations in the latent space. However, such perturbations are hard to control due to the lack of interpretability and disentanglement. In this paper, we propose a more practical adversarial attack by designing structured perturbation with semantic meanings. Our proposed technique manipulates the semantic attributes of images via the disentangled latent codes. The intuition behind our technique is that images in similar domains have some commonly shared but theme-independent semantic attributes, e.g. thickness of lines in handwritten digits, that can be bidirectionally mapped to disentangled latent codes. We generate adversarial perturbation by manipulating a single or a combination of these latent codes and propose two unsupervised semantic manipulation approaches: vector-based disentangled representation and feature map-based disentangled representation, in terms of the complexity of the latent codes and smoothness of the reconstructed images. We conduct extensive experimental evaluations on real-world image data to demonstrate the power of our attacks for black-box classifiers. We further demonstrate the existence of a universal, image-agnostic semantic adversarial example.

研究の動機と目的

  • 従来のピクセル単位の敵対的攻撃における解釈不能性と制御不能性の欠如に対処すること。
  • 視覚的に自然で人間が解釈可能な属性レベルの構造的敵対的攻撃を開発すること。
  • VAEの潜在空間において、フォントスタイルやサイズなどのセマンティック属性を細かく分離して制御できることを実現すること。
  • 普遍的で画像に依存しない意味的敵対的例の存在とその転送性を実証すること。
  • 意味的摂動に対してブラックボックス分類器の耐性を評価すること。

提案手法

  • 各次元が特定のセマンティック属性に対応する分離された潜在表現を学習するため、分離された変分オートエンコーダー(VAE)を活用する。
  • 2つの非教師あり分離技術(ベクトルベースの分離表現と特徴マップベースの分離表現)を適用し、制御性と再構成品質を向上させる。
  • 物体の識別子を保持したまま、テーマに依存しない属性(例:フォントスタイル、サイズ)に対応する特定の潜在コードを摂動することで敵対的例を生成する。
  • 複数のサンプルに効果的な単一の画像に依存しない敵対的摂動を生成するための普遍的摂動戦略を採用する。
  • 分離された潜在空間を用いることで、属性の操作中に滑らかで自然な視覚的遷移を確保する。
  • 実世界の画像データセットを用いてブラックボックス分類器の性能を評価し、誤分類率と転送性を測定する。

実験結果

リサーチクエスチョン

  • RQ1分離された潜在表現は、セマンティック属性レベルで細かく制御可能で、解釈可能かつ自然な見た目の敵対的摂動を可能にするか?
  • RQ2摂動が特定の入力に最適化されていなくても、意味的敵対的例が複数の画像間でどれほど転送可能か?
  • RQ3本手法は、普遍的で画像に依存しない意味的敵対的例を効果的に生成できるか?
  • RQ4視覚的に妥当で意味的に整合性のある摂動を維持しながら、攻撃がブラックボックス分類器を効果的に欺けるか?
  • RQ5潜在空間の分離品質が、敵対的攻撃の制御性と耐性にどのように影響するか?

主な発見

  • 提案手法は、フォントスタイルやサイズなどのテーマに依存しない属性に限定された摂動を伴い、視覚的に自然で意味的に意味のある敵対的例を効果的に生成した。
  • ブラックボックス分類器に対して高い誤分類率を達成し、異なる画像やモデル間での強い転送性を示した。
  • 普遍的で画像に依存しない意味的敵対的例が成功裏に生成され、データセット内の複数のサンプルを高信頼度で誤分類した。
  • 再構成品質と視覚的滑らかさの観点から、特徴マップベースの分離表現がベクトルベースのアプローチを上回った。
  • 攻撃対象となるモデルが生成モデルの訓練データにアクセスしていない場合でも攻撃が有効であることが確認され、ブラックボックス設定における耐性が裏付けられた。
  • 深層ニューラルネットワークが、人間にとって見えにくく解釈可能な細かく制御可能な属性レベルの摂動に対して脆弱であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。