Skip to main content
QUICK REVIEW

[論文レビュー] LatentPoison - Adversarial Attacks On The Latent Space

Antonia Creswell, Anil A. Bharath|arXiv (Cornell University)|Nov 8, 2017
Adversarial Robustness in Machine Learning参考文献 11被引用数 9
ひとこと要約

本稿では、深層変分オートエンコーダー(dVAE)の潜在空間を操作することで、最小限の摂動で分類ラベルを反転させる、新しい敵対的攻撃であるLatentPoisonを提案する。モデルパラメータを必要とせず、潜在コードに小さな、ターゲットを絞った加法的または乗法的摂動を適用することで、復元画像の品質を保ちつつ予測を反転させ、高い信頼度スコアを維持する。これは、分類システムに対する、静かで潜在空間ベースの回避を実現している。

ABSTRACT

Robustness and security of machine learning (ML) systems are intertwined, wherein a non-robust ML system (classifiers, regressors, etc.) can be subject to attacks using a wide variety of exploits. With the advent of scalable deep learning methodologies, a lot of emphasis has been put on the robustness of supervised, unsupervised and reinforcement learning algorithms. Here, we study the robustness of the latent space of a deep variational autoencoder (dVAE), an unsupervised generative framework, to show that it is indeed possible to perturb the latent space, flip the class predictions and keep the classification probability approximately equal before and after an attack. This means that an agent that looks at the outputs of a decoder would remain oblivious to an attack.

研究の動機と目的

  • 深層変分オートエンコーダー(dVAE)の潜在空間が、検出されないまま分類結果を変更できるかどうかを調査すること。
  • モデルパラメータにアクセスできない状況でも、エンコーダ出力と分類器の予測のみを用いて、潜在符号上で動作する実用的な敵対的攻撃を開発すること。
  • 正則化スキーム(L1およびL2)と摂動タイプ(加法的、乗法的)の違いに応じて、潜在空間攻撃の静かさと有効性を評価すること。
  • 潜在空間における最小限の摂動が、復元出力に顕著な意味的変化をもたらす一方で、分類器の信頼度を高い水準に維持できることを示すこと。

提案手法

  • 攻撃は、与えられたクラスの潜在コード z を、別のクラスに復元する潜在コードに写像する変換 𝒯∘z を学習する。この際、エンコーダ出力と分類器の予測のみを用いる。
  • この手法は、潜在コードに加法的摂動 Δz を適用し、分類器のターゲットクラスに対する信頼度を最大化すると同時に、Δz の L1 または L2 ノルムを最小化するように最適化する。
  • L1 正則化を用いることで、Δz におけるスパarsity(スパarsity)を促進し、潜在ユニットの少数のみを変更することで、攻撃の静かさを向上させる。
  • 攻撃は、顔写真データセット(笑顔 vs. 非笑顔)を用いた二値分類設定で評価され、摂動された潜在コードから画像を復元する。
  • 攻撃は各潜在コードに対して独立して適用され、すべてのサンプルに同じ変換 𝒯 が適用されるため、スケーラビリティと一般化性能に優れる。
  • 攻撃の成功は、dVAE 潜在空間のほぼ線形構造に起因しており、クラス間を滑らかに補間可能である。

実験結果

リサーチクエスチョン

  • RQ1dVAE の潜在空間における敵対的摂動は、視覚的品質に影響を与えずに、復元画像の予測クラスを反転させることができるか?
  • RQ2モデルパラメータにアクセスできない状況でも、エンコーダ出力と分類器の予測のみを用いて攻撃が有効に機能するか?
  • RQ3L1 正則化は、変更対象となる潜在ユニットの数をどれほど削減するか? また、その結果、攻撃の静かさが向上するか?
  • RQ4加法的摂動と乗法的摂動の違い、および正則化スキームの違いが、攻撃の成功度と検出可能性に与える影響は?
  • RQ5攻撃後も、元のデータや再構成サンプルよりも、変更された出力の分類器信頼度が高く保たれるか?

主な発見

  • 攻撃は『非笑顔』から『笑顔』、逆に『笑顔』から『非笑顔』へのラベル反転に成功し、再構成画像は元の再構成と視覚的に区別がつかない。
  • L1 正則化の下では、Δz におけるスパarsity が高く、わずか数個の潜在ユニットの変更で予測を反転させることができる。
  • 『非笑顔 → 笑顔』攻撃では、Poisoning+Class 攻撃タイプで分類器の信頼度が 0.98 まで上昇し、摂動の最適化が著しく行われたことが示された。
  • 同様の条件下で『笑顔 → 非笑顔』攻撃でも信頼度が 0.96 を記録し、両方向で一貫した性能を示した。
  • 攻撃は静かである。なぜなら、改ざんされた出力の信頼度が、元のデータや再構成サンプルのそれよりも高いからであり、検出が困難である。
  • 攻撃の成功は、主に dVAE 潜在空間のほぼ線形構造に起因しており、加法的摂動によるクラス間の滑らかな遷移が可能であるためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。