Skip to main content
QUICK REVIEW

[論文レビュー] AdvFlow: Inconspicuous Black-box Adversarial Attacks using Normalizing Flows

Hadi M. Dolatabadi, Sarah Erfani|arXiv (Cornell University)|Jul 15, 2020
Adversarial Robustness in Machine Learning参考文献 61被引用数 20
ひとこと要約

AdvFlowは、クリーン画像の周囲のデータ分布を事前学習済みの正規化フローでモデル化することで、自然なデータ構造に沿った摂動を生成する、画期的なブラックボックス敵対的攻撃を提案する。これにより、より目立たず検出されにくい敵対的例が得られ、ベースライン手法(例:$σ$-Attack)と比較して、同等以上の成功率、低いクエリ数、防御モデルにおける高い転送性を達成する。

ABSTRACT

Deep learning classifiers are susceptible to well-crafted, imperceptible variations of their inputs, known as adversarial attacks. In this regard, the study of powerful attack models sheds light on the sources of vulnerability in these classifiers, hopefully leading to more robust ones. In this paper, we introduce AdvFlow: a novel black-box adversarial attack method on image classifiers that exploits the power of normalizing flows to model the density of adversarial examples around a given target image. We see that the proposed method generates adversaries that closely follow the clean data distribution, a property which makes their detection less likely. Also, our experimental results show competitive performance of the proposed approach with some of the existing attack methods on defended classifiers. The code is available at https://github.com/hmdolatabadi/AdvFlow.

研究の動機と目的

  • 検出を避けられる、自然なデータ構造に適合した摂動を生成するブラックボックス敵対的攻撃の開発。
  • クリーン画像の周囲の真のデータ分布を正規化フローでモデル化し、敵対的例が自然なデータ多様体内に留まるようにする。
  • 摂動がクリーンデータと分布的に区別がつかないよう設計することで、敵対的検出に対する耐性を向上させる。
  • 既存のブラックボックス攻撃と比較して、防御モデルにおける高い成功率と低いクエリ数を達成する。
  • 独立した加法的ノイズ手法(例:$σ$-Attack)と比較して、フローに基づく摂動の優位性を示す。

提案手法

  • クリーンデータ上で正規化フローを事前学習し、潜在的なデータ分布を学習する。
  • 学習済みのフローを用いて、敵対的摂動の探索分布をパrameter化し、自然なデータ構造に従うように保証する。
  • ブラックボックス設定において、自然な進化戦略(NES)と探索勾配を用いて摂動分布を最適化する。
  • ターゲットモデルへのクエリを繰り返し実行し、勾配推定値を用いてフローに基づく分布を段階的に更新する。
  • 最適化されたフローに基づく分布からサンプリングすることで敵対的例を生成し、クリーンデータと構造的に類似したものを得る。
  • AdvFlowの摂動が、$σ$-Attackにおける独立ノイズとは異なり、相関を持つ成分を持つ正規分布で近似可能であることを示す補題を証明する。

実験結果

リサーチクエスチョン

  • RQ1正規化フローを用いて、自然なデータ分布に従うブラックボックス敵対的例を効果的に生成できるか?
  • RQ2AdvFlowが生成する摂動の分布的類似性は、敵対的例検出器による検出可能性にどのように影響するか?
  • RQ3フローに基づく分布で摂動をモデル化することで、加法的ノイズベースラインと比較して、より高い攻撃成功率と低いクエリ数が達成できるか?
  • RQ4特に転送性と耐性の観点から、AdvFlowは防御モデルに対してどのように性能を発揮するか?
  • RQ5正規化フローがランダム初期化のままでも、AdvFlowは効果的な敵対的例を生成できるか?

主な発見

  • ImageNetのInception-v3において、AdvFlowは平均375.00クエリ(中央値200)で97.78%の成功率を達成し、$σ$-Attack(95.06%)とBandits(87.80%)を上回るクエリ効率を示した。
  • VGG16では、平均395.61クエリ(中央値200)で99.57%の成功率を達成し、$σ$-Attack(99.57%)とBandits(95.46%)を上回る効率を示した。
  • 防御済みのDef. ResNetモデルでは、平均381.97クエリ(中央値200)で57.20%の成功率を達成し、$σ$-Attack(33.99%)とBandits(50.77%)を大きく上回った。
  • 視覚的比較では、AdvFlowの摂動が画像構造を保持しており、$σ$-Attackのピクセル単位の独立ノイズよりも検出されにくいことが示された。
  • 論文で証明された補題により、AdvFlowの摂動が相関を持つ成分を持つことが確認され、より自然でデータに整合した摂動が可能であることが裏付けられた。
  • ランダム初期化のフローを用いても、AdvFlowはInception-v3で97.78%の成功率を達成し、成功確率とクエリ効率の両面でBanditsと$σ$-Attackを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。