Skip to main content
QUICK REVIEW

[論文レビュー] Black-box Adversarial Attacks on Video Recognition Models

Linxi Jiang, Xingjun Ma|arXiv (Cornell University)|Apr 10, 2019
Adversarial Robustness in Machine Learning参考文献 45被引用数 9
ひとこと要約

本稿では、画像モデルからの転送可能摂動とNESベースのピクセル単位の補正を用いて、効率的な adversarial グラディエント推定を実現する、動画認識モデル向けの最初のブラックボックス敵対的攻撃フレームワークであるV-BADを提案する。高次元の動画モデルに対しても、わずか3.4–8.4×10⁴回のクエリで93%を超える標的攻撃成功率を達成し、高い効率性を示している。

ABSTRACT

Deep neural networks (DNNs) are known for their vulnerability to adversarial examples. These are examples that have undergone small, carefully crafted perturbations, and which can easily fool a DNN into making misclassifications at test time. Thus far, the field of adversarial research has mainly focused on image models, under either a white-box setting, where an adversary has full access to model parameters, or a black-box setting where an adversary can only query the target model for probabilities or labels. Whilst several white-box attacks have been proposed for video models, black-box video attacks are still unexplored. To close this gap, we propose the first black-box video attack framework, called V-BAD. V-BAD utilizes tentative perturbations transferred from image models, and partition-based rectifications found by the NES on partitions (patches) of tentative perturbations, to obtain good adversarial gradient estimates with fewer queries to the target model. V-BAD is equivalent to estimating the projection of an adversarial gradient on a selected subspace. Using three benchmark video datasets, we demonstrate that V-BAD can craft both untargeted and targeted attacks to fool two state-of-the-art deep video recognition models. For the targeted attack, it achieves $>$93\% success rate using only an average of $3.4 \sim 8.4 imes 10^4$ queries, a similar number of queries to state-of-the-art black-box image attacks. This is despite the fact that videos often have two orders of magnitude higher dimensionality than static images. We believe that V-BAD is a promising new tool to evaluate and improve the robustness of video recognition models to black-box adversarial attacks.

研究の動機と目的

  • 画像モデルにおける既知の脆弱性にもかかわらず、動画認識モデルに対するブラックボックス敵対的攻撃の研究が未だほとんど行われていないという問題に対処すること。
  • 高次元の動画入力においてクエリの複雑さを低減する効率的なブラックボックス攻撃フレームワークを開発すること。画像と比較して、通常は数個のオーダーも多くのクエリを要する動画入力に適したアプローチを提供する。
  • クエリ効率の良い手法を用いて、最先端の動画モデルがブラックボックス敵対的攻撃に対してどれほど耐性があるかを評価すること。
  • 画像ベースの摂動の転送性と、動画攻撃シナリオにおける部分ベースの補正によるその改善効果を調査すること。

提案手法

  • V-BADは、事前に訓練されたImageNetモデルを用いて、真の敵対的勾配方向を近似するための一時的摂動を生成する。
  • 動画入力を空間的なパッチに分割し、各パッチに対して自然推進戦略(NES)を適用して方向微分を推定することで、効率的な勾配推定を実現する。
  • 特定の部分空間上で最適化することで、一時的摂動を補正し、全ピクセル単位の勾配計算を伴わずに勾配推定の精度を向上させる。
  • V-BADは、真の敵対的勾配の低次元部分空間への射影を推定することで、クエリコストを削減しながらも高い攻撃成功率を維持する。
  • フレームワークは標的攻撃と非標的攻撃の両方をサポートしており、複数の動画データセットおよびモデルにおいてクエリ効率が維持される。
  • 画像モデルからの転送性と、NESを用いた反復的改善を組み合わせることで、精度とクエリ効率のバランスを図る。

実験結果

リサーチクエスチョン

  • RQ1高次元の動画入力という特徴を考慮しても、ブラックボックス敵対的攻撃が動画認識モデルに効果的に適用可能かどうか。
  • RQ2限られたモデルクエリ数のもとで、高次元の動画空間における敵対的勾配推定をどのように効率化できるか。
  • RQ3画像モデルからの転送された摂動が、動画モデルにおける攻撃性能にどれほど寄与するか。
  • RQ4NESを用いた部分ベースの補正が、動画攻撃フレームワークにおける勾配推定品質をどのように向上させるか。
  • RQ5ブラックボックス動画敵対的攻撃において、クエリ効率と攻撃成功率のトレードオフはどのようなものか。

主な発見

  • V-BADは、2つの最先端の動画モデルに対して平均3.4–8.4×10⁴回のクエリで93%を超える標的攻撃成功率を達成し、トップクラスのブラックボックス画像攻撃の効率性と同等の性能を示した。
  • 非標的攻撃では、標的攻撃に必要なクエリの約10%で十分であり、数百分の1のクエリ数でCNN+LSTMモデルを容易に破壊した。
  • V-BADにおける補正済み摂動は、一時的摂動よりも顕著に高いコサイン類似度(約4.66×10⁻³)を示し、NESベースの最適化による有効性が裏付けられた。
  • 初期の転送摂動は負のコサイン類似度が著しく(例:-2.743×10⁻⁴)であったが、それでもその転送性のおかげで強力な初期化として機能し、最終的な勾配推定を改善した。
  • P-BAD や SR-BAD といったベースラインと比較して、特にCNN+LSTMモデルにおいて優れた性能を示した。V-BADでは、UCF-101で他の手法が50%以上低下するのに対し、精度の低下を5%未満に抑えた。
  • 本フレームワークは、動画モデルが画像モデルと同程度にブラックボックス攻撃に対して脆弱であることを示しており、動画認識システムにおける強固な防御策の必要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。