Skip to main content
QUICK REVIEW

[論文レビュー] Motion-Excited Sampler: Video Adversarial Attack with Sparked Prior

Hu Zhang, Linchao Zhu|arXiv (Cornell University)|Mar 17, 2020
Adversarial Robustness in Machine Learning参考文献 40被引用数 6
ひとこと要約

本稿では、効率的なブラックボックス動画敵対的攻撃のため、動きに依存するノイズ事前分布(以下「スパークド・プライア」)を生成する動き刺激型サンプラーを提案する。光流を用いてノイズのサンプリングを誘導することで、4つの動画行動認識データセットにおいて、ランダムまたは非動きに依存するベースラインと比較して、はるかに少ないクエリ数で収束が速く、成功確率も高い結果が得られた。

ABSTRACT

Deep neural networks are known to be susceptible to adversarial noise, which are tiny and imperceptible perturbations. Most of previous work on adversarial attack mainly focus on image models, while the vulnerability of video models is less explored. In this paper, we aim to attack video models by utilizing intrinsic movement pattern and regional relative motion among video frames. We propose an effective motion-excited sampler to obtain motion-aware noise prior, which we term as sparked prior. Our sparked prior underlines frame correlations and utilizes video dynamics via relative motion. By using the sparked prior in gradient estimation, we can successfully attack a variety of video classification models with fewer number of queries. Extensive experimental results on four benchmark datasets validate the efficacy of our proposed method.

研究の動機と目的

  • 画像ベースの敵対的攻撃手法を動画モデルに適用する有効性を調査すること。
  • 時間的ダイナミクスと動きパターンを活用することで、動画敵対的攻撃研究におけるギャップを埋めること。
  • 動き情報を利用したクエリ効率の良いブラックボックス攻撃手法を、動画分類モデル向けに開発すること。
  • 勾配推定と攻撃効率の観点から、ランダムまたはフレーム独立のノイズと比較して、動きに依存するノイズ事前分布が優れていることを示すこと。
  • 複数の動画データセットおよびモデルを用いて、動きマップの品質と損失関数の選択の妥当性を実証的に検証すること。

提案手法

  • 連続する動画フレーム間の光流または動きベクトルを用いて動きマップを構築し、フレーム間の動きを捉える。
  • 動きマップを用いてランダムノイズの選択を誘導する動き刺激型サンプラーを設計し、動きに依存するノイズ事前分布(「スパークド・プライア」)を生成する。
  • スパークド・プライアを勾配推定に活用し、反復的な敵対的例生成の過程で探索効率を向上させる。
  • モデルの勾配に依存しないブラックボックス設定で本手法を適用し、入力-出力クエリのみを前提とする。
  • 最適化過程でクロスエントロピー、確率ベース、ログティスベースの損失関数を比較し、最も効果的な目的関数を同定する。
  • 動きマップを手作業で作成したマップ(均一および順序付き)に置き換えることで、内在的動きパターンの重要性をアブレーションする。

実験結果

リサーチクエスチョン

  • RQ1画像攻撃から直接移行した手法と比較して、動画敵対的攻撃に動き情報を組み込むことで、攻撃効率と成功確率が向上するか?
  • RQ2動きマップの構造(例:内在的動き vs. 手作業で作成したパターン)が攻撃性能に与える影響は何か?
  • RQ3クロスエントロピー、確率、ログティスのどの損失関数が、動画敵対的攻撃における勾配推定に最も効果的か?
  • RQ4動き刺激型サンプラーは、ブラックボックス動画攻撃において、成功する敵対的例を生成するためのクエリ数を削減できるか?
  • RQ5動きに依存するノイズサンプリングから得られるスパークド・プライアは、フレーム独立または繰り返しノイズ事前分布よりも優れているか?

主な発見

  • I3Dを用いたKinetics-400およびUCF-101では、それぞれ2,494クエリおよび1,780クエリで100%の攻撃成功確率を達成し、ベースラインを著しく上回った。
  • I3Dを用いたUCF-101では、本手法は6,876クエリで効果を発揮したが、マルチノイズベースラインは2倍以上の13,773クエリを要し、成功確率も10%低い結果となった。
  • 「S-Value」マップ(順序付きピクセル値)を手作業で作成した場合、均一ノイズの「U-Sample」と比較してわずかに性能が向上した。これは、構造的な動きパターンが重要であることを示唆している。
  • I3Dを用いたKinetics-400では、「S-Value」マップよりもスパークド・プライア手法が1,000以上のクエリを削減した。これは、動きマップが合成マップよりも優れていることを示している。
  • ログティスベースの損失関数が一貫してクロスエントロピーおよび確率ベースの損失関数を上回り、最も少ないクエリ数で100%の成功確率を達成した。
  • アブレーションスタディにより、動きマップに内在する動きパターンが極めて重要であることが確認された。ランダムまたは均一なマップに置き換えると、攻撃の有効性が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。