[論文レビュー] Heuristic Black-box Adversarial Attacks on Video Recognition Models
本稿では、キーフレームと顕著領域にのみ焦点を当てることで、クエリコストを低減するヒューリスティックなブラックボックス敵対的攻撃を提案する。UCF-101およびHMDB-51でベースライン手法と比較して28%以上のクエリ数を削減しながら、同時時間的・空間的スパarsityを活用して人間が感知できない摂動を維持する。
We study the problem of attacking video recognition models in the black-box setting, where the model information is unknown and the adversary can only make queries to detect the predicted top-1 class and its probability. Compared with the black-box attack on images, attacking videos is more challenging as the computation cost for searching the adversarial perturbations on a video is much higher due to its high dimensionality. To overcome this challenge, we propose a heuristic black-box attack model that generates adversarial perturbations only on the selected frames and regions. More specifically, a heuristic-based algorithm is proposed to measure the importance of each frame in the video towards generating the adversarial examples. Based on the frames' importance, the proposed algorithm heuristically searches a subset of frames where the generated adversarial example has strong adversarial attack ability while keeps the perturbations lower than the given bound. Besides, to further boost the attack efficiency, we propose to generate the perturbations only on the salient regions of the selected frames. In this way, the generated perturbations are sparse in both temporal and spatial domains. Experimental results of attacking two mainstream video recognition methods on the UCF-101 dataset and the HMDB-51 dataset demonstrate that the proposed heuristic black-box adversarial attack method can significantly reduce the computation cost and lead to more than 28\% reduction in query numbers for the untargeted attack on both datasets.
研究の動機と目的
- 高次元な動画データに起因する、動画認識モデルに対するブラックボックス敵対的攻撃における高いクエリコストの課題に対処すること。
- 動画データ内の時間的・空間的スパarsityを活用することで、キーフレームと顕著領域に限定して、クエリの複雑さを低減すること。
- モデルアーキテクチャや勾配情報が不要な攻撃効率の向上を実現し、動画監視における実世界への展開に適すること。
- 攻撃成功確率を最大化すると同時に摂動の大きさを最小化するように、適応的にフレームと領域を選択するヒューリスティックフレームワークの開発。
- LRCNやC3Dといった複数の動画認識モデルと、UCF-101やHMDB-51といったベンチマークデータセットにおいて、有効性を実証すること。
提案手法
- 動画分類に与える寄与度に基づいてキーフレームを特定するヒューリスティックアルゴリズムを提案し、敵対的摂動の探索空間を縮小する。
- 選択されたキーフレーム内の顕著領域(通常は前面の物体)を特定するためのサリエンシー検出を適用し、摂動生成をその領域に集中させる。
- 他のクラスからのサンプルを用いて摂動方向を初期化し、クエリ使用量を最小化するように、選択されたフレームと領域を段階的に最適化する。
- 最適なフレームと領域を選択した後、ゼロ次最適化(ZOO)を用いて方向を更新し、摂動の大きさを低く保つ。
- 人間が感知できないことを保証するため、平均絶対摂動(MAP)に上限を課し、同時に摂取するフレーム数と空間的領域数を最小限に抑える。
- 時間的および空間的スパarsityのヒューリスティックを統合し、最も影響力のある動画セグメントと領域に焦点を当てることでクエリ数を削減する。
実験結果
リサーチクエスチョン
- RQ1キーフレームのヒューリスティックな選択は、動画認識モデルに対するブラックボックス敵対的攻撃におけるクエリコストを低減できるか?
- RQ2時間的スパarsity(キーフレームの選択)と空間的スパarsity(顕著領域のターゲティング)のどちらがクエリ数の削減により効果的か?
- RQ3時間的および空間的スパarsityを併用することで、攻撃成功と人間が感知できない摂動を維持しつつ、クエリ効率がどの程度向上するか?
- RQ4ターゲット攻撃において空間的スパarsityを導入すると摂動の大きさがなぜ増加するのか、そして収束にどのように影響するか?
- RQ5提案手法は、モデルの勾配情報が得られない状況でも、多様な動画モデルとデータセットにおいて、強力な攻撃性能を達成できるか?
主な発見
- 提案手法は、UCF-101およびHMDB-51の両データセットにおいて、Opt-attackベースラインと比較して、非ターゲット攻撃で28%以上のクエリ数削減を達成した。
- C3DおよびLRCNモデルにおいて、時間的および空間的スパarsityを併用することで、クエリ数を28%以上削減した。特に、空間的スパarsityは時間的スパarsity単体よりもより顕著な寄与を示した。
- ターゲット攻撃では、LRCNモデル(UCF-101)においてクエリ数を445,279から399,655に削減し、両データセットで19.59%の削減を達成した。
- クエリ数を削減したにもかかわらず、ターゲット攻撃ではMAPおよびMAP*が大幅に増加し、モデルをだますためにより高い摂動エネルギーが必要であることが示された。
- 図2に示すように、本手法はキーフレーム内の前面の物体に焦点を当てた人間が感知できないスパース摂動を効果的に生成した。
- ヒューリスティックなフレーム選択プロセスは、UCF-101で約12%のクエリを占めており、最適化の重要な構成要素であるが非自明な課題を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。