[論文レビュー] IoU Attack: Towards Temporally Coherent Black-Box Adversarial Attack for Visual Object Tracking
本稿では、連続するフレーム間の予測された交差率(IoU)スコアを活用して時間的に整合性のある摂動を生成する、視覚的オブジェクト追跡のための意思決定ベースのブラックボックス敵対的攻撃であるIoU攻撃を提案する。繰り返し最適化により摂動を直交的合成し、フレーム間でそれらを転送することで、モデルアーキテクチャの知識を一切必要とせずに、最先端のトラッカーのFスコアを最大27.5%低下させ、性能を著しく劣化させる。
Adversarial attack arises due to the vulnerability of deep neural networks to perceive input samples injected with imperceptible perturbations. Recently, adversarial attack has been applied to visual object tracking to evaluate the robustness of deep trackers. Assuming that the model structures of deep trackers are known, a variety of white-box attack approaches to visual tracking have demonstrated promising results. However, the model knowledge about deep trackers is usually unavailable in real applications. In this paper, we propose a decision-based black-box attack method for visual object tracking. In contrast to existing black-box adversarial attack methods that deal with static images for image classification, we propose IoU attack that sequentially generates perturbations based on the predicted IoU scores from both current and historical frames. By decreasing the IoU scores, the proposed attack method degrades the accuracy of temporal coherent bounding boxes (i.e., object motions) accordingly. In addition, we transfer the learned perturbations to the next few frames to initialize temporal motion attack. We validate the proposed IoU attack on state-of-the-art deep trackers (i.e., detection based, correlation filter based, and long-term trackers). Extensive experiments on the benchmark datasets indicate the effectiveness of the proposed IoU attack method. The source code is available at https://github.com/VISION-SJTU/IoUattack.
研究の動機と目的
- 実世界の応用においてモデルアーキテクチャが不明であるため、視覚的オブジェクト追跡のための有効なブラックボックス敵対的攻撃が不足しているという問題に対処すること。
- 空間的なバウンディングボックスの正確さとフレーム間の動きの整合性の両方に焦点を当てることで、時間的整合性を保った意思決定ベースの攻撃を開発すること。
- フレーム間で摂動を転送することで、トラッカー性能の時間的劣化を強化し、攻撃効果を向上させること。
- 検出ベース、相関フィルタベース、および長期トラッカーを含む多様な最先端トラッカー上で、この手法の有効性を検証すること。
- IoUフィードバックを用いて最適化された摂動が、ランダムノイズや静的画像攻撃法よりも優れていることを示すこと。
提案手法
- 本手法は意思決定ベースのアプローチを採用し、現在および過去のフレームにおける予測バウンディングボックスと真値バウンディングボックスの間のIoUスコアを、トラッカーの出力をクエリすることで取得する。
- 反復的直交合成法を適用する:等しいノイズレベルで接線方向の摂動を生成し、その中からIoUを最小化するものを選択した後、最も効果的な方向に法線方向の摂動を追加する。
- 時間的整合性は、現在のフレームと直前のフレームのバウンディングボックス間のIoUスコアを摂動選択プロセスに組み込むことで確保する。
- 摂動を1フレームから次のフレームに転送することで、以降のフレームでの攻撃を初期化し、時間的攻撃効果を高める。
- 攻撃はフレーム単位で実行され、トラッカーの予測からのリアルタイムフィードバックに基づいて摂動が最適化されるため、目立たずかつ高い攻撃成功率を達成する。
- ネットワークの重みやアーキテクチャへのアクセスは不要で、分類および局所化の出力のみに依存する。
実験結果
リサーチクエスチョン
- RQ1モデルアーキテクチャへのアクセスなしに、視覚的オブジェクト追跡性能を低下させるブラックボックス敵対的攻撃を設計できるか?
- RQ2オブジェクト追跡における時間的動きの整合性は、敵対的攻撃の効果を高めるためにどのように活用できるか?
- RQ3フレームごとに独立して攻撃するのと比較して、フレーム間で摂動を転送することで、動画追跡における攻撃成功率が向上するか?
- RQ4提案されたIoUベースのフィードバック機構は、標準的な分類ベースの攻撃手法と比較して、トラッカーに対する攻撃効果性においてどのように異なるか?
- RQ5この攻撃は、短期、長期、相関フィルタベースのトラッカーを含む多様なトラッカー種別において、どの程度性能を劣化させるか?
主な発見
- IoU攻撃は、SiamRPN++でFスコアを27.5%低下、DiMPでは27.3%低下、LTMUでは14.8%低下させ、ランダムノイズやベースラインブラックボックス手法を著しく上回った。
- SiamRPN++ではEAOスコアを19.6%低下させ、精度を26.1%低下させ、ブラックボックス設定においてSPARKやUAPを上回った。
- アブレーションスタディにより、時間的IoUスコアを組み込むことで、空間的のみのIoUフィードバックよりも攻撃性能が向上したことが確認された。
- 直前のフレームからの摂動転送により攻撃成功率が向上し、初期化された摂動を使用した場合に顕著な性能劣化が観察された。
- 摂動の大きさ(ℓ₂ノルム)が増加しても攻撃は有効であり、失敗率は比例して上昇したため、本手法のロバスト性と制御可能性が裏付けられた。
- 定性的な結果から、IoU攻撃はトラッカーの予測に顕著なドリフトを引き起こした一方で、同じノイズレベルのランダムノイズはほとんど影響を及ぼさなかったため、摂動が追跡の混乱を最適化するために設計されていることが証明された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。