Skip to main content
QUICK REVIEW

[論文レビュー] Temporally-Transferable Perturbations: Efficient, One-Shot Adversarial Attacks for Online Visual Object Trackers

Krishna Kanth Nakka, Mathieu Salzmann|arXiv (Cornell University)|Dec 30, 2020
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本論文は、オンライン視覚オブジェクトトラッカー向けに、1回の入力から1つの摂動を生成し、その後のすべての検索フレームに近似的にゼロの計算コストで適用可能な、1ショットで時間的に転送可能な敵対的攻撃を提案する。この手法は、先行研究と比較して標準ベンチマーク上で優れた攻撃成功率を達成するとともに、複雑な軌道操作が可能な事前計算された方向性摂動を用いて標的トラッキングを可能にする。

ABSTRACT

In recent years, the trackers based on Siamese networks have emerged as highly effective and efficient for visual object tracking (VOT). While these methods were shown to be vulnerable to adversarial attacks, as most deep networks for visual recognition tasks, the existing attacks for VOT trackers all require perturbing the search region of every input frame to be effective, which comes at a non-negligible cost, considering that VOT is a real-time task. In this paper, we propose a framework to generate a single temporally transferable adversarial perturbation from the object template image only. This perturbation can then be added to every search image, which comes at virtually no cost, and still, successfully fool the tracker. Our experiments evidence that our approach outperforms the state-of-the-art attacks on the standard VOT benchmarks in the untargeted scenario. Furthermore, we show that our formalism naturally extends to targeted attacks that force the tracker to follow any given trajectory by precomputing diverse directional perturbations.

研究の動機と目的

  • オンライン視覚オブジェクトトラッカーに対する従来の敵対的攻撃がフレームごとに摂動を生成する必要があるため、計算コストが高いため、その問題を解決すること。
  • オブジェクトテンプレート画像から1回だけ摂動を生成する1ショット攻撃戦略を開発し、その摂動を動画のすべてのフレームに適用可能にすること。
  • 事前に計算された方向性摂動を用いて、トラッカーを事前に定義された軌道に従わせる標的攻撃を可能にすること。
  • リアルタイムでの動作を維持しつつ、攻撃の効率性と有効性を向上させること。

提案手法

  • 摂動生成器を訓練し、オブジェクトテンプレート画像から1つの敵対的摂動を生成させ、それを動画シーケンス内のすべての検索領域に適用する。
  • 標的トラッキングのための多様な摂動を生成するために、標的方向を条件として用いる条件付き生成器を攻撃フレームワークで使用する。
  • 摂動がトラッカーを誤導するだけでなく、空間的一致性を保つように、欺瞞損失とシフト損失を組み合わせた損失関数を活用する。
  • 摂動は1動画あたり1回だけ生成されるため、テンプレートでの推論時間がたった8msで、リアルタイムでの適用が可能になる。
  • 分類損失と回帰損失の組み合わせを用いて、エンドツーエンドで学習し、トラッカーの誤分類を最大化する。
  • バックボーンアーキテクチャ(例:ResNet, MobileNet, AlexNet)およびトラッカー(SiamRPN++, SiamMask, SiamFC)の間での転送性を評価する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトテンプレート画像から1回だけ生成された摂動が、すべての動画フレームでオンラインのシアンセスベースの視覚オブジェクトトラッカーを効果的に欺けるか?
  • RQ2フレームごとの摂動生成と比較して、本手法がリアルタイム性能を維持しながらも、より高い攻撃成功率を達成できるか?
  • RQ3摂動生成器を条件づけることで、事前に定義された軌道に従わせる標的攻撃を実現できるか?
  • RQ4異なるトラッカーのアーキテクチャおよびバックボーンに対して、攻撃の一般化性能はどの程度高いか?

主な発見

  • OTB100では69.5%の成功率と90.5%の精度を達成し、最先端手法のCSA_T(57.3%と78.6%)を上回る。
  • VOT2018では65.4%の成功率と86.3%の精度を達成し、CSA_T(57.3%と78.6%)およびCSA_S(21.5%と36.4%)を顕著に上回る。
  • アブレーションスタディにより、シフト損失の成分が攻撃効果性に最も寄与しており、最適な性能はシフト距離d=8で得られる。
  • 転送性分析から、攻撃はSiamMaskおよびSiamRPN++(M)に対しても良好に一般化され、SiamRPN++(M)では34.7%の成功率、SiamMaskでは29.4%の成功率を記録し、大多数のケースでCSA_Tを上回る。
  • リアルタイム性能を維持しており、1動画あたりわずか8msで摂動を生成できるため、効率的なオンライン展開が可能。
  • 標的攻撃フレームワークにより、事前に計算された方向性摂動を用いて複雑な軌道操作が可能であり、実験で効果的な誘導が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。