Skip to main content
QUICK REVIEW

[論文レビュー] Deep Motion Features for Visual Tracking

Susanna Gladh, Martin Danelljan|arXiv (Cornell University)|Dec 20, 2016
Video Surveillance and Tracking Methods参考文献 19被引用数 9
ひとこと要約

本稿では、事前学習済みのオプティカルフロー網の学習した深層モーショントラック特徴と、手作業で作成した特徴および深層RGB外見特徴を、分類的相関フィルタ(DCF)に基づくトラッキングフレームワークに統合することを提案する。統合によりトラッキング性能が顕著に向上し、OTB-2015、Temple-Color、VOT-2015で最先端の結果を達成した。外見特徴のみのベースラインと比較して、平均オーバーラップ正解度で3.4%の向上を達成し、OTB-2015とTemple-Colorではそれぞれ6.8%および5.8%の向上を示した。

ABSTRACT

Robust visual tracking is a challenging computer vision problem, with many real-world applications. Most existing approaches employ hand-crafted appearance features, such as HOG or Color Names. Recently, deep RGB features extracted from convolutional neural networks have been successfully applied for tracking. Despite their success, these features only capture appearance information. On the other hand, motion cues provide discriminative and complementary information that can improve tracking performance. Contrary to visual tracking, deep motion features have been successfully applied for action recognition and video classification tasks. Typically, the motion features are learned by training a CNN on optical flow images extracted from large amounts of labeled videos. This paper presents an investigation of the impact of deep motion features in a tracking-by-detection framework. We further show that hand-crafted, deep RGB, and deep motion features contain complementary information. To the best of our knowledge, we are the first to propose fusing appearance information with deep motion features for visual tracking. Comprehensive experiments clearly suggest that our fusion approach with deep motion features outperforms standard methods relying on appearance information alone.

研究の動機と目的

  • オプティカルフローデータから学習された深層モーショントラック特徴が、視覚追跡性能に与える影響を調査すること。
  • 深層モーショントラック特徴が、外見ベースの特徴と補完的情報を提供するかどうかを検討すること。
  • 手作業特徴、深層RGB特徴、深層モーショントラック特徴を統合する戦略を、DCFベースのトラッキングフレームワークで開発・評価すること。
  • モーショントラック特徴が、遮蔽、回転、背景の雑音などの困難な追跡状況でのロバスト性を向上させることを実証すること。
  • 追跡用に追加のラベル付き学習データを必要とせずに、標準ベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • アクション認識のためのUCF101データセットで事前学習された畳み込みニューラルネットワーク(C3D)を用い、オプティカルフロー入力から深層モーショントラック特徴を抽出する。
  • 連続フレーム間のオプティカルフロー推定を実行し、深層モーショントラックネットワークの入力として利用する。
  • 分類的相関フィルタ(DCF)に基づく検出ベースのトラッキングフレームワーク内で、深層モーショントラック特徴と手作業で作成したHOG、深層RGB特徴を統合する。
  • 複数の特徴タイプにわたる統合特徴表現を用いて分類スコアを同時に最適化するDCFベースのトラッカーを採用する。
  • DCFフレームワークにおける効率的な学習および推論を実現するため、FFTを活用し、リアルタイム性能を達成する。
  • 追跡データに対する微調整なしに、事前学習済みのネットワークを外見特徴およびモーショントラック特徴に使用し、追加の学習要件を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1大規模な動画アクション認識データセットで事前学習された深層モーショントラック特徴を、外見特徴と統合することで、視覚追跡性能が向上するか?
  • RQ2手作業特徴および深層RGB特徴と比較して、深層モーショントラック特徴の分類的パワーは、追跡においてどの程度優れているか?
  • RQ3遮蔽、回転、ぼやけなど、どのような追跡状況で深層モーショントラック特徴が最も顕著な性能向上をもたらすか?
  • RQ4外見特徴とモーショントラック特徴の統合は、多様なベンチマークにおいて外見特徴のみのベースラインよりも一貫した向上をもたらすか?
  • RQ5オフプレーン回転や背景の雑音などの困難な追跡状況において、深層モーショントラック特徴がロバスト性を向上させるか?

主な発見

  • 手作業で作成したHOG、深層RGB、深層モーショントラック特徴の統合により、OTB-2015データセットで平均オーバーラップ正解度84.1%を達成し、外見特徴のみのベースライン(77.3%)を3.4%上回った。
  • OTB-2015データセットでは、本手法が成功プロットAUC 67.4%を達成し、DeepSRDCFベースライン(64.3%)を2.9ポイント上回った。
  • Temple-Colorデータセットでは、平均オーバーラップ正解度71.2%を達成し、DeepSRDCFベースライン(65.4%)を5.8%上回った。
  • VOT-2015データセットでは、精度(0.58)とロバストネス(0.92)の両面で最先端の性能を達成し、最も精度の高かった(RAJSSC)および最もロバストだった(EBT)先行手法を上回った。
  • 属性別分析により、変形(+6.4%)、視界外(+6.1%)、オフプレーン回転(+4.7%)の状況で顕著な向上が確認され、困難な状況下でのモーショントラック特徴の価値が示された。
  • OTB-2015の全11属性において一貫した性能向上が確認され、モーショントラック特徴が外見特徴と補完的であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。