Skip to main content
QUICK REVIEW

[論文レビュー] Robust Visual Tracking via Hierarchical Convolutional Features

Chao Ma, Jia‐Bin Huang|arXiv (Cornell University)|Jul 12, 2017
Video Surveillance and Tracking Methods参考文献 62被引用数 17
ひとこと要約

本論文は、深層ニューラルネットワークからの階層的畳み込み特徴を用いたロバストな視覚追跡手法を提案する。複数のCNN層における適応的相関フィルタの学習により粗いから細かい位置特定を実現し、スケール推定および再検出のための長期記憶フィルタを採用することで、ベンチマークデータセット上で最先端の精度とロバスト性を達成し、追跡性能および計算効率の両面で既存のトラッカーを上回る。

ABSTRACT

In this paper, we propose to exploit the rich hierarchical features of deep convolutional neural networks to improve the accuracy and robustness of visual tracking. Deep neural networks trained on object recognition datasets consist of multiple convolutional layers. These layers encode target appearance with different levels of abstraction. For example, the outputs of the last convolutional layers encode the semantic information of targets and such representations are invariant to significant appearance variations. However, their spatial resolutions are too coarse to precisely localize the target. In contrast, features from earlier convolutional layers provide more precise localization but are less invariant to appearance changes. We interpret the hierarchical features of convolutional layers as a nonlinear counterpart of an image pyramid representation and explicitly exploit these multiple levels of abstraction to represent target objects. Specifically, we learn adaptive correlation filters on the outputs from each convolutional layer to encode the target appearance. We infer the maximum response of each layer to locate targets in a coarse-to-fine manner. To further handle the issues with scale estimation and re-detecting target objects from tracking failures caused by heavy occlusion or out-of-the-view movement, we conservatively learn another correlation filter, that maintains a long-term memory of target appearance, as a discriminative classifier. We apply the classifier to two types of object proposals: (1) proposals with a small step size and tightly around the estimated location for scale estimation; and (2) proposals with large step size and across the whole image for target re-detection. Extensive experimental results on large-scale benchmark datasets show that the proposed algorithm performs favorably against state-of-the-art tracking methods.

研究の動機と目的

  • 顔の変化、遮蔽、背景のごみなどの大きな外観変化に起因する視覚追跡の課題に対処すること。
  • 追跡にのみ最終層のCNN特徴を使用する手法の限界を克服すること。これは、意味的不変性は保証されるが空間的精度に欠けるためである。
  • 階層的畳み込み特徴からの多層抽象化を活用することで、ロバスト性と精度を向上させること。
  • 陽的な正例および負例の広範なサンプリングに依存しない、効率的なオンライン追跡フレームワークを開発すること。
  • 追跡失敗後の信頼性の高いスケール推定および再検出を、長期記憶分類器を用いて実現すること。

提案手法

  • 事前学習済みのCNN(例:VGGNet)の複数の畳み込み層からの特徴マップを、異なる抽象化レベルでのターゲット表現に活用すること。
  • 各層の特徴マップ上で線形相関フィルタを学習し、応答マップを介してターゲット位置を予測することで、粗いから細かい位置特定を実現すること。
  • 意味的ロバスト性と空間的精度のバランスを取るために、経験的に調整されたソフトウェイトを用いて異なる層からの応答を統合すること。
  • 失敗後にターゲットを検出できるように、判別的分類器に基づいて学習された長期記憶相関フィルタを導入すること。
  • 2種類の領域提案を生成する:スケール推定用のタイトスケール提案(小さなステップサイズ)と再検出用のワイド提案(大きなステップサイズ)をEdgeBoxを用いて生成すること。
  • それぞれのタイプから最高信頼度の提案を選択し、最終的なスケール推定および再検出推定とする。

実験結果

リサーチクエスチョン

  • RQ1複数のCNN層からの階層的特徴を用いることで、最終層のみを使用する手法と比較して追跡精度とロバスト性が向上するか?
  • RQ2相関フィルタフレームワークにおいて、多層特徴表現を用いて粗いから細かい位置特定を効果的に実現できるか?
  • RQ3広範なオンラインサンプリングに依存せずに、長期記憶分類器が追跡失敗後のスケール推定および再検出を改善できるか?
  • RQ4遮蔽、変形、背景のごみなどの困難な条件下で、本手法はどのように性能を示すか?
  • RQ5リアルタイム追跡において、最先端の性能を維持しながら高い効率性を達成できるか?

主な発見

  • 提案されたHCFT*トラッカーは、VOT2015データセットにおいてロバスト性で2位、全体のオーバーラップで3位を記録し、多くの最先端手法を上回っている。
  • OTB2013およびOTB2015ベンチマークにおいて、HCFT*は、エンドツーエンドのディーブラーニングを用いた既存のトラッカーと比較して優れた精度とロバスト性を達成している。
  • HCFT*は6.7 FPSで動作し、MDNet(1.2 FPS)よりも顕著に高速であるため、強力な性能にもかかわらず高い計算効率を示している。
  • 深層の層からの意味的特徴を活用することで、外観変化や部分的遮蔽に対する耐性が向上している。
  • 失敗事例から、大規模なスケール変化および平面内回転の処理に限界があることが判明し、提案生成および幾何モデリングの改善の余地がある。
  • 階層的特徴におけるソフトウェイト統合を用いることで、ハードウェイトまたは単一層アプローチと比較して、ドリフトの低減と位置特定精度の向上が達成されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。