Skip to main content
QUICK REVIEW

[論文レビュー] Robust Visual Tracking via Convolutional Networks

Kaihua Zhang, Qingshan Liu|arXiv (Cornell University)|Jan 19, 2015
Video Surveillance and Tracking Methods参考文献 44被引用数 18
ひとこと要約

本論文は、最初のフレームにおけるターゲットオブジェクトから直接k-meansで抽出されたフィルタを用いて、判別性・スパarsity・ロバスト性に優れた視覚的表現を学習する、軽量な2層畳み込みニューラルネットワークトラッカー(CNT)を提案する。局所的な構造的および幾何的レイアウト情報を適応的文脈フィルタリングとソフトシャープンを用いてノイズ除去することで、オフライン事前学習を必要とせず、CVPR2013ベンチマークで最先端の性能を達成し、遮蔽、スケール変化、照明変化の処理において多数の高度な手法を上回っている。

ABSTRACT

Deep networks have been successfully applied to visual tracking by learning a generic representation offline from numerous training images. However the offline training is time-consuming and the learned generic representation may be less discriminative for tracking specific objects. In this paper we present that, even without offline training with a large amount of auxiliary data, simple two-layer convolutional networks can be powerful enough to develop a robust representation for visual tracking. In the first frame, we employ the k-means algorithm to extract a set of normalized patches from the target region as fixed filters, which integrate a series of adaptive contextual filters surrounding the target to define a set of feature maps in the subsequent frames. These maps measure similarities between each filter and the useful local intensity patterns across the target, thereby encoding its local structural information. Furthermore, all the maps form together a global representation, which is built on mid-level features, thereby remaining close to image-level information, and hence the inner geometric layout of the target is also well preserved. A simple soft shrinkage method with an adaptive threshold is employed to de-noise the global representation, resulting in a robust sparse representation. The representation is updated via a simple and effective online strategy, allowing it to robustly adapt to target appearance variations. Our convolution networks have surprisingly lightweight structure, yet perform favorably against several state-of-the-art methods on the CVPR2013 tracking benchmark dataset with 50 challenging videos.

研究の動機と目的

  • 大規模なオフライン事前学習および補助データに依存しない、ロバストな視覚的トラッキング手法の開発。
  • ターゲットの局所的構造的および幾何的レイアウト情報を活用して、背景との判別性を向上させること。
  • 外見変化(照明変化、遮蔽、スケールシフトなど)を効果的に処理できる、軽量かつオンラインで適応可能な表現の設計。
  • 複雑なアーキテクチャや事前学習モデルがなくても、単純な2層畳み込みネットワークが競争力のあるトラッキング性能を達成できることの実証。

提案手法

  • 最初のフレームにおけるターゲット領域から抽出された正規化済みパッチを用いてk-meansクラスタリングによりフィルタを学習し、以降のフレーム用に固定フィルタを形成する。
  • 周囲の文脈領域からも正規化パッチを抽出し、それらを追加のフィルタとして用いて適応的文脈情報を捉える。
  • これらのフィルタを、以降のフレームからの正規化画像パッチと畳み込んで特徴マップを生成し、局所的な強度パターンと構造的詳細を符号化する。
  • 得られた特徴マップを統合して、ターゲットの内部幾何的レイアウトと画像レベルの構造を保持するグローバルで中位レベルの表現を形成する。
  • 適応的しきい値を用いたソフトシャープンを適用してグローバル表現のノイズを除去し、ロバストでスパースな特徴ベクトルを生成する。
  • 外見変化に適応するためのシンプルな戦略を用いてオンラインで表現を更新することで、トラッキング中のリアルタイムなロバスト性を実現する。

実験結果

リサーチクエスチョン

  • RQ1オフライン事前学習を必要とせず、大規模な補助データセット上で学習されたモデルなしに、軽量な2層畳み込みネットワークが競争力のあるトラッキング性能を達成できるか?
  • RQ2外見変化下でのトラッキングにおいて、局所的構造的および幾何的レイアウト情報に基づく表現はどの程度有効か?
  • RQ3k-meansで学習されたフィルタとランダムなフィルタのどちらがトラッキングのロバスト性に寄与しているか?
  • RQ4ソフトシャープンは、特徴表現のスパarsityとノイズ耐性をどのように向上させるか?
  • RQ5オンライン更新戦略は、スケール変化や遮蔽下でもどの程度トラッキング精度を維持できるか?

主な発見

  • 提案されたCNTは、CVPR2013ベンチマークでAUCスコア0.545を達成し、DLTベースラインおよび他の最先端手法を大きく上回り、複雑なトラッキング課題への対処能力に優れている。
  • ソフトシャープン部を除去するとAUCスコアは0.469に低下し、ノイズ抑制と表現のロバスト性においてその重要性が明確に示された。
  • k-meansで学習されたフィルタをランダムパッチに置き換えるとAUCスコアは約7%低下し、判別性の高いフィルタ選択の重要性が確認された。
  • david, freeman3, singer1などのシーケンスで顕著なスケール変化が発生しても、KCF, Struck, VTSはスケール推定の誤りにより失敗するが、CNTは正常にターゲットを追跡できた。
  • jogging-1, suv, womanなどの重度の遮蔽状況においても、CNTは多数の競合手法よりも優れたトラッキング性能を維持し、部分的または完全な遮蔽後にターゲットを再検出できた。
  • プーリング層が存在しないため、高い空間分解能と幾何的レイアウトの保持が可能であり、これはトラッキングにおける正確な局所化に不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。