Skip to main content
QUICK REVIEW

[論文レビュー] Semantic tracking: Single-target tracking with inter-supervised convolutional networks

Jingjing Xiao, Qiang Lan|arXiv (Cornell University)|Nov 19, 2016
Video Surveillance and Tracking Methods参考文献 13被引用数 3
ひとこと要約

本稿では、統一された畳み込みニューラルネットワークアーキテクチャを用いて、単一ターゲット追跡とオブジェクトカテゴリ認識を統合的に実行する意味的トラッキング手法を提案する。共有特徴抽出器とカテゴリ特化型分類および追跡ブランチを統合し、互いに相互に監視するように設計することで、OTB-100ベンチマークでSOTAの性能を達成し、38の既存手法を上回るAUCスコア0.572を達成した。

ABSTRACT

This article presents a semantic tracker which simultaneously tracks a single target and recognises its category. In general, it is hard to design a tracking model suitable for all object categories, e.g., a rigid tracker for a car is not suitable for a deformable gymnast. Category-based trackers usually achieve superior tracking performance for the objects of that specific category, but have difficulties being generalised. Therefore, we propose a novel unified robust tracking framework which explicitly encodes both generic features and category-based features. The tracker consists of a shared convolutional network (NetS), which feeds into two parallel networks, NetC for classification and NetT for tracking. NetS is pre-trained on ImageNet to serve as a generic feature extractor across the different object categories for NetC and NetT. NetC utilises those features within fully connected layers to classify the object category. NetT has multiple branches, corresponding to multiple categories, to distinguish the tracked object from the background. Since each branch in NetT is trained by the videos of a specific category or groups of similar categories, NetT encodes category-based features for tracking. During online tracking, NetC and NetT jointly determine the target regions with the right category and foreground labels for target estimation. To improve the robustness and precision, NetC and NetT inter-supervise each other and trigger network adaptation when their outputs are ambiguous for the same image regions (i.e., when the category label contradicts the foreground/background classification). We have compared the performance of our tracker to other state-of-the-art trackers on a large-scale tracking benchmark (100 sequences)---the obtained results demonstrate the effectiveness of our proposed tracker as it outperformed other 38 state-of-the-art tracking algorithms.

研究の動機と目的

  • 外見や運動の一貫性といったヒューリスティック仮定に依存するカテゴリフリーのトラッカーの限界を解消すること。
  • 特定のオブジェクトタイプに限定された一般化能力の欠如を解消すること。
  • 汎用的でカテゴリ特化型の特徴を活用する統一フレームワークを構築し、堅牢で一般化可能なトラッキングを実現すること。
  • 初期化時にターゲットカテゴリに関する事前知識が不要なオンラインでの同時分類と追跡を可能にすること。
  • 推論段階で分類ネットワークと追跡ネットワークの相互監視を通じて、トラッキングの堅牢性を向上させること。

提案手法

  • ImageNetで事前学習された共有畳み込みネットワーク(NetS)を用い、オブジェクトカテゴリを跨いで汎用的特徴を抽出する。
  • NetSが抽出した特徴からオブジェクトカテゴリを予測する分類ネットワーク(NetC)を用いる。
  • 複数のブランチで構成される追跡ネットワーク(NetT)を導入し、各ブランチは特定のカテゴリの動画データで学習させ、カテゴリ特化型の前景・背景特徴を学習する。
  • オンライン追跡段階では、NetCがターゲットカテゴリを特定し、最初のフレームからの前景および背景サンプルを用いて対応するNetTブランチをファインチューニングする。
  • NetCとNetTの出力を統合して、カテゴリと前景ラベルが一貫する画像領域を選択し、ターゲットの局所化を実行する。
  • NetCとNetTの出力が矛盾する場合にネットワーク適応をトリガーし、曖昧な状況下での堅牢性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1汎用的特徴とカテゴリ特化型特徴を統合する統一された深層学習フレームワークは、単一ターゲット追跡において効果的に機能するか?
  • RQ2分類ネットワークと追跡ネットワークの間接的相互監視は、追跡の堅牢性と精度をどのように向上させるか?
  • RQ3多様なオブジェクトカテゴリにわたって一般化できる程度はどの程度か?
  • RQ4カテゴリ認識と追跡の共同学習は、外見の一貫性といったヒューリスティック仮定への依存をどのように低減するか?
  • RQ5変形、照明変化、遮蔽などの困難な視覚的条件下で、トラッカーの性能はどの程度か?

主な発見

  • 提案手法の意味的トラッカーは、OTB-100ベンチマークでAUCスコア0.572を達成し、38のSOTAトレッキングアルゴリズムを上回った。
  • 変形(DEF)、照明変動(IV)、スケール変動(SV)、高速運動(FM)、視界外(OV)、低解像度(LR)といった特定属性を持つサブデータセットにおいて、すべてのケースで最高のAUCスコアを記録した。
  • 照明変動(IV)および同一平面内回転(OPR)サブデータセットでは、それぞれAUCスコア0.577および0.544を達成し、2番目に高いスコアを記録した。
  • 変形や高速運動といった最も困難なサブデータセットを含め、12個のサブデータセットのうち9つで2番目に優れた手法(HCF)を上回った。
  • 失敗事例は主に camouflage シナリオで観察され、ターゲットの外見が背景と類似していた場合であり、文脈的シーン理解の必要性を示唆している。
  • NetCとNetTの出力が矛盾した場合に、相互監視機構が効果的にネットワーク適応をトリガーし、曖昧領域での堅牢性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。