Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning of Appearance Models for Online Object Tracking

Mengyao Zhai, Mehrsan Javan|arXiv (Cornell University)|Jul 9, 2016
Video Surveillance and Tracking Methods参考文献 26被引用数 13
ひとこと要約

本論文では、ベイジアン損失層を備えた畳み込みニューラルネットワーク(CNN)を用いて、外見モデルと判別的特徴を同時に学習する深層学習ベースのオンラインオブジェクトトラッカーを提案する。ImageNetにおける事前学習、最初のフレームでのファインチューニング、およびネットワークとガウス分布パラメータの反復的オンライン適応を組み合わせることで、遮蔽や外見変化に対して優れた局所化精度と耐性を示し、標準ベンチマークで最先端の性能を達成した。

ABSTRACT

This paper introduces a novel deep learning based approach for vision based single target tracking. We address this problem by proposing a network architecture which takes the input video frames and directly computes the tracking score for any candidate target location by estimating the probability distributions of the positive and negative examples. This is achieved by combining a deep convolutional neural network with a Bayesian loss layer in a unified framework. In order to deal with the limited number of positive training examples, the network is pre-trained offline for a generic image feature representation and then is fine-tuned in multiple steps. An online fine-tuning step is carried out at every frame to learn the appearance of the target. We adopt a two-stage iterative algorithm to adaptively update the network parameters and maintain a probability density for target/non-target regions. The tracker has been tested on the standard tracking benchmark and the results indicate that the proposed solution achieves state-of-the-art tracking results.

研究の動機と目的

  • 限られた正例と動的な外見変化を伴うオンラインオブジェクトトラッキングの課題に対処すること。
  • 深層特徴を用いて、遮蔽、照明変化、視点変化に対してトラッキングの耐性を向上させること。
  • ターゲット固有の外見モデルのオンライン学習を可能にする統合的深層ネットワークフレームワークの開発。
  • 手作業で設計された特徴の限界を克服し、パラメータの適応的更新が可能なエンド・トゥ・エンドで学習可能な深層特徴を活用すること。
  • CNN特徴上でのガウス混合モデルを用いたターゲットと背景の外見分布のモデリングにより、高精度な局所化を実現すること。

提案手法

  • 一般的特徴抽出のため、事前学習済みのCNN(例:GoogLeNet)を用い、オブジェクトネス検出でオフラインでファインチューニングして一般オブジェクト表現を学習する。
  • オンライン段階では、ターゲットの最初のフレームのバウンディングボックスを用いて、ネットワークをさらにファインチューニングし、ターゲット固有の外見に適応する。
  • fc7層の上に、正例(ターゲット)と負例(背景)の特徴分布をモデリングするためのガウス分布を備えたベイジアン損失層を追加する。
  • 2段階の反復的アルゴリズムを採用:まず、固定されたネットワーク重みを用いてガウスパラメータを更新し、次にトラッキング誤差からの誤差逆伝播を用いてネットワーク重みを更新する。
  • 各フレームで、ターゲット分布と背景分布の尤度比を計算し、最もスコアの高い位置を予測ターゲットとして選択する。
  • オンライン適応には、サンプリングされた正例および負例パッチの小さなバッチを用い、外見変化の継続的学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ベイジアン損失層を備えた深層CNNが、オンライントラッキングにおけるターゲットと背景の外見分布を効果的にモデリングできるか?
  • RQ2大規模データセットでの事前学習と最初のフレームでのファインチューニングが、最小限の正例でトラッキング性能を向上させるか?
  • RQ3ネットワーク重みとガウスパラメータの反復的オンライン適応が、遮蔽や外見変化に対する耐性を向上させるか?
  • RQ4局所化精度と成功確率の観点から、本手法は最先端の深層および非深層トラッカーと比較してどのように差をつけるか?
  • RQ5深層特徴と確率的外見モデルの共同学習が、単独で深層特徴または手作業特徴に依存する手法を上回るか?

主な発見

  • 本トラッカーは、OTB-2013ベンチマークで精度スコア0.841、成功スコア0.613を達成し、KCF、Struck、TLDといった非深層学習トラッカーを上回った。
  • スケール変動や低解像度を含むほとんどの属性において、FCNTやSO-DLTといった最先端の深層学習トラッカーを精度および成功スコアの両面で上回った。
  • 視界外(OV)シナリオにおいても優れた局所化精度を示し、長期的な遮蔽後でも高いオーバーラップ比を維持した。
  • 変形(DEF)および遮蔽(OCC)属性においても優れた性能を示し、強力な特徴学習により外見変化への効果的対処が可能であった。
  • 事前学習済みの深層特徴とガウス分布モデリングによる反復的オンライン適応の組み合わせが、単に複数の畳み込み層を用いる手法よりも優れた一般化性能を示した。
  • 一部の状況では精度がHDTやHCFTより低かったが、成功スコアはそれらを上回っており、困難な条件下でもより優れた局所化安定性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。