Skip to main content
QUICK REVIEW

[論文レビュー] Deep Tracking: Visual Tracking Using Deep Convolutional Networks

Meera Hahn, Si Chen|arXiv (Cornell University)|Dec 13, 2015
Video Surveillance and Tracking Methods参考文献 10被引用数 11
ひとこと要約

本論文では、二重スティームアーキテクチャを用いて事前学習済みの深層畳み込みニューラルネットワークを活用し、同時的な外見と運動特徴を抽出する視覚追跡手法であるDeep Tracking (DT) を提案する。事前学習済みのCNNとオンラインSVM分類、および適応的モデル更新を組み合わせることで、ベンチマークデータセット上で最先端の性能を達成し、Visual Tracker Benchmarkでは4.28%、ALOV++では2.77%のFスコアで既存のトラッカーを上回った。

ABSTRACT

In this paper, we study a discriminatively trained deep convolutional network for the task of visual tracking. Our tracker utilizes both motion and appearance features that are extracted from a pre-trained dual stream deep convolution network. We show that the features extracted from our dual-stream network can provide rich information about the target and this leads to competitive performance against state of the art tracking methods on a visual tracking benchmark.

研究の動機と目的

  • 遮蔽、照明変化、スケール変動、運動ブラーといった視覚追跡における継続的な課題に対処するため、深層特徴を活用すること。
  • 手作業で設計された特徴(HoG や SIFT など)と比較して、事前学習済みの深層特徴が追跡のロバスト性と正確性を向上させるかどうかを調査すること。
  • 限られたトレーニングデータでリアルタイムに適応する効率的なオンライン追跡パイプラインを開発すること。
  • 二重スティームCNNアーキテクチャと適応的モデル更新を用いて、運動と外見の手がかりを効果的に統合すること。

提案手法

  • トラッカーは、Krizhevskyらの研究にインspiredされた事前学習済みImageNet CNNを用い、外見および運動スティームから深層特徴を抽出する。
  • 正例および負例のトレーニングサンプルは、Nフレーム間(実験ではN=4)にわたり、追跡対象の位置を中心に回転・シフトを用いたデータ拡張によって収集される。
  • CNNの2番目の全結合層からの特徴が、候補ボクシングのオンライントレーニングおよび分類のためのSVM分類器に供給される。
  • モデルは、効率性を高めるために、3層の全結合ヘッドを用いて動画固有のデータでファインチューニングされ、特徴と分類器の共同学習が可能になる。
  • 光学フローを用いて運動スティームの表現を強化し、急激な運動変化や遮蔽に対するロバスト性を向上させる。
  • トラッカーは適応的モデル更新を採用している:運動スティームは4フレームごとに更新され、外見スティームは50フレームごとまたは信頼度が0.85未満になったときに更新される。

実験結果

リサーチクエスチョン

  • RQ1二重スティームCNNから得られる事前学習済みの深層特徴は、従来の手作業特徴(例:HoG や SIFT)と比較して、視覚追跡性能を向上させるか?
  • RQ2外見と運動特徴の統合は、遮蔽や照明変化の処理においてどの程度効果的か?
  • RQ3限られた動画固有のデータで事前学習済みCNNをオンラインでファインチューニングすることで、追跡の正確性と効率性を維持できるか?
  • RQ4信頼度しきい値(0.85)に基づく適応的モデル更新は、ターゲット変形や外見変化に対するロバスト性をどのように向上させるか?
  • RQ5再訓練を伴わず、マルチスケールテストを用いることで、スケール変動はどの程度管理可能か?

主な発見

  • Deep Tracker (DT) はVisual Tracker BenchmarkでFスコア65.92を達成し、Struck (55.19) や SCM (61.64) よりも少なくとも4.28ポイント高い性能を示した。
  • ALOV++ベンチマークでは、DTがFスコア68.96を達成し、Struckの66.00を2.77ポイント上回った。
  • DTは遮蔽、高速運動、背景の雑音、照明変化といった複数の困難な状況において優れた性能を示した。
  • 事前学習済みの深層特徴の使用により、従来の手作業特徴と比較して追跡のロバスト性が顕著に向上した。
  • 信頼度しきい値(0.85)に基づく適応的モデル更新は、過学習を避けて急激な遮蔽や外見変化に対処するのに効果的であった。
  • 1フレームあたり20種類の異なるスケールを用いたマルチスケールテストにより、網羅的なサンプリングを必要とせず、計算コストを削減しながら効率的なスケール管理が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。