Skip to main content
QUICK REVIEW

[論文レビュー] Tracking Revisited using RGBD Camera: Baseline and Benchmark

Shuran Song, Jianxiong Xiao|arXiv (Cornell University)|Dec 12, 2012
Video Surveillance and Tracking Methods参考文献 28被引用数 9
ひとこと要約

本稿では、100本の動画を含む多様なRGBDトラッキングベンチマークを導入し、深度データを活用してトラッキングのロバスト性を著しく向上させる、シンプルだが効果的なベースラインアルゴリズムを提案する。RGB特徴、オプティカルフロー、深度に基づく遮蔽モデル化を統合することで、変形、遮蔽、モデルドリフトといった困難な状況下でも、最先端のRGBトラッカーを上回る性能を発揮する。

ABSTRACT

Although there has been significant progress in the past decade,tracking is still a very challenging computer vision task, due to problems such as occlusion and model drift.Recently, the increased popularity of depth sensors e.g. Microsoft Kinect has made it easy to obtain depth data at low cost.This may be a game changer for tracking, since depth information can be used to prevent model drift and handle occlusion.In this paper, we construct a benchmark dataset of 100 RGBD videos with high diversity, including deformable objects, various occlusion conditions and moving cameras. We propose a very simple but strong baseline model for RGBD tracking, and present a quantitative comparison of several state-of-the-art tracking algorithms.Experimental results show that including depth information and reasoning about occlusion significantly improves tracking performance. The datasets, evaluation details, source code for the baseline algorithm, and instructions for submitting new models will be made available online after acceptance.

研究の動機と目的

  • 実際的で多様な条件下におけるRGBDトラッキングアルゴリズムの評価を標準化するベンチマークを確立すること。
  • 深度情報を利用することで、視覚トラッキングにおける長年の課題であるモデルドリフトと遮蔽を解決すること。
  • 既存のRGBオンリーベストインクラス手法を上回る、シンプルで強力なRGBDトラッキングのベースラインを提供すること。
  • 大規模で多様なデータセットとアノテーション付きのグランドトゥルースを公開することで、トラッキングアルゴリズムの公平で定量的な比較を可能にすること。
  • 受容後、データセット、評価サーバー、ベースラインコードを公開することで、再現可能な研究を促進すること。

提案手法

  • 変形可能なオブジェクト、動くカメラ、さまざまな遮蔽シナリオを含む100本の高多様性なRGBD動画からなるベンチマークデータセットを構築する。
  • HOG特徴、線形SVM分類、オプティカルフロー、深度ベースの信頼性モデリングを統合したベースライントラッキングアルゴリズムを提案する。
  • ターゲットの深度ヒストグラムから推定された1次元ガウス分布を用いて、深度の一貫性をモデル化し、遮蔽物を検出する。
  • 2次元の信頼性マップ(分類器とオプティカルフローから得られる)を、ターゲットの深度分布を用いてしきい値処理することで3次元の信頼性マップを構築し、局所化の正確性を向上させる。
  • ターゲットの深度から著しく異なる深度値を持つ領域を遮蔽物として特定し、遮蔽領域におけるトラッキング応答を抑制する。
  • ターゲットが信頼性高く検出された領域でのみオンラインモデル更新を実行することで、モデルドリフトを低減する。

実験結果

リサーチクエスチョン

  • RQ1RGBオンリーモデルと比較して、深度情報がトラッキング性能にどれほど向上効果をもたらすか?
  • RQ2遮蔽やモデルドリフトに対処するために深度を活用する、シンプルで強力なRGBDトラッキングのベースラインは何か?
  • RQ3最先端のRGBトラッキングアルゴリズムが、同じRGBDベンチマークで評価された場合、どのように動作するか?
  • RQ4部分的または徐々に進行する遮蔽において、深度データが信頼性を持って遮蔽を検出し補正できるか?
  • RQ5深度情報は、ターゲットの変形や外観変化によって引き起こされるモデルドリフトをどの程度軽減できるか?

主な発見

  • 提案されたRGBDベースラインは、最先端のRGBトラッカーを著しく上回り、全評価指標において高い精度を達成した。
  • 「ぬいぐるみのくま」や「バスケットボール選手」のシーケンスのように、ターゲットの回転や変形が生じる動画では、RGBトラッカーがモデルドリフトにより追跡を失う一方、RGBDトラッカーは追跡を維持した。
  • 部分的遮蔽(例:「顔の人物」動画)の状況では、RGBDトラッカーはRGBオンリーメソッドよりも高い信頼性を維持し、誤検出を低減した。
  • 完全な遮蔽(例:「看板」動画)の状況では、RGBDトラッカーは深度情報を用いて遮蔽物を特定し、周辺領域に注目することで追跡を保持したのに対し、RGBトラッカーはターゲットを失った。
  • 徐々に進行する遮蔽(例:「鞄を持った学生」)のシナリオでは、RGBDトラッカーは遮蔽物を正しく同定し、遮蔽物に起因する汚染を防ぐためにモデル更新を抑制した。
  • 定量的評価では、RGBDベースラインが34.2%の成功率(20px以内の誤差で10フレーム中7フレームが正しく推定)を達成し、TLD(6.90%)やSemi-B(26.1%)といったRGBオンリーメソッドを大きく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。