Skip to main content
QUICK REVIEW

[論文レビュー] Online Object Tracking, Learning and Parsing with And-Or Graphs

Tianfu Wu, Yang Lu|arXiv (Cornell University)|Sep 27, 2015
Video Surveillance and Tracking Methods参考文献 67被引用数 9
ひとこと要約

本論文は、未知のオブジェクトの構造的および外観的変化をモデル化するための階層的アンド・オアグラフ(AOG)を用いた、オンラインオブジェクト追跡、学習、パースングフレームワーク「AOGTracker」を提案する。空間的および時間的動的計画法を用いてリアルタイム推論を実現し、識別的潜在SVM学習により遮蔽、照明変化、不要なオブジェクト(distractors)に対応可能であり、TB-100では最先端性能を達成し、VOTベンチマーク(VOT2015およびTIR2015含む)でも競争力のある結果を示した。

ABSTRACT

This paper presents a method, called AOGTracker, for simultaneously tracking, learning and parsing (TLP) of unknown objects in video sequences with a hierarchical and compositional And-Or graph (AOG) representation. %The AOG captures both structural and appearance variations of a target object in a principled way. The TLP method is formulated in the Bayesian framework with a spatial and a temporal dynamic programming (DP) algorithms inferring object bounding boxes on-the-fly. During online learning, the AOG is discriminatively learned using latent SVM to account for appearance (e.g., lighting and partial occlusion) and structural (e.g., different poses and viewpoints) variations of a tracked object, as well as distractors (e.g., similar objects) in background. Three key issues in online inference and learning are addressed: (i) maintaining purity of positive and negative examples collected online, (ii) controling model complexity in latent structure learning, and (iii) identifying critical moments to re-learn the structure of AOG based on its intrackability. The intrackability measures uncertainty of an AOG based on its score maps in a frame. In experiments, our AOGTracker is tested on two popular tracking benchmarks with the same parameter setting: the TB-100/50/CVPR2013 benchmarks, and the VOT benchmarks --- VOT 2013, 2014, 2015 and TIR2015 (thermal imagery tracking). In the former, our AOGTracker outperforms state-of-the-art tracking algorithms including two trackers based on deep convolutional network. In the latter, our AOGTracker outperforms all other trackers in VOT2013 and is comparable to the state-of-the-art methods in VOT2014, 2015 and TIR2015.

研究の動機と目的

  • 外観的および構造的変化、遮蔽、背景の雑音にさらされる長期的オンラインオブジェクト追跡の課題に対処すること。
  • 事前学習済みモデルが不要な状態で、動画シーケンスにおいて未知のオブジェクトを同時に追跡・学習・解析する統合フレームワークの開発。
  • AOG構造およびパラメータのオンライン学習中に、モデルの純度を保ちつつ複雑さを制御すること。
  • モデルの不確実性を測る指標「イントラックアビリティ」に基づき、再学習のための重要な瞬間を特定すること。
  • 構成的で階層的な表現を用いて、最小限の人的監視で複雑なシーンにおける頑健な追跡を可能にすること。

提案手法

  • フレームワークは、オブジェクト構造と部品配置を表現するための階層的アンド・オアグラフ(AOG)を用い、外観的および構造的変化の組み合わせ的モデリングを可能にする。
  • 空間的および時間的動的計画法(DP)アルゴリズムを用いて、直近の観測と過去の観測を統合し、リアルタイムでオブジェクトのバウンディングボックスを推論する。
  • 潜在SVMを用いてAOGパラメータの識別的学習を実施し、外観の変化、遮蔽、不要なオブジェクトへの適応をリアルタイムで可能にする。
  • オンライン学習中に正例と負例の純度を保つための純度制御機構を適用し、モデルの劣化を防止する。
  • 量子化された構成空間からの判別性が低い部品構成のプルーニングにより、モデルの複雑さを制御する。
  • スコアマップから算出されるイントラックアビリティを用い、不確実性を検出すると、必要に応じて構造的再学習をトリガーする。

実験結果

リサーチクエスチョン

  • RQ1構成的アンド・オアグラフ表現は、長期動画追跡における未知オブジェクトの変化を効果的にモデル化できるか?
  • RQ2正例および負例の純度を保ちながら、効率的なオンライン学習を実現できるか?
  • RQ3動的計画法を用いることで、時間的および空間的次元でオブジェクト状態を同時に推論し、追跡精度を向上させられるか?
  • RQ4オンライン潜在構造学習中にモデルの複雑さをどのように制御できるか?
  • RQ5イントラックアビリティは、不確実性への対応として構造的再学習をトリガーする信頼できるシグナルとして機能するか?

主な発見

  • TB-100/50/CVPR2013ベンチマークでは、2つのディープラーニングベースの手法を含む最先端のトラッカーを上回った。
  • VOT2013では、最高の正確性と最も良い総合順位を達成したが、上位3つのトラッカーと比較してわずかに低い耐障害性を示した。
  • VOT2014では、最先端のトラッカーと同等の性能を示し、多様な視覚的課題に対する強い汎化能力を示した。
  • VOT2015では51%の正確性を達成し、62のトラッカー中3位となった。
  • TIR2015(赤外画像)では65%の正確性を達成し、28のトラッカー中3位と並び、同率となった。
  • 本手法は、事前学習済みモデルに依存せず、照明の変化、部分的遮蔽、背景の雑音に対しても頑健であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。