Skip to main content
QUICK REVIEW

[論文レビュー] On Duality Of Multiple Target Tracking and Segmentation

Yicong Tian, Mubarak Shah|arXiv (Cornell University)|Oct 14, 2016
Video Surveillance and Tracking Methods参考文献 30被引用数 3
ひとこと要約

本稿では、ラグランジュ双対分解を用いて、オンラインマルチターゲットトラッキングと動画オブジェクトセグメンテーションを同時に最適化する二重最適化フレームワークを提案する。この手法により、相互に改善が可能となる:セグメンテーションは正確な前景マスクを提供してトラッキングのドリフトとIDスイッチを低減し、トラッキングは時間的整合性をもってセグメンテーションをガイドする。本手法は、複数のベンチマークで両タスクにおいて最先端の性能を達成した。

ABSTRACT

Traditionally, object tracking and segmentation are treated as two separate problems and solved independently. However, in this paper, we argue that tracking and segmentation are actually closely related and solving one should help the other. On one hand, the object track, which is a set of bounding boxes with one bounding box in every frame, would provide strong high-level guidance for the target/background segmentation task. On the other hand, the object segmentation would separate object from other objects and background, which will be useful for determining track locations in every frame. We propose a novel framework which combines online multiple target tracking and segmentation in a video. In our approach, the tracking and segmentation problems are coupled by Lagrange dual decomposition, which leads to more accurate segmentation results and also \emph{helps resolve typical difficulties in multiple target tracking, such as occlusion handling, ID-switch and track drifting}. To track targets, an individual appearance model is learned for each target via structured learning and network flow is employed to generate tracks from densely sampled candidates. For segmentation, multi-label Conditional Random Field (CRF) is applied to a superpixel based spatio-temporal graph in a segment of video to assign background or target labels to every superpixel. The experiments on diverse sequences show that our method outperforms state-of-the-art approaches for multiple target tracking as well as segmentation.

研究の動機と目的

  • トラッキングで得られる粗いバウンディングボックスが特徴の汚染やドリフトを引き起こすという、トラッキングとセグメンテーションを独立して処理する手法の限界を解消する。
  • オブジェクトトラック(バウンディングボックス)とピクセルレベルのセグメンテーションの強い相関関係を活用し、両タスクを同時に改善する。
  • オクルージョン、IDスイッチ、トラックドリフトといった一般的なトラッキングの課題を、ピクセル単位のセグメンテーションを監視信号として組み込むことで解決する。
  • 双対分解を用いてトラッキングとセグメンテーションを結合する統一された最適化フレームワークを開発し、反復的改善を可能にする。
  • 事前学習済み検出器に依存せず、構造的学習を用いて適応的な外見モデルを構築するエンドツーエンドのオンライン性能を達成する。

提案手法

  • ラグランジュ双対分解を用いてトラッキングとセグメンテーションの部分問題を結合し、双対変数によってバウンディングボックスとピクセルラベルの整合性を強制する。
  • トラッキングの部分では、構造的学習により個々のターゲットごとの判別的外見モデルを学習し、密にサンプリングされた候補に対してネットワークフローを用いてトラックを生成する。
  • セグメンテーションの部分では、各ターゲットごとにフォアグラウンドGMMを構築し、汎用のバックグラウンドGMMを用いて信頼度マップを生成した後、スーパーピクセルに基づく空間的・時間的グラフにマルチラベルCRFを適用する。
  • 両部分問題を反復的に最適化する:セグメンテーションはピクセルレベルのラベルによってトラック候補を精緻化し、トラッキングは整合性のあるバウンディングボックス制約によってセグメンテーションを改善する。
  • オンライン学習を用いて推論中に外見モデルを適応させ、外見の変化やオクルージョンに対しても耐性を発揮する。
  • 一部のケースでは人為的検出結果を初期化に用いるが、共同最適化により自動的にターゲットを発見可能である。

実験結果

リサーチクエスチョン

  • RQ1トラッキングとセグメンテーションを独立して解くのではなく、同時に最適化することで、両タスクの性能向上が図れるか?
  • RQ2ピクセルレベルのセグメンテーション結果は、オクルージョン時のIDスイッチやドリフトといったトラッキング誤差をどのように低減できるか?
  • RQ3トラッキング制約は、動画セグメンテーションの正確性と時間的整合性をどの程度向上できるか?
  • RQ4事前学習済み検出器を必要とせずに、双対分解がトラッキングとセグメンテーションを効果的に結合できるか?
  • RQ5粗いバウンディングボックストラッキングと細粒度の高いセグメンテーションの相互改善は、困難なシーケンスにおいてより良い一般化性能をもたらすか?

主な発見

  • 提案手法は、PETS-S2L1、TUD-Crossing、TUD-Stadtmitteの複数のデータセットで、マルチターゲットトラッキングおよび動画オブジェクトセグメンテーションの両タスクにおいて最先端の性能を達成した。
  • PETS-S2L1データセットでは、MOTAが92.5、IDSが0を達成し、従来のトラッカーを大きく上回り、IDスイッチの発生を大幅に低減した。
  • TUD-Crossingでは、MOTAが91.7、IDSが0を達成し、オクルージョンや複雑なシーンに対しても高い耐性を示した。
  • TUD-Stadtmitteでは、MOTAが83.8、IDSが0を達成し、混雑した環境でも優れた性能を発揮した。
  • 共同最適化により、オクルージョン時のアイデンティティの一貫性を維持するためのセグメンテーションの活用によって、トラックドリフトとIDスイッチが顕著に低減された。
  • アブレーションスタディの結果、セグメンテーションを組み込むことで、トラッキング専用ベースライン(Ours-Track)の性能が顕著に向上し、両タスク間の相互利益が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。