Skip to main content
QUICK REVIEW

[論文レビュー] Robust Online Multi-target Visual Tracking using a HISP Filter with Discriminative Deep Appearance Learning

Nathanael L. Baisa|arXiv (Cornell University)|Aug 11, 2019
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

本稿では、検証・識別畳み込みニューラルネットワーク(VerIdNet)を用いた判別的深層外見学習と、仮説的独立確率的集団(HISP)フィルタを組み合わせた、新しいオンラインマルチターゲット視覚トラッカーを提案する。空間的・時間的運動特徴と深層外見埋め込みを原理的な拡張尤度に統合することで、外見学習なしのベースライン手法に比べ、MOT16およびMOT17ベンチマークで最先端の性能を達成し、MOTA(+4.18%)およびIDF1(+5.54%)が顕著に向上した。

ABSTRACT

We propose a novel online multi-target visual tracker based on the recently developed Hypothesized and Independent Stochastic Population (HISP) filter. The HISP filter combines advantages of traditional tracking approaches like MHT and point-process-based approaches like PHD filter, and it has linear complexity while maintaining track identities. We apply this filter for tracking multiple targets in video sequences acquired under varying environmental conditions and targets density using a tracking-by-detection approach. We also adopt deep CNN appearance representation by training a verification-identification network (VerIdNet) on large-scale person re-identification data sets. We construct an augmented likelihood in a principled manner using this deep CNN appearance features and spatio-temporal information. Furthermore, we solve the problem of two or more targets having identical label considering the weight propagated with each confirmed hypothesis. Extensive experiments on MOT16 and MOT17 benchmark data sets show that our tracker significantly outperforms several state-of-the-art trackers in terms of tracking accuracy.

研究の動機と目的

  • 変動する環境条件や高いターゲット密度下でも、頑健なオンラインマルチターゲットトラッキングを実現すること。
  • データ関連の改善を目的として、ベイズフレームワーク内で運動情報と判別的深層外見特徴を統合すること。
  • HISPフィルタにおいて複数のターゲットが同じラベルを割り当てられるというアイデンティティの曖昧さ問題を解消すること。
  • 自動運転や監視などの時間的に制限のあるアプリケーションに適したリアルタイム対応トラッカーを開発すること。
  • 原理的な深層外見特徴と運動センサの統合により、標準的なMOTベンチマークで既存のオンラインおよびオフライントラッカーを上回ること。

提案手法

  • トラックのアイデンティティを維持しながら、誕生・消滅・誤検出を処理できる線形計算量のマルチターゲットフィルタであるHISPフィルタを採用する。
  • 大規模な人物再識別データセットで、判別的な深層外見特徴を抽出できる検証・識別畳み込みニューラルネットワーク(VerIdNet)を学習する。
  • 原理的なベイズ的アプローチにより、深層外見埋め込みと空間的・時間的運動特徴を統合した拡張尤度関数を構築する。
  • トラック抽出後に複数のターゲットが同じラベルが割り当てられる状況でのアイデンティティの衝突を、仮説重みを用いて解消する。
  • 公平な比較を可能にするために、MOT16およびMOT17ベンチマークの公開検出結果を用いた検出ベースのトラッキングパラダイムを適用する。
  • オンライン推論のためのスライディングウインドウアプローチを実装し、フルフレームのトラック抽出によりオフラインモードへの拡張も可能である。

実験結果

リサーチクエスチョン

  • RQ1原理的な深層外見特徴と運動特徴の統合は、オンラインマルチターゲットトラッキング性能を向上させることができるか?
  • RQ2HISPフィルタに深層外見学習を組み合わせた場合、標準ベンチマークで最先端のオンラインおよびオフライントラッカーと比較してどうなるか?
  • RQ3仮説重みを用いることで、HISPフィルタのアイデンティティの曖昧さ問題は効果的に解消できるか?
  • RQ4深層外見学習は、困難な条件下でアイデンティティスイッチをどれほど低減し、トラッキング精度を向上させられるか?
  • RQ5本手法は、高いターゲット密度およびカメラの動きがある状況でも、高い性能を維持できるか?

主な発見

  • 提案されたHISP-DALトラッカーは、MOT17ベンチマークでMOTA 37.4、IDF1 30.5を達成し、ベースラインのHISP-Tトラッカー(MOTA 35.9、IDF1 28.9)に比べてそれぞれ+4.18%、+5.54%の向上を示した。
  • アイデンティティスイッチ(IDSw)と断片化(Frag)が顕著に低減され、トラックの一貫性が向上した。
  • アブレーションスタディにより、深層外見特徴を組み込むことでIDF1が相対的に5.54%増加することが確認され、判別的外見モデリングの重要性が示された。
  • 高密度な歩行者とカメラの動きを伴う難易度の高いシーケンスMOT17-07-SDPにおいても、わずか数回のアイデンティティスイッチで、頑健な性能を維持した。
  • MOT16およびMOT17ベンチマークの主な指標(MOTA、MOTP、IDF1)において、複数の最先端のオンラインおよびオフライントラッカーを上回った。
  • 仮説重みの使用により、トラック抽出後に複数のターゲットが同じアイデンティティに割り当てられる問題が効果的に解消され、トラック管理の質が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。