Skip to main content
QUICK REVIEW

[論文レビュー] Tracking by Animation: Unsupervised Learning of Multi-Object Attentive Trackers

Zhen He, Jian Li|arXiv (Cornell University)|Sep 10, 2018
Video Surveillance and Tracking Methods参考文献 70被引用数 5
ひとこと要約

本論文は、ラベルなしの境界ボックスを必要とせず、再構成誤差から学習する、オンラインマルチオブジェクトトラッキングのための新しい教師なしエンドツーエンドフレームワーク、Tracking-by-Animation (TBA) を提案する。RAT(Reprioritized Attentive Tracking)を導入することで、データアソシエーションのロバスト性を向上させ、DukeMTMC などの合成および実世界のデータセットで競争力ある性能を達成した。

ABSTRACT

Online Multi-Object Tracking (MOT) from videos is a challenging computer vision task which has been extensively studied for decades. Most of the existing MOT algorithms are based on the Tracking-by-Detection (TBD) paradigm combined with popular machine learning approaches which largely reduce the human effort to tune algorithm parameters. However, the commonly used supervised learning approaches require the labeled data (e.g., bounding boxes), which is expensive for videos. Also, the TBD framework is usually suboptimal since it is not end-to-end, i.e., it considers the task as detection and tracking, but not jointly. To achieve both label-free and end-to-end learning of MOT, we propose a Tracking-by-Animation framework, where a differentiable neural model first tracks objects from input frames and then animates these objects into reconstructed frames. Learning is then driven by the reconstruction error through backpropagation. We further propose a Reprioritized Attentive Tracking to improve the robustness of data association. Experiments conducted on both synthetic and real video datasets show the potential of the proposed model. Our project page is publicly available at: https://github.com/zhen-he/tracking-by-animation

研究の動機と目的

  • 高価な境界ボックスアノテーションを必要とする、教師ありで非エンドツーエンドなトラッキング・バイ・ディテクション(TBD)手法の限界を解消すること。
  • ラベル付きデータの必要性を排除することで、オンラインマルチオブジェクトトラッキングにおけるエンドツーエンドで教師なしの学習を可能にすること。
  • 遮蔽、外観変化、背景ノイズの下でも、学習可能なアテンションメカニズムによってデータアソシエーションのロバスト性を向上させること。
  • バックプロパゲーションによってトレーニング可能な、生成的で統合最適化が可能な微分可能でジェネレーティブなフレームワークを構築すること。

提案手法

  • TBAフレームワークは、入力フレームからオブジェクトをまずトラッキングし、その後それらを再構成フレームにアニメートする微分可能ニューラルモデルを用いる。
  • 特徴抽出ネットワークは、θ^feat でパrameter化されたニューラルネットワークを用いて、入力フレームを低次元特徴に圧縮する。
  • I 個のニューラルトラッカーからなるトラッカー配列は、状態ベクトル h_t,i を維持し、θ^upd でパラメータ化されたニューラルネットワーク NN^upd を用いて、新しい Reprioritized Attentive Tracking (RAT) メカニズムにより更新する。
  • 各トラッカーは共有出力ネットワーク NN^out を通じて出力を生成し、信頼度スコアと空間特徴を含む中間レベルの表現を出力する。
  • レンダラは、学習可能なパラメータを一切持たず、トラッカー出力から入力フレームを再構成する。トレーニングは、システム全体にわたって逆伝播されるピxls単位の再構成損失によって駆動される。
  • RAT は、イテレーティブなメモリの読み書きを伴うソフトアテンションメカニズムを導入し、トラッカーが信頼度に基づいてメモリを優先的に更新することで、重複トラッキングを防ぎ、ロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1再構成誤差を唯一の学習信号として用いることで、教師なしでエンドツーエンドのマルチオブジェクトトラッキングが可能になるか?
  • RQ2特に遮蔽や外観変化の下で、真のIDが与えられていない状況において、データアソシエーションをどのようにしてロバストに保てるか?
  • RQ3RAT のような学習可能なアテンションメカニズムは、信頼度とメモリ状態に基づいてトラッカー更新の優先順位を動的に再設定することで、トラッキング性能を向上させられるか?
  • RQ4提案された TBA フレームワークは、アノテートされた境界ボックスを一切必要とせず、合成データセットおよび実世界の動画データセットの両方で一般化可能か?

主な発見

  • TBA モデルは、DukeMTMC データセットで IDF1 スコア 82.4、IDP 86.1、MOTA 79.6 を達成し、教師ありベースラインと比較しても一部の指標で優れた性能を示したが、教師なしであるにもかかわらず。
  • 合成データセットである Sprites-MOT および MNIST-MOT において、モデルは強力な一般化性能と遮蔽・外観変化に対するロバスト性を示した。
  • RAT の可視化により、アテンションウェイトがトラッキング対象に関連するメモリコンテンツを効果的に消去していることが確認され、重複トラッキングの防止とアソシエーション精度の向上に寄与している。
  • DukeMTMC において、TBA フレームワークは教師なし手法の中での最先端性能を達成し、1,026 個のオブジェクトがほとんど追跡され、46 個がほとんど紛失された状態であった。これは、長期間にわたるトラッキングの安定性が優れていることを示している。
  • アブレーションスタディにより、RAT が標準的なアテンションメカニズムと比較して、トラッキングの中断と過学習の低減を著しく改善することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。