Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Multiple Person Tracking using AutoEncoder-Based Lifted Multicuts

Kalun Ho, Janis Keuper|arXiv (Cornell University)|Feb 4, 2020
Video Surveillance and Tracking Methods参考文献 52被引用数 8
ひとこと要約

本稿では、人間によるアノテーションを一切用いずに、空間的・時間的ヒントと自己符号化器ベースの潜在空間を活用して、頑健な外見特徴を学習する完全に自己教師ありの複数人物トラッキング手法を提案する。自己符号化器の学習に、リフトドマルチカット制約を組み込むことで、モデルはアイデンティティ不変の表現を学習し、長距離での再識別を正確に行えるようになる。MOT17ベンチマークにおいて、人間のアノテーションを一切使用せず、48.1%のMOTAを達成した。

ABSTRACT

Multiple Object Tracking (MOT) is a long-standing task in computer vision. Current approaches based on the tracking by detection paradigm either require some sort of domain knowledge or supervision to associate data correctly into tracks. In this work, we present an unsupervised multiple object tracking approach based on visual features and minimum cost lifted multicuts. Our method is based on straight-forward spatio-temporal cues that can be extracted from neighboring frames in an image sequences without superivison. Clustering based on these cues enables us to learn the required appearance invariances for the tracking task at hand and train an autoencoder to generate suitable latent representation. Thus, the resulting latent representations can serve as robust appearance cues for tracking even over large temporal distances where no reliable spatio-temporal features could be extracted. We show that, despite being trained without using the provided annotations, our model provides competitive results on the challenging MOT Benchmark for pedestrian tracking.

研究の動機と目的

  • 人物再識別に人間によるアノテーションデータに依存しない完全に自己教師ありの複数オブジェクトトラッキング手法を開発すること。
  • ポーズ、視点、遮蔽の変化に対しても耐性を持つ、長時間にわたる時間的距離をカバーする外見表現を学習すること。
  • 空間的・時間的ヒントを深層自己符号化器に統合し、潜在空間におけるアイデンティティの一貫性を強制すること。
  • いかなる真値アノテーションや事前学習モデルを使用せずに、MOT17ベンチマークで競争力のあるトラッキング性能を達成すること。
  • 自己教師学習によるリフトドマルチカットが、MOT用に競争力のある外見指標を生成できることを示すこと。

提案手法

  • 本手法は、隣接フレーム間のIoUなどの空間的・時間的ヒントに基づいて、最小コストのリフトドマルチカットを用いて検出結果をクラスタリングし、初期のトラックレットを形成する。
  • これらのトラックレットを用いて、同一トラックレットに属する検出結果の潜在表現間の距離を最小化するように畳み込み自己符号化器を学習する。
  • アイデンティティの一貫性を潜在空間に強制するクラスタリング損失を用いて自己符号化器を学習し、時間的経過に伴う外見不変性を学習する。
  • 得られた潜在表現は、空間的・時間的ヒントが失敗するような長時間ギャップに対しても、再識別のための頑健な外見特徴として機能する。
  • 長距離関連性をモデル化するために、10、20、30フレームの距離にリフトドエッジを追加する。
  • 最終的なトラッキング解は、空間的・時間的ヒントと学習済みの外見特徴の両方を用いて、最小コストのリフトドマルチカット問題を解くことで得られる。

実験結果

リサーチクエスチョン

  • RQ1完全に自己教師ありの手法が、人間によるアノテーションデータに依存せずに、効果的な外見特徴を学習できるか?
  • RQ2隣接フレームからの空間的・時間的ヒントを用いて、深層自己符号化器がアイデンティティ不変の表現を学習できるか?
  • RQ3トラックレットレベルのクラスタリング情報を自己符号化器に組み込むことで、長距離再識別性能が向上するか?
  • RQ4得られた潜在空間が、いかなる監督信号も使用せず、MOT17ベンチマークで競争力のあるトラッキング性能を実現できるか?
  • RQ5長距離距離でのリフトドエッジの統合が、トラッキング精度とアイデンティティスイッチの低減に与える影響は何か?

主な発見

  • 提案手法は、MOT17テストセットで48.1%のMOTAを達成し、人間のアノテーションを一切使用せず、高い競争力を示した。
  • 自己符号化器の学習中にクラスタリング損失を導入することで、ベースライン自己符号化器(クラスタリング監督なし)と比較してMOTAが10.6ポイント向上した。
  • アイデンティティスイッチの数は、ベースラインと比較して116件減少し、より優れたアイデンティティの一貫性が得られた。
  • 最高の性能はSDP検出器(MOTA 57.7%)で達成されたが、ノイズの多いDPM検出結果では性能が低下し、特にMOT17-08のような困難なシーケンスで顕著に顕われた。
  • 10〜30フレームの長距離リフトドエッジを追加することで、トラッキング精度が向上し、アイデンティティスイッチも減少した。最適な設定では、学習データで49.9%のMOTAを達成した。
  • 本手法は、自己教師ありアプローチの中で最先端の性能を達成し、MOT17ベンチマークにおいて他の完全に自己教師あり手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。