Skip to main content
QUICK REVIEW

[論文レビュー] Tracking Objects as Points

Xingyi Zhou, Vladlen Koltun|arXiv (Cornell University)|Apr 2, 2020
Video Surveillance and Tracking Methods参考文献 57被引用数 18
ひとこと要約

CenterTrackは、フレーム間で物体の中心位置を追跡することで、物体を点として扱うシンプルでリアルタイムなマルチオブジェクト追跡手法を提案する。物体の中心位置と過去の位置へのオフセットを予測するため、2つの連続フレームと過去の検出結果のヒートマップを入力として、1段階の検出器を用いて中心位置を推定する。これにより、グリーディな関連付けを伴うエンド・トゥ・エンドで微分可能な追跡が可能となり、MOT17で67.8%のSOTA MOTA、KITTIで89.4%、nuScenes 3Dで28.3%のAMOTA@0.2を達成した。

ABSTRACT

Tracking has traditionally been the art of following interest points through space and time. This changed with the rise of powerful deep networks. Nowadays, tracking is dominated by pipelines that perform object detection followed by temporal association, also known as tracking-by-detection. In this paper, we present a simultaneous detection and tracking algorithm that is simpler, faster, and more accurate than the state of the art. Our tracker, CenterTrack, applies a detection model to a pair of images and detections from the prior frame. Given this minimal input, CenterTrack localizes objects and predicts their associations with the previous frame. That's it. CenterTrack is simple, online (no peeking into the future), and real-time. It achieves 67.3% MOTA on the MOT17 challenge at 22 FPS and 89.4% MOTA on the KITTI tracking benchmark at 15 FPS, setting a new state of the art on both datasets. CenterTrack is easily extended to monocular 3D tracking by regressing additional 3D attributes. Using monocular video input, it achieves 28.3% AMOTA@0.2 on the newly released nuScenes 3D tracking benchmark, substantially outperforming the monocular baseline on this benchmark while running at 28 FPS.

研究の動機と目的

  • オブジェクトをその中心点として表現することで、関連付けと検出の複雑さを軽減すること。
  • エンド・トゥ・エンドで微分可能な追跡を実現し、リアルタイムで物体を同時に検出・関連付けること。
  • 最小限の計算コストでMOT17、KITTI、nuScenes 3DベンチマークでSOTA性能を達成すること。
  • 静的画像上で強力なデータオーグメンテーションを用いることで、実際の動画がなくても追跡を効果的に学習できることを示すこと。
  • 手作業で設計された運動モデル(カルマンフィルターやオプティカルフローなど)よりも、学習されたオフセット予測が複雑な追跡シナリオで優れていることを示すこと。

提案手法

  • CenterTrackは、現在フレームと直前のフレームの2フレームに加え、過去のトラックレットのヒートマップを入力として、CenterNetを用いてオブジェクトの中心位置を検出する。
  • 現在のオブジェクト中心から、直前のフレームにおける対応する中心位置への2次元オフセットベクトルを予測する。
  • 予測されたオフセットとヒートマップ上の過去の検出位置に基づいて、グリーディなマッチングによりオブジェクトを関連付ける。
  • 実際の動画がなくても、静的画像に運動を模倣するような強力なデータオーグメンテーションを用いてモデルを学習する。
  • トラッカーは完全に局所的であり、未来のフレームの情報を一切使用せず、隣接するフレーム間でのみオブジェクトを関連付ける。
  • 3D追跡のため、モノクローラル動画から追加の3D属性を回帰し、nuScenesベンチマークに拡張する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトをその中心点として単一の点としてモデル化し、フレーム間のオフセット予測を学習することで、追跡を簡素化できるか?
  • RQ2エンド・トゥ・エンドで学習された検出と追跡の統合フレームワークは、複雑な2段階の検出ベース追跡パイプラインを上回る性能を発揮できるか?
  • RQ3強力なデータオーグメンテーションにより、実際の動画シーケンスがなくても静的画像上で効果的な学習が可能になるか?
  • RQ4実世界の追跡ベンチマークにおいて、学習されたオフセット予測器はカルマンフィルターやオプティカルフローといった手作業で設計された運動モデルを上回るか?
  • RQ5シンプルで局所的な追跡アプローチが、MOT17、KITTI、nuScenes 3Dといった多様なベンチマークでSOTA性能を達成できるか?

主な発見

  • MOT17では22 FPSで67.8%のMOTAを達成し、このベンチマークで新たなSOTAを樹立した。
  • KITTI追跡ベンチマークでは15 FPSで89.4%のMOTAを達成し、先行手法を上回った。
  • nuScenes 3D追跡ベンチマークでは28.3%のAMOTA@0.2を達成し、モノクローラルベースラインを3倍以上に上回った。
  • nuScenesでは28 FPSで実行され、3Dマルチオブジェクト追跡においてリアルタイム性能を示した。
  • 偽の運動を含む静的画像での学習は、動画学習と比較してわずかな性能低下しか引き起こさず、強力な性能を発揮した。
  • 検出スコアを用いたグリーディマッチングはハンガリアンマッチングを上回り、トラックの再生成によりIDF1が向上し、IDスイッチが減少した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。