Skip to main content
QUICK REVIEW

[論文レビュー] RetinaTrack: Online Single Stage Joint Detection and Tracking

Zhichao Lu, Vivek Rathod|arXiv (Cornell University)|Mar 30, 2020
Video Surveillance and Tracking Methods参考文献 67被引用数 15
ひとこと要約

RetinaTrackは、オンライン追跡のためのインスタンスレベルの埋め込みをRetinaNetに拡張することで、単一段階のシンプルで効率的な共同検出・追跡モデルを提案する。Waymo Open Datasetにおいて、先行手法よりも顕著に低い推論遅延で最先端の性能を達成しており、MOTA(44.92 vs. 42.62)とmAPの両面でTracktor++を上回り、37倍高速である。

ABSTRACT

Traditionally multi-object tracking and object detection are performed using separate systems with most prior works focusing exclusively on one of these aspects over the other. Tracking systems clearly benefit from having access to accurate detections, however and there is ample evidence in literature that detectors can benefit from tracking which, for example, can help to smooth predictions over time. In this paper we focus on the tracking-by-detection paradigm for autonomous driving where both tasks are mission critical. We propose a conceptually simple and efficient joint model of detection and tracking, called RetinaTrack, which modifies the popular single stage RetinaNet approach such that it is amenable to instance-level embedding training. We show, via evaluations on the Waymo Open Dataset, that we outperform a recent state of the art tracking algorithm while requiring significantly less computation. We believe that our simple yet effective approach can serve as a strong baseline for future work in this area.

研究の動機と目的

  • 自動運転における検出と追跡を別々のシステムとして学習する際の非効率性と複雑さに対処する。
  • 共有特徴を用いて検出と追跡を共同で学習することで、誤検出とIDスイッチを低減し、追跡性能を向上させる。
  • 計算オーバーヘッドを最小限に抑えることで、高精度なベンチマークでもリアルタイム推論を実現する。
  • 今後の2D RGB入力に基づく共同検出・追跡分野の研究の強力でシンプルなベースラインを確立する。

提案手法

  • データ関連付けにインスタンスレベルの埋め込みを出力できるように、RetinaNetのFPN後の予測ヘッドを変更し、検出と追跡の共同学習を可能にする。
  • 検出損失(Focal Loss)とインスタンス埋め込みのメトリクス学習損失を組み合わせて、エンド・ツー・エンドでモデルを学習し、追跡の一貫性を向上させる。
  • フレーム間のデータ関連付けに、埋め込み間のコサイン類似度を用い、従来のIOUベースの追跡を置き換える。
  • RetinaNetの強力な検出バックボーン(ResNet-50)を活用し、遮蔽や低照度といった困難な状況下でも小サイズの物体を処理できる。
  • トラックレットを維持し、埋め込み類似度と空間的近接性を用いて更新することで、オンライン追跡を実装する。
  • 比較のための軽量なReIDモデル(ResNet-50 TriNet)を用いるが、RetinaTrackは外部ReIDモデルに依存しないように共同で学習する。

実験結果

リサーチクエスチョン

  • RQ1単一段階の検出器は、オンラインマルチオブジェクト追跡のためのオブジェクト検出とインスタンスレベルの埋め込みを同時に予測できるように効果的に拡張可能か?
  • RQ2検出と追跡を共同で学習することで、別々に学習する場合と比較して追跡性能が向上するか?
  • RQ32段階または複数モジュールのトラッカーと比較して、共同モデルが顕著に低い推論遅延で最先端の追跡性能を達成できるか?
  • RQ4遮蔽、小サイズのオブジェクト、低照度といった困難な自動運転環境下で、共同モデルはどの程度の性能を示すか?

主な発見

  • RetinaTrackはWaymo v1.1データセットで44.92 MOTAを達成し、IOUベースのベースライン(38.25 MOTA)とTracktor++(42.62 MOTA)を上回った。
  • モデルはWaymoデータセットで45.70 mAPを達成し、最先端の検出器と同等の高い検出精度を示した。
  • RetinaTrackは1フレームあたり70msで実行され、Tracktor++(2645ms)の37倍高速であり、誤検出とIDスイッチを顕著に低減した。
  • 検出とメトリクス学習損失を共同で学習することで、検出とReIDを別々に学習する場合よりも優れた追跡性能が得られた。
  • 外部ReIDモデルがなくても、RetinaTrackはIOUオンativeのベースラインを上回った。これは、検出と同時に学習されるインスタンス埋め込みが非常に効果的であることを示している。
  • 遮蔽や低照度の困難な状況下でも、長時間にわたる消失期間中でも一貫した追跡を維持するなど、強力な性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。