Skip to main content
QUICK REVIEW

[論文レビュー] Joint Multi-Object Detection and Tracking with Camera-LiDAR Fusion for Autonomous Driving

Kemiao Huang, Hao Qi|arXiv (Cornell University)|Aug 10, 2021
Video Surveillance and Tracking Methods被引用数 6
ひとこと要約

本論文は、自動運転を想定したリアルタイムでエンド・ツー・エンドの統合的複数対象検出と追跡(JMODT)フレームワークを、カメラ-LiDAR融合を用いて提案する。3次元物体検出とオンライン連携を統合されたネットワークで統合し、外観、運動、幾何学的要因を組み合わせた頑健な3次元アフィニティ指標を採用し、包括的なデータ連携に混合整数プログラミングを用いる。外部の事前学習を必要とせず、KITTIベンチマークでSOTAのMOTA(86.3%)と推論速度(0.01秒)を達成する。

ABSTRACT

Multi-object tracking (MOT) with camera-LiDAR fusion demands accurate results of object detection, affinity computation and data association in real time. This paper presents an efficient multi-modal MOT framework with online joint detection and tracking schemes and robust data association for autonomous driving applications. The novelty of this work includes: (1) development of an end-to-end deep neural network for joint object detection and correlation using 2D and 3D measurements; (2) development of a robust affinity computation module to compute occlusion-aware appearance and motion affinities in 3D space; (3) development of a comprehensive data association module for joint optimization among detection confidences, affinities and start-end probabilities. The experiment results on the KITTI tracking benchmark demonstrate the superior performance of the proposed method in terms of both tracking accuracy and processing speed.

研究の動機と目的

  • 自動運転のための複数対象追跡(MOT)における、段階的トラッキング・バイ・ディテクションパイプラインの限界を解消すること。
  • マルチモーダルセンサーフュージョンを用いて、オクルージョンや密集した物体配置下でも追跡の頑健性を向上させること。
  • リアルタイム性能を実現するため、検出、相関、データ連携を統合的に最適化するフレームワークを開発すること。
  • 検出信頼度、アフィニティ指標、開始/終了確率を包括的なデータ連携モジュールに統合すること。
  • 外部の2次元データセットや事前学習を不要とし、3次元データ上のエンド・ツー・エンド統合学習に依存すること。

提案手法

  • カメラ(2次元)とLiDAR(3次元)の測定値を統合し、エンド・ツー・エンドの深層ニューラルネットワークが3次元バウンディングボックスと関連スコアを同時に予測する。
  • 独自の3次元運動に適応したアフィニティ計算モジュールが、カメラからの外観特徴とカルマンフィルタからの運動予測を、距離IoU(DIoU)指標を用いて統合する。
  • ポイントワイズでのカメラとLiDAR特徴の統合により、空間的正確性を保持し、正確な3次元位置特定を可能にする。
  • 包括的なデータ連携モジュールが、混合整数プログラミング(MIP)を用い、検出信頼度、アフィニティスコア、トラックの開始/終了確率を同時に最適化する。
  • 類似した外観の対象を区別できるようにするため、開始・終了推定モジュールをフレームワークに組み込む。
  • 外部の2次元データセットでの事前学習を一切行わず、3次元アノテーションのみに依存したエンド・ツー・エンドの学習でモデルを訓練する。
Figure 1: An overview of the classical MOT system with camera-LiDAR fusion for autonomous driving. $\text{Frame}_{t-1}$ and $\text{Frame}_{t}$ are two adjacent frames of fused 2D-3D data respectively. $S_{1...4}$ represent tracking states.
Figure 1: An overview of the classical MOT system with camera-LiDAR fusion for autonomous driving. $\text{Frame}_{t-1}$ and $\text{Frame}_{t}$ are two adjacent frames of fused 2D-3D data respectively. $S_{1...4}$ represent tracking states.

実験結果

リサーチクエスチョン

  • RQ1検出と追跡の統合的エンド・ツー・エンド学習は、カメラ-LiDAR統合システムにおける追跡精度と推論速度を向上させ得るか?
  • RQ23次元運動および幾何学的注意を備えたアフィニティ指標を組み込むことで、オクルージョンや密集した物体シナリオ下での頑健性がどのように向上するか?
  • RQ3検出の不確実性とトラックのライフサイクルをモデル化する統合的データ連携モジュールは、追跡性能をどの程度向上させるか?
  • RQ4統合的検出・追跡フレームワークは、外部の2次元事前学習を不要とし、性能を維持または向上させ得るか?
  • RQ5本手法は、実世界ベンチマーク上でのSOTAのトラッキング・バイ・ディテクションおよび統合的検出・追跡ベースラインと比較して、どのように差をつけるか?

主な発見

  • 提案されたJMODTフレームワークは、KITTIの車両追跡ベンチマークでMOTA 86.27%を達成し、既存のカメラ-LiDAR統合手法を上回る性能を示した。
  • 処理速度は1フレームあたり0.01秒を達成し、ベースラインのmmMOT(0.02秒)および他のSOTA手法よりも顕著に高速であった。
  • データ連携に混合整数プログラミング(MIP)を用いることで、誤検出(FP)は1946(ハンガリアン法)から578に、IDスイッチ(IDSW)は1169から2に削減された(検出信頼度閾値0.85時)。
  • 外観と運動の統合を実現した3次元DIoUアフィニティ指標により、IDSWはわずか2にまで低下し、オクルージョンや複雑な運動シナリオ下でも優れた頑健性を示した。
  • 開始・終了推定モジュールは、外見が類似した対象を的確に区別でき、ベースラインのmmMOTが失敗する状況でもIDスイッチを防止した。
  • 外部の2次元データセットや事前学習を一切必要とせず、3次元アノテーションのみに依存したエンド・ツー・エンド学習でSOTA性能を達成した。
Figure 2: The system architecture of the proposed camera-LiDAR based joint multi-object detection and tracking system.
Figure 2: The system architecture of the proposed camera-LiDAR based joint multi-object detection and tracking system.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。