Skip to main content
QUICK REVIEW

[論文レビュー] GNN3DMOT: Graph Neural Network for 3D Multi-Object Tracking with Multi-Feature Learning

Xinshuo Weng, Yongxin Wang|arXiv (Cornell University)|Jun 12, 2020
Video Surveillance and Tracking Methods参考文献 25被引用数 15
ひとこと要約

本論文では、グラフニューラルネットワーク(GNN)を用いた対象間特徴相互作用と、アンサンブル学習を用いた2D-3D特徴抽出器による統合により、外見と運動特徴を複数モodal間で融合する、3Dマルチオブジェクトトラッキング手法GNN3DMOTを提案する。この手法は、GNNベースの特徴精錬とマルチモーダル統合により特徴の識別性を向上させることで、KITTIおよびnuScenes 3D MOTベンチマークで最先端の性能を達成する。

ABSTRACT

3D Multi-object tracking (MOT) is crucial to autonomous systems. Recent work uses a standard tracking-by-detection pipeline, where feature extraction is first performed independently for each object in order to compute an affinity matrix. Then the affinity matrix is passed to the Hungarian algorithm for data association. A key process of this standard pipeline is to learn discriminative features for different objects in order to reduce confusion during data association. In this work, we propose two techniques to improve the discriminative feature learning for MOT: (1) instead of obtaining features for each object independently, we propose a novel feature interaction mechanism by introducing the Graph Neural Network. As a result, the feature of one object is informed of the features of other objects so that the object feature can lean towards the object with similar feature (i.e., object probably with a same ID) and deviate from objects with dissimilar features (i.e., object probably with different IDs), leading to a more discriminative feature for each object; (2) instead of obtaining the feature from either 2D or 3D space in prior work, we propose a novel joint feature extractor to learn appearance and motion features from 2D and 3D space simultaneously. As features from different modalities often have complementary information, the joint feature can be more discriminate than feature from each individual modality. To ensure that the joint feature extractor does not heavily rely on one modality, we also propose an ensemble training paradigm. Through extensive evaluation, our proposed method achieves state-of-the-art performance on KITTI and nuScenes 3D MOT benchmarks. Our code will be made available at https://github.com/xinshuoweng/GNN3DMOT

研究の動機と目的

  • 個々のオブジェクトごとに独立して特徴を抽出するための不十分な識別的特徴学習を是正すること。
  • グラフニューラルネットワーク(GNN)を用いた対象間の特徴相互作用を可能にすることで、検出ベースのトラッキングパイプラインにおけるデータアソシエーションを改善すること。
  • 2Dおよび3Dモダリティからの補完的情報を活用するため、両空間における外見と運動特徴を同時に学習すること。
  • 訓練中に特徴抽出器のブランチをランダムに無効化するアンサンブル学習パラダイムにより、モデルが単一モダリティに過剰に依存するのを防ぐこと。

提案手法

  • 各オブジェクトの特徴がグラフ内の近隣オブジェクトの特徴を集約することで更新されるGNNベースの特徴相互作用機構を導入し、対象間の文脈を活用することで識別性を向上させる。
  • 2D外見、2D運動、3D外見、3D運動特徴を同時に学習する4ブランチの共同特徴抽出器を設計し、GNN処理の前に特徴を統合する。
  • 2層のMLPを用いてアテンション重みを計算する2層のMLPを備えた、学習可能なエッジレグレッションモジュールを有する多層GNNアーキテクチャを採用する。
  • ドロップアウトにインspiredされたアンサンブル学習パラダイムを適用し、訓練中に特徴抽出器のブランチをランダムに無効化することで、モデルの頑健性とバランスの取れたモダリティ利用を確保する。
  • MOTの文脈でGCN、GraphSAGE、GATなど標準的なGNN層を上回る性能を示す、新しいノード集約ルール(タイプ4)を提案する。
  • GNN処理後の特徴から得られる精錬された類似度行列を用い、ハンガリアン法を用いてデータアソシエーションを実行することで、ネットワーク全体をエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1グラフニューラルネットワークを用いることで、対象間の特徴相互作用を可能にすることで、3Dマルチオブジェクトトラッキングにおける識別的特徴学習を改善できるか?
  • RQ22Dおよび3Dの外見と運動特徴を共同で学習することで、単一モダリティを用いる場合よりも高い性能が達成できるか?
  • RQ3訓練中に特徴抽出器のブランチをランダムに無効化するアンサンブル学習が、マルチモーダル3D MOTにおけるモデルの頑健性と性能に与える影響は何か?
  • RQ43D MOTの追跡精度を最大化するための最適なGNN層の数と集約戦略は何か?
  • RQ5cosine類似度やL2距離といった従来のメトリクスと比較して、2層MLPなどの異なるエッジレグレッションモジュールが最終的な追跡性能に与える影響は何か?

主な発見

  • 提案手法GNN3DMOTは、KITTI 3D MOTベンチマークで93.68%のsAMOTAスコアを達成し、先行手法を顕著に上回る最先端の性能を示した。
  • 2D+3D特徴抽出器に連結統合を適用した場合、93.68%のsAMOTAスコアを達成し、マルチモーダル特徴が顕著に補完的であり、追跡精度の向上に寄与することを示した。
  • 2層MLPをエッジレグレッションモジュールとして用いることで、従来のメトリクス(cosine類似度やL2距離)を上回り、93.68%のsAMOTAスコアを達成した。
  • 最適なGNN層の数は3層であり、これより増加させると過学習が生じ、性能が低下することがわかった。
  • ドロップレート0.5のアンサンブル学習パラダイムが最良の性能を達成し、モダリティ優位性の防止と一般化性能の向上の有効性を裏付けた。
  • 提案されたノード集約ルール(タイプ4)は、KITTI-Carバリデーションセットで84.70%のMOTAを達成し、GCN や GAT などの標準的なGNNバージョンを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。