Skip to main content
QUICK REVIEW

[論文レビュー] ByteTrackV2: 2D and 3D Multi-Object Tracking by Associating Every Detection Box

Yifu Zhang, Xinggang Wang|arXiv (Cornell University)|Mar 27, 2023
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

ByteTrackV2 は、動きの類似性を活用する階層的データ関連戦略により、スコアにかかわらずすべての検出ボックスを関連付ける、2次元および3次元マルチオブジェクトトラッキングの統合的で非パrametricなフレームワークを提案する。nuScenesで最先端の性能を達成し、LiDARモダリティで70.1%のAMOTA、カメラモダリティで56.4%のAMOTAを記録。検出器の種類にかかわらず強い汎化性能を示し、検出以外に学習可能なパrameterを一切持たない。

ABSTRACT

Multi-object tracking (MOT) aims at estimating bounding boxes and identities of objects across video frames. Detection boxes serve as the basis of both 2D and 3D MOT. The inevitable changing of detection scores leads to object missing after tracking. We propose a hierarchical data association strategy to mine the true objects in low-score detection boxes, which alleviates the problems of object missing and fragmented trajectories. The simple and generic data association strategy shows effectiveness under both 2D and 3D settings. In 3D scenarios, it is much easier for the tracker to predict object velocities in the world coordinate. We propose a complementary motion prediction strategy that incorporates the detected velocities with a Kalman filter to address the problem of abrupt motion and short-term disappearing. ByteTrackV2 leads the nuScenes 3D MOT leaderboard in both camera (56.4% AMOTA) and LiDAR (70.1% AMOTA) modalities. Furthermore, it is nonparametric and can be integrated with various detectors, making it appealing in real applications. The source code is released at https://github.com/ifzhang/ByteTrack-V2.

研究の動機と目的

  • マルチオブジェクトトラッキングにおいて、低スコアの検出ボックスをフィルタリングすることで生じるオブジェクトの欠落やトラジェクトリの断片化を解消すること。
  • 急激な運動や一時的な遮蔽が生じる3次元シナリオにおいて、トラッキングのロバスト性を向上させること。
  • さまざまな2次元および3次元検出器と互換性を持つ、統合的で非パrametricなトラッキングフレームワークを構築すること。
  • 検出された速度とカルマンフィルタベースのスムージングを組み合わせることで、3次元における動き予測を向上させ、より一貫性のある軌道を実現すること。

提案手法

  • 高スコアの検出ボックスをトラックレットに、動きの類似性(予測ボックスと検出ボックスのIoU)を用いて最初に関連付ける階層的データ関連戦略を導入。その後、同じ基準を用いて低スコアの検出ボックスを回復する。
  • 2次元および3次元空間の両方で、トラックレットの動き予測にカルマンフィルタを用い、フレーム間での一貫性のある状態推定を実現。
  • 3次元における補完的な動き予測戦略を提案。検出されたオブジェクトの速度とカルマンフィルタの出力を融合させることで、急激な運動や遮蔽に対するロバスト性を向上。
  • データ関連の類似性指標として、予測されたトラックレット位置と検出ボックスの間で2次元または3次元のIoUを用いる。
  • 2次元および3次元MOTの両方で同じ関連付けメカニズムを適用することで、最小限のアーキテクチャ変更で統合的フレームワークを実現。
  • 再トレーニングや追加パrameterを必要とせず、任意の検出器(例:CenterPoint、TransFusion-L)とシームレスに統合可能。

実験結果

リサーチクエスチョン

  • RQ1検出スコアと動きの類似性を活用するデータ関連戦略は、低スコアの検出ボックスから真のオブジェクトを効果的に回復できるか?
  • RQ2検出された速度とカルマンフィルタの予測値を組み合わせることで、3次元マルチオブジェクトトラッキングにおける動きモデリングがどのように向上するか?
  • RQ3非パrametricで検出器に依存しないトラッキングフレームワークは、2次元および3次元MOTベンチマークで最先端の性能を達成できるか?
  • RQ4階層的関連付けは、遮蔽や急激な運動といった複雑なシナリオにおいて、軌道の断片化やオブジェクトの欠落をどの程度軽減できるか?

主な発見

  • ByteTrackV2 は、nuScenesのLiDAR 3次元MOTベンチマークで70.1%のAMOTAを達成し、新たな最先端性能を樹立。
  • カメラモダリティでは56.4%のAMOTAを記録し、これもリーダーボードをリード。
  • 同じCenterPointの検出結果を用いても、Immortal よりAMOTAで2.2%、MOTAで2.3%向上し、IDSを52%削減。
  • TransFusion-Lの検出結果と組み合わせた場合、バリデーションセットで75.0%のAMOTAを達成。これにより、すべての先行手法を上回った。
  • テストセットでは、TransFusion-L よりAMOTAで1.5%向上、IDSで45%削減。検出品質に依存しないトラッキングアルゴリズムの優位性が示された。
  • 定性的な結果から、遮蔽や急激な運動を伴う困難な状況でもIDスイッチが発生せず、実世界のシナリオにおけるロバスト性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。