[論文レビュー] DAIR-V2X: A Large-Scale Dataset for Vehicle-Infrastructure Cooperative 3D Object Detection
本論文は、都市部および高速道路環境における71,254フレームの同期LiDARおよびカメラデータを含む、車両-インフラ協調3次元物体検出(VIC3D)のための、初めての大規模で現実世界のデータセットDAIR-V2Xを紹介する。本研究では、時間的非同期を軽減し、データ送信コストを削減しながら、単一視点手法よりも平均で15%の検出精度向上を実現する、タイムコンペンセーションレイトファージョン(TCLF)フレームワークを提案する。
Autonomous driving faces great safety challenges for a lack of global perspective and the limitation of long-range perception capabilities. It has been widely agreed that vehicle-infrastructure cooperation is required to achieve Level 5 autonomy. However, there is still NO dataset from real scenarios available for computer vision researchers to work on vehicle-infrastructure cooperation-related problems. To accelerate computer vision research and innovation for Vehicle-Infrastructure Cooperative Autonomous Driving (VICAD), we release DAIR-V2X Dataset, which is the first large-scale, multi-modality, multi-view dataset from real scenarios for VICAD. DAIR-V2X comprises 71254 LiDAR frames and 71254 Camera frames, and all frames are captured from real scenes with 3D annotations. The Vehicle-Infrastructure Cooperative 3D Object Detection problem (VIC3D) is introduced, formulating the problem of collaboratively locating and identifying 3D objects using sensory inputs from both vehicle and infrastructure. In addition to solving traditional 3D object detection problems, the solution of VIC3D needs to consider the temporal asynchrony problem between vehicle and infrastructure sensors and the data transmission cost between them. Furthermore, we propose Time Compensation Late Fusion (TCLF), a late fusion framework for the VIC3D task as a benchmark based on DAIR-V2X. Find data, code, and more up-to-date information at https://thudair.baai.ac.cn/index and https://github.com/AIR-THU/DAIR-V2X.
研究の動機と目的
- 車両-インフラ協調自動運転(VICAD)研究における現実世界のデータセットの不足に対処する。
- 複数視点・複数モodalデータを用いた協調的認識を可能にする、車両-インフラ協調3次元物体検出(VIC3D)タスクを定式化する。
- 車両およびインフラセンサー間の時間的非同期と高いデータ送信コストといった、VIC3Dにおける主な課題に取り組む。
- 現実の通信制約下で融合戦略を評価・比較可能なベンチマークフレームワークを提供する。
- 現実世界のデータを用いて、協調的認識システムにおけるパフォーマンス-帯域幅トレードオフに関する研究を可能にする。
提案手法
- 都市部の交差点、高速道路、都市部の道路で収集した71,254フレームの同期LiDARおよびカメラデータを、3次元バウンディングボックスのアノテーションを含む。
- 評価シナリオの多様性を考慮し、DAIR-V2X-C(協調的)、DAIR-V2X-V(車両専用)、DAIR-V2X-I(インフラ専用)の3つのサブセットにデータセットを構造化する。
- 車両およびインフラセンサーからの入力を用いた協調的3次元検出問題として、VIC3Dタスクを定式化する。
- 時間に依存する特徴補正を用いて、時間的にずれたセンサー情報を整列させる、タイムコンペンセーションレイトファージョン(TCLF)というレイトファージョンフレームワークを提案する。
- MMDetection3Dを用いて、DAIR-V2X-VおよびDAIR-V2X-Iでベースラインを実装し、単一および複数モーダル検出のためのImvoxelNet、PointPillars、SECOND、MVXNetを含む。
- PASCAL VOCスタイルの指標を用いて、IoU閾値が車両では0.5、歩行者および自軌道利用者では0.25である、Easy、Moderate、Hardの3つの難易度レベルでパフォーマンスを評価する。

実験結果
リサーチクエスチョン
- RQ1インフラ側の認識データを統合することで、単一車両認識と比較して3次元物体検出のパフォーマンスはどの程度向上するか?
- RQ2車両およびインフラセンサー間の時間的非同期が検出精度にどの程度悪影響を及ぼし、どのように緩和できるか?
- RQ3協調的3次元検出において、エアリー・ファージョンとレイトファージョン戦略の間で、パフォーマンス-帯域幅トレードオフはどのように変化するか?
- RQ4完全な点群送信を必要とせずに、レイトファージョンフレームワークがセンサー・データストリームの遅延を効果的に補正できるか?
- RQ5さまざまな環境条件およびオブジェクトカテゴリにおいて、実際の都市部シナリオで異なる融合戦略はどのように性能を発揮するか?
主な発見
- インフラセンサーのデータ統合により、オブジェクトカテゴリにかかわらず平均で15%の平均適合率(AP)向上が達成された。
- レイトファージョン手法は、単一視点検出器と比較して10~20ポイント高いAPを達成し、複数視点協調の利点を示した。
- エアリー・ファージョンは、BEVおよび3D検出ベンチマークの両方で、最大8%のAP向上を達成したが、レイトファージョンに比べて4,000倍のデータ送信量を要した。
- 提案されたタイムコンペンセーションレイトファージョン(TCLF)フレームワークは、時間的非同期を効果的に緩和しており、特に大きな遅延がある状況でも、定量的結果および可視化からその有効性が示された。
- DAIR-V2X-I(インフラ専用)セットでは、MVXNetが車両で71.04%(Easy)、歩行者で55.83%(Easy)、自軌道利用者で54.05%(Easy)のAPを達成し、インフラ側認識の強力な性能を示した。
- DAIR-V2X-V(車両専用)セットでは、MVXNetが車両で69.86%(Easy)、歩行者で47.73%(Easy)、自軌道利用者で45.68%(Easy)のAPを達成し、車両側センサーからの高精度な検出が実現可能であることを確認した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。