Skip to main content
QUICK REVIEW

[論文レビュー] BEVFusion: A Simple and Robust LiDAR-Camera Fusion Framework

Tingting Liang, Hongwei Xie|arXiv (Cornell University)|May 27, 2022
Advanced Neural Network Applications被引用数 201
ひとこと要約

BEVFusion はカメラと LiDAR のストリームを共有 BEV 空間に分離し、動的モジュールで統合することで、LiDAR またはカメラの故障に対する頑健性を向上させ、ポスト処理なしで nuScenes で最先端の結果を達成します。

ABSTRACT

Fusing the camera and LiDAR information has become a de-facto standard for 3D object detection tasks. Current methods rely on point clouds from the LiDAR sensor as queries to leverage the feature from the image space. However, people discovered that this underlying assumption makes the current fusion framework infeasible to produce any prediction when there is a LiDAR malfunction, regardless of minor or major. This fundamentally limits the deployment capability to realistic autonomous driving scenarios. In contrast, we propose a surprisingly simple yet novel fusion framework, dubbed BEVFusion, whose camera stream does not depend on the input of LiDAR data, thus addressing the downside of previous methods. We empirically show that our framework surpasses the state-of-the-art methods under the normal training settings. Under the robustness training settings that simulate various LiDAR malfunctions, our framework significantly surpasses the state-of-the-art methods by 15.7% to 28.9% mAP. To the best of our knowledge, we are the first to handle realistic LiDAR malfunction and can be deployed to realistic scenarios without any post-processing procedure. The code is available at https://github.com/ADLab-AutoDrive/BEVFusion.

研究の動機と目的

  • LiDAR 入力を用いて画像クエリを生成する既存の LiDAR-カメラフュージョン手法の限界を特定する。
  • 互いに独立した共通 BEV 表現へカメラと LiDAR データを符号化する二重ストリームのフレームワークを提案する。
  • 両モダリティの BEV 特徴を結合する、単純で効果的なフュージョンモジュールを開発する。
  • 専門の拡張と評価を通じて、現実的な LiDAR の不具合やカメラ故障への頑健性を示す。

提案手法

  • 二つの独立したストリームが入力を同じ BEV 空間に符号化する。カメラストリームは Lift-Splat-Shoot の適応と Dual-Swin-Tiny ボトルネックおよび BEV エンコーダを用い、LiDAR ストリームは PointPillars、CenterPoint、または TransFusion をバックボーンとして使用する。
  • 動的フュージョンモジュールは BEV 特徴を連結し、チャネル-空間融合を適用した後、適応的特徴選択で F_fused を生成する。
  • 統合 BEV 特徴は、予測のために標準的な3D検出ヘッド(アンカー型、アンカーフリー、またはトランスフォーマー型)へ供給される。
  • カメラ BEV 特徴は、深度を予測し画像特徴をボクセルグリッドにレンダリングするビュー射影機を介して生成され、空間からチャネルへのアプローチを用いて BEV エンコーダによって圧縮される。
  • LiDAR BEV 特徴は確立された LiDAR バックボーンによって生成され、カメラ分岐に依存せず BEV に変換される。
  • 訓練は二段階プロセスを使い、単眼と LiDAR ストリームを別々に訓練し、次に両ストリームを用いて BEVFusion をファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1LiDAR 入力を用いずにカメラクエリを生成できる LiDAR-カメラフュージョンフレームワークを設計して、依然として高い性能を達成できるか。
  • RQ2カメラと LiDAR のストリームを分離することは、従来のフュージョン手法と比較して LiDAR の故障やカメラの故障への頑健性を向上させるか。
  • RQ3BEVFusion は異なる LiDAR バックボーンや検出ヘッドに対してどれくらい generalize するか。
  • RQ4提案された動的フュージョンモジュールがモダリティ間の検出精度に与える影響はどうか。

主な発見

  • BEVFusion はカメラストリームと融合した場合、PointPillars が mAP が 18.4% 向上、CenterPoint がベースラインに応じて 3.0%〜7.1% の mAP 向上など、いくつかの LiDAR ベース検出器を改善する。
  • nuScenes テストで、LiDAR バックボーンとして TransFusion-L を用いた BEVFusion は 69.2% mAP を達成し、TransFusion の 68.9% を上回り、テスト時 augmentation なしの最先端を達成。
  • LiDAR の頑健性実験(視野角の制限やオブジェクト LiDAR 点の削減)で、BEVFusion は LiDAR のみのベースラインおよび素の LC フュージョンを一貫して上回り、設定によっては 25+ mAP 以上の向上を示す。
  • カメラの頑健性シナリオでは、カメラのみや他のフュージョンベースよりも競争力があり、カメラが欠如または劣化している場合にも優れていることが多い。
  • アブレーション研究は、カメラストリームがより大きな 2D バックボーン(Dual-Swin-Tiny)の恩恵を受け、動的フュージョンモジュール(CSF + AFS)が静的フュージョンよりも性能を大幅に向上させることを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。