Skip to main content
QUICK REVIEW

[논문 리뷰] BEVFusion: A Simple and Robust LiDAR-Camera Fusion Framework

Tingting Liang, Hongwei Xie|arXiv (Cornell University)|2022. 05. 27.
Advanced Neural Network Applications인용 수 201
한 줄 요약

BEVFusion은 카메라 스트림과 LiDAR 스트림을 공유 BEV 공간으로 분리하고 동적 모듈로 융합하여 LiDAR 또는 카메라 오작동에 대한 강건성을 향상시키고 포스트 프로세싱 없이 nuScenes에서 최첨단 결과를 달성합니다.

ABSTRACT

Fusing the camera and LiDAR information has become a de-facto standard for 3D object detection tasks. Current methods rely on point clouds from the LiDAR sensor as queries to leverage the feature from the image space. However, people discovered that this underlying assumption makes the current fusion framework infeasible to produce any prediction when there is a LiDAR malfunction, regardless of minor or major. This fundamentally limits the deployment capability to realistic autonomous driving scenarios. In contrast, we propose a surprisingly simple yet novel fusion framework, dubbed BEVFusion, whose camera stream does not depend on the input of LiDAR data, thus addressing the downside of previous methods. We empirically show that our framework surpasses the state-of-the-art methods under the normal training settings. Under the robustness training settings that simulate various LiDAR malfunctions, our framework significantly surpasses the state-of-the-art methods by 15.7% to 28.9% mAP. To the best of our knowledge, we are the first to handle realistic LiDAR malfunction and can be deployed to realistic scenarios without any post-processing procedure. The code is available at https://github.com/ADLab-AutoDrive/BEVFusion.

연구 동기 및 목표

  • LiDAR 입력을 이미지를 쿼리하는 데 의존하는 기존 LiDAR-카메라 융합 방법의 한계를 규명한다.
  • 서로 독립적인 공통 BEV 표현으로 카메라와 LiDAR 데이터를 인코딩하는 두 스트림 프레임워크를 제안한다.
  • 두 모달리티의 BEV 특징을 결합하는 간단하고 효과적인 융합 모듈을 개발한다.
  • 전용 증강 및 평가를 통해 현실적인 LiDAR 오작동과 카메라 고장에 대한 강건성을 입증한다.

제안 방법

  • 두 개의 독립 스트림이 입력을 동일한 BEV 공간으로 인코딩한다: 카메라 스트림은 Lift-Splat-Shoot 적응을 기반으로 Dual-Swin-Tiny 백본과 BEV 인코더를 사용하고, LiDAR 스트림은 PointPillars, CenterPoint, 또는 TransFusion을 백본으로 사용한다.
  • 동적 융합 모듈이 BEV 특징을 연결하고 채널-공간 융합을 적용한 후 적응형 특징 선택으로 F_fused를 생성한다.
  • 융합된 BEV 특징은 예측을 위해 표준 3D 탐지 헤드(앵커 기반, 앵커 프리, 또는 트랜스포머 기반)로 보내진다.
  • 카메라 BEV 특징은 깊이를 예측하고 이미지 특징을 보셀 격자에 렌더링하는 뷰 프로젝터를 통해 생성된 뒤, Spatial-to-Channel 접근법을 사용하는 BEV 인코더로 압축된다.
  • LiDAR BEV 특징은 기존의 LiDAR 백본으로 생성되어 카메라 분기에 의존하지 않고 BEV로 변환된다.
  • 학습은 두 단계로 진행된다: 단안 및 LiDAR 스트림을 각각 학습시키고, 그 다음 두 스트림을 사용하여 BEVFusion를 미세 조정한다.

실험 결과

연구 질문

  • RQ1LiDAR 입력에 의존하지 않고 카메라 쿼리를 생성하는 LiDAR-카메라 융합 프레임워크를 설계하여도 강력한 성능을 달성할 수 있는가?
  • RQ2카메라와 LiDAR 스트림의 분리가 전통적인 융합 방법과 비교하여 LiDAR 오작동과 카메라 고장에 대한 강건성을 향상시키는가?
  • RQ3BEVFusion은 다양한 LiDAR 백본과 탐지 헤드에 걸쳐 얼마나 잘 일반화되는가?
  • RQ4제안된 동적 융합 모듈이 모달리티 간 탐지 정확도에 미치는 영향은 무엇인가?

주요 결과

  • BEVFusion은 카메라 스트림과 융합될 때 여러 LiDAR 기반 탐지기에서 성능을 향상시키며, 예를 들어 PointPillars는 18.4% mAP를, CenterPoint는 기준에 따라 3.0%–7.1% mAP를 얻는다.
  • nuScenes 테스트에서 LiDAR 백본으로 TransFusion-L을 쓸 때 BEVFusion은 69.2% mAP를 달성하여 TransFusion의 68.9%를 넘어섰고 테스트 시점 보강 없이도 최첨단을 달성했다.
  • LiDAR 강건성 실험(제한된 FOV 및 물체 LiDAR-포인트 드랍)에서 BEVFusion은 LiDAR-전용 기준선과 일반 LC 융합을 지속적으로 능가하며 일부 설정에서 25+ mAP 이상의 이점을 보인다.
  • 카메라 강건성 시나리오에서 카메라만 사용하거나 기타 융합 기준선에 비해 BEVFusion은 카메라가 없거나 저하되었을 때도 경쟁력 있고 종종 우수하다.
  • 아블레이션 연구는 카메라 스트림이 더 큰 2D 백본(Dual-Swin-Tiny)으로부터 이점을 얻고, 동적 융합 모듈(CSF + AFS)이 정적 융합에 비해 성능을 크게 향상시킨다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.