Skip to main content
QUICK REVIEW

[논문 리뷰] CoBEVFusion: Cooperative Perception with LiDAR-Camera Bird's-Eye View Fusion

Donghao Qiao, Farhana Zulkernine|arXiv (Cornell University)|2023. 10. 09.
Advanced Neural Network ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 이중 윈도우 기반 교차 어텐션(DWCA) 모듈을 사용하여 라이다와 카메라 데이터를 통합된 베이비스아이뷰(BEV) 표현으로 융합하는 협업 인식 프레임워크인 CoBEVFusion을 제안한다. 이 방법은 연결된 자율주행차(CAVs)가 융합된 BEV 특징을 공유함으로써 3D 객체 탐지 및 BEV 세분화 성능을 향상시키며, OPV2V 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하여 차량 탐지 시 92.5% AP@.7, 도메인 적응 시 86.5%를 기록한다.

ABSTRACT

Autonomous Vehicles (AVs) use multiple sensors to gather information about their surroundings. By sharing sensor data between Connected Autonomous Vehicles (CAVs), the safety and reliability of these vehicles can be improved through a concept known as cooperative perception. However, recent approaches in cooperative perception only share single sensor information such as cameras or LiDAR. In this research, we explore the fusion of multiple sensor data sources and present a framework, called CoBEVFusion, that fuses LiDAR and camera data to create a Bird's-Eye View (BEV) representation. The CAVs process the multi-modal data locally and utilize a Dual Window-based Cross-Attention (DWCA) module to fuse the LiDAR and camera features into a unified BEV representation. The fused BEV feature maps are shared among the CAVs, and a 3D Convolutional Neural Network is applied to aggregate the features from the CAVs. Our CoBEVFusion framework was evaluated on the cooperative perception dataset OPV2V for two perception tasks: BEV semantic segmentation and 3D object detection. The results show that our DWCA LiDAR-camera fusion model outperforms perception models with single-modal data and state-of-the-art BEV fusion models. Our overall cooperative perception architecture, CoBEVFusion, also achieves comparable performance with other cooperative perception models.

연구 동기 및 목표

  • 단일 센서 인식의 한계, 예를 들어 가림 현상과 제한된 시야를 해결하기 위해 다중 모odal 센서 융합을 활용한다.
  • 원시 데이터나 예측 결과가 아닌 융합된 라이다-카메라 BEV 표현을 공유함으로써 연결된 자율주행차(CAVs)의 협업 인식을 향상시킨다.
  • 희박한 라이다 포인트 클라우드와 밀도 높은 카메라 특징을 통합된 BEV 공간에서 정렬하고 융합할 수 있는 효과적인 교차 어텐션 기반 메커니즘을 개발한다.
  • 협업 센싱 조건 하에서 BEV 세분화 및 3D 객체 탐지와 같은 다중 작업에 대해 강건하고 고정밀도의 인식 성능을 달성한다.
  • 대규모 시뮬레이션 벤치마크(OPV2V)에서 제안된 프레임워크를 평가하고, 단일 모odal 및 최신 기술 수준의 다중 모달 융합 모델 대비 뛰어난 성능을 입증한다.

제안 방법

  • 이중 윈도우 기반 교차 어텐션(DWCA) 모듈은 입력 순서를 뒤바꿔 적용하는 두 개의 교차 어텐션 블록을 사용한다: 하나는 라이다 특징을 쿼리로, 카메라 특징을 키로 사용하고, 반대로 다른 하나는 카메라 특징을 쿼리로, 라이다 특징을 키로 사용한다.
  • 라이다 포인트 클라우드와 다중 시야 카메라 이미지는 먼저 공통된 베이비스아이뷰(BEV) 특징 공간으로 인코딩되고 투영되어 기하학적 및 의미적 정렬을 달성한다.
  • DWCA 모듈은 양 방향의 특징 향상 기능을 제공함으로써 두 모odal이 상호 대응하는 표현에 주목함으로써 특징 품질과 맥락 이해도를 향상시킨다.
  • 다양한 CAVs로부터의 융합된 BEV 표현은 3D 컨볼루션 신경망(3D-CNN)을 사용해 집계되어 인식의 강건성과 커버리지가 향상된다.
  • 시스템은 중간 수준 융합을 적용하여 V2X 통신을 통해 CAV 간에 융합된 BEV 특징만을 공유함으로써 대역폭 효율성과 맥락 정보 유지 간의 균형을 이루고자 한다.
  • 전체 파ip라인은 두 가지 인식 작업인 BEV 세분화 및 3D 객체 탐지에 최적화된 엔드 투 엔드 트레이닝 가능하다.

실험 결과

연구 질문

  • RQ1이중 어텐션 기반 메커니즘이 통합된 BEV 표현에서 희박한 라이다 포인트 클라우드와 밀도 높은 카메라 이미지를 효과적으로 융합하여 인식 성능을 향상시킬 수 있는가?
  • RQ2공유된 융합된 BEV 특징을 활용한 협업 인식은 단일 차량 인식 및 다른 융합 전략 대비 탐지 정확도와 강건성 측면에서 어떻게 비교되는가?
  • RQ3DWCA 모듈은 기존의 어텐션 기반 융합 방법에 비해 다중 모달 BEV 인식에서 얼마나 뛰어난 성능을 보이는가?
  • RQ4BEV 공간에서 라이다와 카메라 데이터를 협업적으로 융합하면 먼 곳에 있거나 가려진 차량의 탐지 성능이 크게 향상되는가?
  • RQ5제안된 프레임워크는 새로운 환경으로의 도메인 적응과 같은 실제 세계 일반화 벤치마크에서 어떻게 성능을 발휘하는가?

주요 결과

  • DWCA 모듈은 차량 탐지에 대해 3D 객체 탐지에서 64.7% AP@.7 성능을 기록하여 단일 모달 PointPillars 기준선(60.2%)을 크게 초월했다.
  • OPV2V 기본 CARLA 타운 테스트 세트에서 CoBEVFusion은 차량 탐지에 대해 92.5% AP@.7 성능을 기록하여 비교 모델 전부를 압도했으며, SOTA 모델인 S-AdaFusion(91.6%)보다 뛰어났다.
  • 쿠버 시티 도메인 적응 벤치마크에서 CoBEVFusion은 86.5% AP@.7 성능을 기록하여 이어지는 최고 성능 모델인 C-AdaFusion(81.4%)을 능가했다.
  • 제거 분석 결과, DWCA는 WCA(LC)와 WCA(CL) 블록을 모두 포함함으로써 도로 이용 가능 영역에 대해 최고의 mIoU(61.4)와 차선 세분화에 대해 47.6의 성능을 기록하여 단일 모달 기준선을 능가했다.
  • 정성적 결과는 협업 인식이 특히 교차로 앞에서 먼 곳에 있거나 가려진 차량의 탐지 성능을 크게 향상시켰음을 보여주었다.
  • 프레임워크는 초기 또는 후기 융합 대비 중간 융합 방식이 대역폭 효율성과 맥락 정보 유지 사이에 유리한 균형을 이룬다는 것을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.