[논문 리뷰] Multi-View Fusion of Sensor Data for Improved Perception and Prediction in Autonomous Driving
이 논문은 자율주행에서 객체 검출 및 궤적 예측 성능을 햖थ기 위해 LiDAR 및 카메라 데이터의 Bird's-Eye View (BEV) 및 Range-View (RV) 표현을 융합하는 다중 시각 융합 프레임워크를 제안한다. 원시 LiDAR RV 특징을 LiDAR 매칭을 통해 BEV 특징과 융합하고, BEV 투영 이전에 RV 공간에서 카메라 데이터를 효율적으로 통합함으로써, 최소한의 계산 오버헤드로 nuScenes 및 기업 내부 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.
We present an end-to-end method for object detection and trajectory prediction utilizing multi-view representations of LiDAR returns and camera images. In this work, we recognize the strengths and weaknesses of different view representations, and we propose an efficient and generic fusing method that aggregates benefits from all views. Our model builds on a state-of-the-art Bird's-Eye View (BEV) network that fuses voxelized features from a sequence of historical LiDAR data as well as rasterized high-definition map to perform detection and prediction tasks. We extend this model with additional LiDAR Range-View (RV) features that use the raw LiDAR information in its native, non-quantized representation. The RV feature map is projected into BEV and fused with the BEV features computed from LiDAR and high-definition map. The fused features are then further processed to output the final detections and trajectories, within a single end-to-end trainable network. In addition, the RV fusion of LiDAR and camera is performed in a straightforward and computationally efficient manner using this framework. The proposed multi-view fusion approach improves the state-of-the-art on proprietary large-scale real-world data collected by a fleet of self-driving vehicles, as well as on the public nuScenes data set with minimal increases on the computational cost.
연구 동기 및 목표
- 자율주행 인식에서 단일 표현 기반 접근법의 한계를 해결하기 위해 BEV 및 RV 특징 표현의 장점을 융합하고자 한다.
- 융합된 다중 시각 센서 데이터를 사용하여 효율적이고 종단 간(end-to-end)의 동시 검출 및 궤적 예측을 가능하게 하고자 한다.
- 검출 및 예측 작업 간 특징 공유를 통해 시스템 지연 시간과 오류 전파를 줄이고자 한다.
- RV 내의 원천 LiDAR 표현을 통해 보행자 및 자전거 기사와 같은 소형·장거리 객체의 검출 성능을 향상시키고자 한다.
- 통합된 다중 시각 프레임워크 내에서 카메라 및 LiDAR 데이터의 계산 효율적인 융합을 가능하게 하고자 한다.
제안 방법
- 이 방법은 LiDAR 데이터를 BEV 및 RV 표현으로 인코딩하여 별도로 처리한 후 공통 BEV 공간에서 융합한다.
- 구형 투영을 사용하여 원시 비정량화된 LiDAR 데이터를 Range-View (RV) 특징 맵으로 투영함으로써 세밀한 세부 정보를 유지한다.
- LiDAR 점 대응을 통해 RV 특징을 BEV 특징과 매칭하여 융합 전 공간 정렬을 수행한다.
- 카메라 RGB 데이터는 BEV 투영 이전에 RV 공간에서 LiDAR와 융합되어 효율적인 다중 센서 학습이 가능해진다.
- 융합된 BEV 특징은 종단 간 검출 및 궤적 예측을 위한 공유 백본 네트워크를 통해 처리된다.
- 아키텍처는 MultiXNet 기반으로 구축되어 BEV 또는 RV 기반의 다른 모델과 호환되어 일반화된 성능 향상을 가능하게 한다.
실험 결과
연구 질문
- RQ1LiDAR 데이터의 BEV 및 RV 표현을 융합하면, 특히 소형 및 장거리 객체에 대해 검출 정확도가 향상되는가?
- RQ2BEV만을 사용하는 융합과 비교해, RV 공간에서 LiDAR 및 카메라 데이터의 다중 시각 융합이 검출 및 예측 성능에 어떤 영향을 미치는가?
- RQ3다중 시각 융합의 계산 비용은 얼마이며, 실시간 배포에 적합한 낮은 지연 시간으로 달성 가능한가?
- RQ4다양한 시각에서 유래한 특징 융합이 자율주행 인식에서 계단식 오류를 줄이고 종단 간 성능을 향상시키는가?
- RQ5ContFuse 및 LaserFlow와 같은 최신 기술 수준 모델과 비교해, 제안된 방법은 정확도 및 추론 속도 측면에서 어떤가?
주요 결과
- LC-MV-Lite 모델은 nuScenes 데이터셋에서 MultiXNet 베이스라인 대비 보행자 검출에 대해 6.5% 향상된 평균 정밀도(mAP)를 기록하였고, 자전거 기사 검출에 대해서는 5.5% 향상되었다.
- LC-MV-Lite 모델은 차량의 3초 후 궤적 예측 오차(DE@3s)를 107cm로 줄여 LaserFlow(143cm) 및 ContFuse를 능가하였다.
- MultiXNet 대비 LC-MV-Lite에서 다중 시각 LiDAR 융합은 오직 5ms의 추가 지연만을 유발하며, 카메라 융합은 단 1ms의 추가 지연만을 유발한다. 반면 ContFuse는 31ms의 추가 지연을 유발한다.
- 이 방법은 장거리에서 더 큰 성능 향상을 보였으며, MultiXNet 대비 LC-MV-ResNet에서 장거리 차량 검출에 대해 mAP가 5.3% 향상되었다.
- 정성적 결과에서는, 특히 카메라에선 보이지만 BEV 전용 모델에서는 감지되지 않았던 장거리에서의 누락된 운전자들을 모델이 성공적으로 탐지함을 확인하였다.
- 강력한 검출 성능에도 불구하고, LC-MV-ResNet 모델은 드문 자전거 기사 클래스에 대해 예측 성능이 저하되었으며, 이는 표본 수가 적기 때문일 것이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.