Skip to main content
QUICK REVIEW

[논문 리뷰] MSMDFusion: Fusing LiDAR and Camera at Multiple Scales with Multi-Depth Seeds for 3D Object Detection

Yang Jiao, Zequn Jie|arXiv (Cornell University)|2022. 09. 07.
Advanced Neural Network Applications인용 수 5
한 줄 요약

MSMDFusion는 다중 해상도 3D 객체 검출 프레임워크를 제안하며, 다중 깊이 역투영(MDU)을 사용해 LiDAR와 카메라 데이터를 융합하여 깊이 인식 의미론을 가진 고품질의 가상 포인트를 생성하고, 가중치 조절 가능한 모odal 인식 컨볼루션(GMA-Conv)을 통해 세밀하고 제어 가능한 다중 모odal 특징 융합을 실현한다. 이는 테스트 시 시간 보정 또는 앙상블 없이 nuScenes에서 71.5% mAP 및 74.0% NDS의 최신 기술 수준 성능을 달성한다.

ABSTRACT

Fusing LiDAR and camera information is essential for achieving accurate and reliable 3D object detection in autonomous driving systems. This is challenging due to the difficulty of combining multi-granularity geometric and semantic features from two drastically different modalities. Recent approaches aim at exploring the semantic densities of camera features through lifting points in 2D camera images (referred to as seeds) into 3D space, and then incorporate 2D semantics via cross-modal interaction or fusion techniques. However, depth information is under-investigated in these approaches when lifting points into 3D space, thus 2D semantics can not be reliably fused with 3D points. Moreover, their multi-modal fusion strategy, which is implemented as concatenation or attention, either can not effectively fuse 2D and 3D information or is unable to perform fine-grained interactions in the voxel space. To this end, we propose a novel framework with better utilization of the depth information and fine-grained cross-modal interaction between LiDAR and camera, which consists of two important components. First, a Multi-Depth Unprojection (MDU) method with depth-aware designs is used to enhance the depth quality of the lifted points at each interaction level. Second, a Gated Modality-Aware Convolution (GMA-Conv) block is applied to modulate voxels involved with the camera modality in a fine-grained manner and then aggregate multi-modal features into a unified space. Together they provide the detection head with more comprehensive features from LiDAR and camera. On the nuScenes test benchmark, our proposed method, abbreviated as MSMDFusion, achieves state-of-the-art 3D object detection results with 71.5% mAP and 74.0% NDS, and strong tracking results with 74.0% AMOTA without using test-time-augmentation and ensemble techniques. The code is available at https://github.com/SxJyJay/MSMDFusion.

연구 동기 및 목표

  • 기존의 LiDAR-카메라 융합 방법에서 깊이 정보가 충분히 활용되지 않는 문제를 해결한다.
  • 각 2D 카메라 시드에 대해 다수의 깊이 추정치를 활용하여, 3D 공간에서 더 정확하고 깊이 인식 의미론을 가진 가상 포인트의 기하학적 정확도와 의미적 풍부함을 향상시킨다.
  • 바이트스페이스 내에서 LiDAR 포인트와 카메라 기반 가상 포인트 간의 세밀하고 제어 가능한 다중 모달 상호작용을 가능하게 한다.
  • 다양한 해상도 수준에서의 특징 집합 및 효과적인 융합을 통해 뛰어난 검출 성능을 달성한다.
  • 단순한 연결 또는 주목력 기반 융합의 한계를 극복하기 위해 바이트스페이스 내에서 조절 가능한 가중치 조절 기반 융합 메커니즘을 도입한다.

제안 방법

  • 각 2D 시드 주변의 국소 영역에서 다수의 깊이 값을 추출하여 더 정확하고 깊이 인식 의미론을 가진 3D 공간의 가상 포인트를 생성하는 다중 깊이 역투영(MDU) 기법을 제안한다.
  • 카메라 특징과 다수의 깊이 추정치를 융합하여 깊이 인식 특징을 통합함으로써 가상 포인트의 의미 일관성과 강건성을 향상시킨다.
  • 실제 LiDAR 포인트의 맥락에 기반해 카메라 모달리티의 특징을 적응적으로 조절하는 학습 가능한 모듈인 가중치 조절 모달 인식 컨볼루션(GMA-Conv)을 설계하여, 바이트스페이스 내에서 세밀하고 주목력 유사한 융합을 실현한다.
  • MDU 및 GMA-Conv 모듈을 다양한 특징 스케일에 걸쳐 적용하여, 다중 모달 특징의 점진적 정련 및 다중 해상도 융합을 가능하게 한다.
  • 다양한 수준의 표현을 통합하기 위한 다중 스케일 특징 집합 전략을 사용하여 특징의 완전성 향상과 검출 강건성 향상을 도모한다.
  • 표준 3D 검출 손실을 사용해 엔드 투 엔드 프레임워크를 훈련하며, 테스트 시 시간 보정 또는 앙상블 기법에 의존하지 않는다.

실험 결과

연구 질문

  • RQ1각 2D 시드에 대해 다수의 깊이 추정치를 활용할 경우, 3D 공간 내 가상 포인트의 기하학적 정확도와 의미 품질이 크게 향상되는가?
  • RQ2바이트스페이스 내에서 세밀하고 가중치 조절 가능한 융합 메커니즘이 단순한 연결 또는 주목력 기반 융합을 능가하는가?
  • RQ3다양한 해상도 수준의 특징 정밀도 간의 다중 스케일 상호작용은 최종 검출 성능에 어떤 영향을 미치는가?
  • RQ4검출 정확도와 노이즈 제어 측면에서, 시드 당 깊이 수와 인스턴스 당 시드 수 사이의 최적의 트레이드오프는 무엇인가?
  • RQ5깊이 인식 및 다중 스케일 융합 프레임워크는 테스트 시 시간 보정 또는 모델 앙상블 없이도 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • MSMDFusion는 테스트 세트에서 nuScenes에서 71.5% mAP 및 74.0% NDS를 달성하여, 테스트 시 시간 보정 또는 앙상블 기법 없이도 새로운 최신 기술 수준의 성능을 확립한다.
  • 제거 분석 결과, 시드 당 깊이 수(K)를 1에서 6으로 증가시킬 경우 mAP는 1.07% 향상되고 NDS는 0.70% 향상되며, K=6에서 최적 성능을 기록한다.
  • K가 10으로 증가할 경우 노이즈 증가로 인해 성능 저하가 발생함을 확인하여, 너무 많은 깊이 추정치는 가상 포인트 품질을 악화시킴을 시사한다.
  • 인스턴스 당 시드 수(N)를 50에서 200으로 늘여도 성능 향상이 없으며, 특히 단일 깊이 역투영과 조합 시 성능 저하가 발생함을 확인하였다.
  • 다중 스케일 상호작용 모델은 단일 스케일 기반 베이스라인 대비 약 2% mAP 및 약 1% NDS 향상되어, 다중 해상도 특징 융합의 유용성을 입증한다.
  • MDU 모듈은 K=6일 때 실제 3D 포인트의 리콜률이 85.6%이며 평균 거리 오차가 0.18m로, 신뢰할 수 있는 가상 포인트 생성 능력을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.