Skip to main content
QUICK REVIEW

[논문 리뷰] M3DeTR: Multi-representation, Multi-scale, Mutual-relation 3D Object Detection with Transformers

Tianrui Guan, Jun Wang|arXiv (Cornell University)|2021. 04. 24.
Advanced Neural Network Applications인용 수 6
한 줄 요약

M3DETR는 원시 포인트 클라우드, 볼록체, 조감도 등 다양한 표현 방식을 통합하고, 다중 척도 특징 피라미드 및 포인트 클라우드 특징 간 상호 관계를 전용 M3 트랜스포머를 통해 모델링하는 새로운 트랜스포머 기반 3D 객체 검출 프레임워크를 제안한다. 이는 단일 프레임 입력으로 KITTI 및 Waymo Open Dataset에서 최신 기술 수준의 성능을 달성하며, 모든 클래스에서 mAP를 1.48% 향상시켰고, 두 벤치마크에서 모두 1위를 기록한다.

ABSTRACT

We present a novel architecture for 3D object detection, M3DeTR, which combines different point cloud representations (raw, voxels, bird-eye view) with different feature scales based on multi-scale feature pyramids. M3DeTR is the first approach that unifies multiple point cloud representations, feature scales, as well as models mutual relationships between point clouds simultaneously using transformers. We perform extensive ablation experiments that highlight the benefits of fusing representation and scale, and modeling the relationships. Our method achieves state-of-the-art performance on the KITTI 3D object detection dataset and Waymo Open Dataset. Results show that M3DeTR improves the baseline significantly by 1.48% mAP for all classes on Waymo Open Dataset. In particular, our approach ranks 1st on the well-known KITTI 3D Detection Benchmark for both car and cyclist classes, and ranks 1st on Waymo Open Dataset with single frame point cloud input. Our code is available at: https://github.com/rayguan97/M3DETR.

연구 동기 및 목표

  • 기존 3D 객체 검출기가 원시 포인트 클라우드, 볼록체, 조감도 등 다양한 포인트 클라우드 표현 방식과 다중 척도 특징을 효과적으로 융합하지 못하는 한계를 해결하기 위해.
  • 표현 방식 간 아키텍처 및 입력 형식의 차이로 인한 의미적 갭을 해소하기 위해.
  • 포인트 클라우드 내 점들 간의 상호 관계를 동시에 모델링하여 미세한 구조나 복잡한 시나리오 패턴의 검출 성능을 향상시키기 위해.
  • 표현, 척도, 관계 모델링을 통합한 단일, 엔드 투 엔드 학습 가능한 아키텍처를 설계하여 하이퍼파rameter 민감도 없이 구현하기 위해.
  • KITTI 및 Waymo Open Dataset과 같은 표준 벤치마크에서 최신 기술 수준의 검출 정확도를 달성하기 위해.

제안 방법

  • M3DETR는 다중 표현, 다중 척도, 상호관계 트랜스포머의 세 가지 전용 M3 트랜스포머를 활용하며, 각각 포인트 클라우드 데이터의 특정 측면을 처리하도록 설계된다.
  • 다중 표현 트랜스포머는 다중 헤드 자기주의를 사용하여 원시 포인트 클라우드, 볼록 격자, 조감도의 특징을 융합함으로써 의미적 갭을 감소시킨다.
  • 다중 척도 트랜스포머는 특징 피라미드를 통해 다양한 해상도 수준의 특징을 집계하며, 주의 메커니즘을 통해 다중 척도 간 상관관계를 향상시킨다.
  • 상호관계 트랜스포머는 다중 헤드 자기주의를 사용하여 포인트 간 장거리 의존성과 관계를 모델링함으로써 특징의 구분 능력을 향상시킨다.
  • 모든 구성 요소는 두 단계 검출 파이프라인에 통합된다: 영역 제안 네트워크(RPN) 이후 트랜스포머 기반 헤드를 통해 바운딩 박스 예측을 수행한다.
  • 전체 아키텍처는 교차 주의 메커니즘을 통해 표현, 척도, 관계 특징의 공동 최적화를 가능하게 하며, 엔드 투 엔드로 학습된다.

실험 결과

연구 질문

  • RQ1통합된 트랜스포머 기반 아키텍처가 원시 포인트 클라우드, 볼록체, BEV 등 다양한 포인트 클라우드 표현 방식을 효과적으로 융합하면서도 특징 일관성을 유지할 수 있는가?
  • RQ2특징 융합을 위해 주의 메커니즘을 사용하는 것이 연결 또는 업샘플링 대비 3D 객체 검출 성능 향상에 기여하는가?
  • RQ3포인트 간 상호관계를 모델링하면 특히 소형 또는 가림을 입은 객체의 검출 정확도 향상에 기여하는가?
  • RQ4제안된 M3DETR 아키텍처는 트랜스포머의 깊이, 헤드 수, 샘플링 전략 등의 하이퍼파ram터 변화에 대해 강건한가?
  • RQ5표현, 척도, 관계의 통합 모델링이 KITTI 및 Waymo Open Dataset에서 최신 기술 수준의 성능을 달성하는가?

주요 결과

  • M3DETR는 KITTI 3D 검출 벤치마크에서 최신 기술 수준의 성능을 달성하여 자동차 및 자전거 기사 클래스 모두 1위를 기록한다.
  • Waymo Open Dataset에서 M3DETR는 이전 최신 기술 수준 대비 모든 클래스에서 mAP를 1.48% 향상시키며, 자동차 클래스에선 2.86% 향상되었다.
  • 절단 분석 결과, 다중 표현, 다중 척도, 상호관계 모듈을 모두 조합할 경우 자동차 클래스의 중간 난이도에서 mAP가 4.07% 향상되었다.
  • 상호관계 트랜스포머만으로도 중간 난이도에서 mAP가 4.47% 향상되어 그 기여도가 뚜렷하게 드러났다.
  • M3DETR는 트랜스포머 계층 수, 헤드 수, 제안 영역 샘플링 크기의 변화에 대해 매우 강건한 성능 유지를 보이며, 다양한 설정에서도 높은 성능 유지를 유지한다.
  • 시각화 결과 M3DETR는 PV-RCNN 대비 복잡한 시나리오에서 가림이 있는 경우에 특히 거짓 음성(false negatives)을 줄이는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.