Skip to main content
QUICK REVIEW

[논문 리뷰] OCM3D: Object-Centric Monocular 3D Object Detection

Liang Peng, Fei Liu|arXiv (Cornell University)|2021. 04. 13.
Advanced Neural Network Applications참고 문헌 41인용 수 11
한 줄 요약

OCM3D는 개체 중심의 바이트 표현을 제안하며, 각 개체 제안에 대해 단일 레이저 깊이 맵과 RGB 이미지를 적응적으로 3D 바이트로 인코딩함으로써 정밀도를 향상시킨다. 이는 국소적 개체 패치를 활용해 자세 추정을 개선하고, 분해된 3D 신뢰도 메커니즘을 도입함으로써 성능을 향상시킨다. KITTI에서 최신 기술 수준의 성능을 달성하며, 보행자 검출에서 레이저 기반 결과에 가까워진다.

ABSTRACT

Image-only and pseudo-LiDAR representations are commonly used for monocular 3D object detection. However, methods based on them have shortcomings of either not well capturing the spatial relationships in neighbored image pixels or being hard to handle the noisy nature of the monocular pseudo-LiDAR point cloud. To overcome these issues, in this paper we propose a novel object-centric voxel representation tailored for monocular 3D object detection. Specifically, voxels are built on each object proposal, and their sizes are adaptively determined by the 3D spatial distribution of the points, allowing the noisy point cloud to be organized effectively within a voxel grid. This representation is proved to be able to locate the object in 3D space accurately. Furthermore, prior works would like to estimate the orientation via deep features extracted from an entire image or a noisy point cloud. By contrast, we argue that the local RoI information from the object image patch alone with a proper resizing scheme is a better input as it provides complete semantic clues meanwhile excludes irrelevant interferences. Besides, we decompose the confidence mechanism in monocular 3D object detection by considering the relationship between 3D objects and the associated 2D boxes. Evaluated on KITTI, our method outperforms state-of-the-art methods by a large margin. The code will be made publicly available soon.

연구 동기 및 목표

  • 이미지 중심 또는 가짜 레이저 기반 표현에 의존하는 기존 단일 레이저 3D 검출 방법의 한계를 해결하기 위해, 노이즈가 많은 깊이 데이터와 열악한 공간 모델링 문제를 해결하고자 한다.
  • 전체 이미지 또는 노이즈가 많은 포인트 클라우드가 아닌, 오직 개체 이미지 패치만을 사용하여 자세 추정을 향상시켜 관련하지 않은 배경의 간섭을 줄이고자 한다.
  • 3D 검출 신뢰도를 2D 검출 신뢰도와 2D에서 3D로의 러핑 난이도로 분리하여, 3D 애너테이션 없이도 더 나은 신뢰도 校정을 가능하게 하고자 한다.
  • KITTI 벤치마크에서 깊이 추정 학습 및 검증 세트 간에 중복이 발생하는 심각한 데이터 泄露 문제를 해결하기 위해, 기존의 중복되지 않는 새로운 데이터셋 분할을 제안하고자 한다.

제안 방법

  • 이 방법은 깊이 추정 포인트 클라우드를 사용하여 각 2D 개체 제안에 대해 적응형 바이트를 구축하며, 바이트 크기는 포인트의 3D 공간 분포에 따라 결정되어, 고밀도 개체 영역은 강화하고 희박한 이상치는 억제한다.
  • 자세 추정에 대해 오직 잘라낸 개체 이미지 패치—적절한 스케일링 기법을 사용해 리사이징한 것—만을 입력으로 사용하여 국소적 의미 정보에 집중하고 배경 간섭을 제거한다.
  • 새로운 분해된 3D 신뢰도 메커니즘은 2D 검출 신뢰도와 2D 및 3D 경계 상자 투영 간의 IoU 유사도 오버랩을 조합하여, 2D에서 3D로의 러핑 난이도를 측정한다.
  • 개체 중심 바이트 표현은 RGB와 깊이 정보를 효과적으로 인코딩하면서도, 단일 레이저 가짜 레이저 포인트 클라우드의 장기적, 노이즈가 많은 특성에 강건하도록 설계되었다.
  • 이 프레임워크는 즉시 적용 가능한 방식이다: 신뢰도 및 자세 모듈은 재학습 없이도 어떤 2D 검출기 기반 단일 레이저 3D 검출기에도 통합될 수 있다.
  • 기존 벤치마크에서 발생하는 데이터 泄露 문제를 해결하기 위해, 기존의 중복되지 않는 새로운 KITTI 데이터셋 분할을 제안한다.

실험 결과

연구 질문

  • RQ13D 포인트 분포에 따라 바이트 크기를 적응적으로 조절하는 개체 중심 바이트 표현은 가짜 레이저 또는 이미지 중심 방법에 비해 단일 레이저 3D 검출 성능을 향상시킬 수 있는가?
  • RQ2단일 레이저 3D 검출에서 자세 추정에 있어 전체 이미지나 노이즈가 많은 포인트 클라우드보다 오직 개체 이미지 패치만을 사용하는 것이 더 나은가?
  • RQ32D 신뢰도와 2D-3D 경계 상자 정렬을 조합한 분해된 3D 신뢰도 메커니즘은 3D 애너테이션 없이도 검출 신뢰도 보정을 향상시킬 수 있는가?
  • RQ4KITTI에서 널리 사용되는 Eigen 분할은 깊이 추정에서 데이터 泄露를 유발하는가? 그리고 이는 단일 레이저 3D 검출기의 보고된 성능에 어떤 영향을 미치는가?

주요 결과

  • OCM3D는 중간 설정에서 차량 카테고리에 대해 96.48% AP (IoU=0.7)를 달성하여, 동일한 분할에서 가짜 레이저(92.85%)와 M3D-RPN(89.37%)를 크게 앞서며 성능을 뛰어나게 했다.
  • 보행자 카테고리에서는 3D AP 70.36% (IoU=0.7)를 기록하여 원래의 가짜 레이저(27.29%)를 초월하였고, 레이저 기반 방법(72.05%)에 매우 가까운 성능을 달성하였다.
  • 기존 방법 대비 자세 헤드를 제안된 개체 패치 입력으로 교체함으로써, 차량 기준 3.3% 향상, 보행자 기준 10.5% 향상된 AOS 성능을 기록하여 그 효과를 입증하였다.
  • 분해된 3D 신뢰도 메커니즘은 가짜 레이저의 중간 AP 3D 성능을 39.87% 상승시켜, 다양한 검출기 간의 강력한 일반화 능력을 입증하였다.
  • 새로운 데이터셋 분할은 데이터 泄露 문제를 완전히 제거하였으며, 이는 이전 성능 보고가 학습 및 검증 세트의 중복으로 과대평가되었음을 드러내었다.
  • 이 방법은 매우 확장 가능하다: 가짜 레이저와 PatchNet에 적용했을 때도 뚜렷한 성능 향상을 보이며, 즉시 적용 가능한 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.