Skip to main content
QUICK REVIEW

[논문 리뷰] LIGA-Stereo: Learning LiDAR Geometry Aware Representations for Stereo-based 3D Detector

Xiaoyang Guo, Shaoshuai Shi|arXiv (Cornell University)|2021. 08. 18.
Advanced Neural Network Applications참고 문헌 9인용 수 7
한 줄 요약

LIGA-Stereo는 LiDAR 기반 교사 모델에서 유도된 기하학적 인식 특징을 활용하여 스테레오 기반 3D 객체 검출 성능을 향상시키는 새로운 스테레오 기반 3D 객체 검출 프레임워크를 제안한다. 고수준 3D 기하학적 표현을 흡수하고 직접적인 2D 검출 헤드를 통해 의미적 감독을 제공함으로써, KITTI 벤치마크에서 자동차, 보행자, 자전거 기사에 대해 각각 10.44%, 5.69%, 5.97%의 SOTA mAP 향상을 달성한다.

ABSTRACT

Stereo-based 3D detection aims at detecting 3D object bounding boxes from stereo images using intermediate depth maps or implicit 3D geometry representations, which provides a low-cost solution for 3D perception. However, its performance is still inferior compared with LiDAR-based detection algorithms. To detect and localize accurate 3D bounding boxes, LiDAR-based models can encode accurate object boundaries and surface normal directions from LiDAR point clouds. However, the detection results of stereo-based detectors are easily affected by the erroneous depth features due to the limitation of stereo matching. To solve the problem, we propose LIGA-Stereo (LiDAR Geometry Aware Stereo Detector) to learn stereo-based 3D detectors under the guidance of high-level geometry-aware representations of LiDAR-based detection models. In addition, we found existing voxel-based stereo detectors failed to learn semantic features effectively from indirect 3D supervisions. We attach an auxiliary 2D detection head to provide direct 2D semantic supervisions. Experiment results show that the above two strategies improved the geometric and semantic representation capabilities. Compared with the state-of-the-art stereo detector, our method has improved the 3D detection performance of cars, pedestrians, cyclists by 10.44%, 5.69%, 5.97% mAP respectively on the official KITTI benchmark. The gap between stereo-based and LiDAR-based 3D detectors is further narrowed.

연구 동기 및 목표

  • 스테레오 기반 및 LiDAR 기반 3D 검출기 간의 성능 격차를 해소하기 위해 스테레오 네트워크 내 기하학적 및 의미적 특징 학습을 향상시키는 것.
  • 깊이 추정 오차로 인해 의미적 특징 학습이 열악해지는 문제를 해결하기 위해 간접적인 3D 감독의 한계를 극복하는 것.
  • 사전 훈련된 LiDAR 기반 검출기에서 유도된 고수준 기하학적 인식 특징을 활용하여 특징 표현을 향상시키는 것.
  • 스테레오 검출기 훈련 중 LiDAR 특징을 정규화 요소로 사용하여 과적합을 줄이고 일반화 성능을 향상시키는 것.
  • 보조 검출 헤드를 통한 직접적인 2D 의미 감독을 통해 특히 희귀 카테고리인 자전거 기사의 검출 재현율을 향상시키는 것.

제안 방법

  • 스테레오 검출기의 중간 단계 3D 및 베이드의이뷰(BEV) 특징을 LiDAR 기반 교사 모델의 특징과 정렬하는 지식 흡수 전략을 도입하며, 기하학적 인식 표현에 중점을 둔다.
  • 표면 법선 방향 및 객체 경계 신호와 같은 고수준 특징을 전달하기 위해 다단계 특징 모방 손실을 사용한다.
  • 2D 의미 특징 스트림에 보조 2D 검출 헤드를 부착하여 3D 감독의 오류에 민감한 문제를 피하고 의미 학습을 직접적으로 지원한다.
  • 배경 특징의 악영향을 방지하기 위해 관련 영역에 집중하기 위해 전경 마스크 기반 특징 모방을 적용한다.
  • 기하학적 안내와 검출 성능 간 균형을 맞추기 위해 모방 손실 가중치(λim)를 최적화하며, λim = 1.0이 최적임을 발견하였다.
  • 특히 자원이 적은 카테고리에서 의미 특징 품질을 향상시키기 위해 2D 백본에 ImageNet 사전 훈련 가중치를 활용한다.
Figure 1: Our method utilizes superior geometry-aware features from LiDAR-based 3D detection models to guide the training of stereo-based 3D detectors.
Figure 1: Our method utilizes superior geometry-aware features from LiDAR-based 3D detection models to guide the training of stereo-based 3D detectors.

실험 결과

연구 질문

  • RQ1LiDAR 기반 검출기에서 유도된 고수준 기하학적 인식 특징이 스테레오 기반 3D 검출기의 기하학적 표현 학습에 기여하는가?
  • RQ2보조 검출 헤드를 통한 직접적인 2D 의미 감독이 간접적인 3D 감독보다 스테레오 검출기의 의미 특징 학습을 더 잘 향상시키는가?
  • RQ3LiDAR 특징의 흡수로 인해 스테레오 기반 및 LiDAR 기반 3D 검출 간 성능 격차는 어느 정도 감소하는가?
  • RQ4전경 마스크 기반 특징 모방은 스테레오 검출기 훈련의 정확도와 내성에 어떤 영향을 미치는가?
  • RQ5기하학적 흡수와 직접적인 2D 감독의 조합이 자전거 기사와 같은 희귀 카테고리의 검출 성능을 크게 향상시키는가?

주요 결과

  • 제안된 LIGA-Stereo 방법은 KITTI 3D 검출 벤치마크에서 기존 SOTA 스테레오 검출기 대비 자동차 클래스에서 10.44% mAP 향상을 기록하였고, 보행자와 자전거 기사에 대해서는 각각 5.69%, 5.97% 향상되었다.
  • 전경 마스크를 사용한 3D 볼륨 및 집계된 BEV 특징의 특징 모방(λim = 1.0)이 최고의 성능을 보였으며, 자동차, 보행자, 자전거 기사 클래스에서 각각 mAP를 2.9%, 5.2%, 6.9% 향상시켰다.
  • 전경 마스크 제거(w/o Mfg) 시 성능 향상이 거의 없음을 확인하여, 객체 영역에 집중하는 것이 효과적인 흡수를 위해 필수적임을 입증하였다.
  • 최적의 모방 손실 가중치 λim = 1.0은 기하학적 안내와 검출 정확도 간 균형을 잘 맞추며, 이보다 높거나 낮은 값은 성능 저하를 초래함을 확인하였다.
  • 직접적인 2D 검출 헤드 추가로 자전거 기사의 3D AP가 26.77%에서 30.26%로 상승하여 자원이 적은 카테고리에서 뚜렷한 성능 향상을 보였다.
  • ImageNet 사전 훈련 가중치를 사용할 경우, 2D 검출 헤드는 자동차, 보행자, 자전거 기사에서 각각 92%, 54%, 41% AP를 기록하여 사전 훈련이 의미 특징 학습에 가치가 있음을 확인하였다.
Figure 2: The framework of our stereo-based 3D detection algorithm. (a) The stereo matching network which takes a stereo image pair as inputs and outputs a feature volume in 3D space. (b) and (d) share the same structure, which detects 3D objects from dense / sparse 3D feature volumes, respectively.
Figure 2: The framework of our stereo-based 3D detection algorithm. (a) The stereo matching network which takes a stereo image pair as inputs and outputs a feature volume in 3D space. (b) and (d) share the same structure, which detects 3D objects from dense / sparse 3D feature volumes, respectively.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.