Skip to main content
QUICK REVIEW

[논문 리뷰] Confidence Guided Stereo 3D Object Detection with Split Depth Estimation

Chengyao Li, Jason S. Ku|arXiv (Cornell University)|2020. 03. 11.
Advanced Vision and Imaging참고 문헌 36인용 수 12
한 줄 요약

이 논문은 전경 및 배경 픽셀에 대해 별도의 깊이 디코더를 사용하고, 신뢰도 추정치를 디텍터 내 소프트 어텐션 메커니즘으로 활용하는 신뢰도 유도 스테레오 3D 객체 검출 프레임워크인 CG-Stereo를 제안한다. 이 방법은 KITTI 벤치마크에서 기존 스테레오 기반 방법보다 각각 자동차, 보행자, 자전거 기사에 대해 1.4%, 6.7%, 12.7% 향상된 AP(0.7 IoU 기준)를 달성하여 최신 기술 수준의 성능을 확보한다.

ABSTRACT

Accurate and reliable 3D object detection is vital to safe autonomous driving. Despite recent developments, the performance gap between stereo-based methods and LiDAR-based methods is still considerable. Accurate depth estimation is crucial to the performance of stereo-based 3D object detection methods, particularly for those pixels associated with objects in the foreground. Moreover, stereo-based methods suffer from high variance in the depth estimation accuracy, which is often not considered in the object detection pipeline. To tackle these two issues, we propose CG-Stereo, a confidence-guided stereo 3D object detection pipeline that uses separate decoders for foreground and background pixels during depth estimation, and leverages the confidence estimation from the depth estimation network as a soft attention mechanism in the 3D object detector. Our approach outperforms all state-of-the-art stereo-based 3D detectors on the KITTI benchmark.

연구 동기 및 목표

  • 전경 객체의 깊이 추정 정확도 향상을 통해 스테레오 기반과 LiDAR 기반 3D 객체 검출 간 성능 격차를 해소한다.
  • 특히 더 먼 거리와 객체 경계에서 발생하는 깊이 추정 정확도의 높은 변동성을 해결한다.
  • 깊이 예측에서 유추된 불확실성 추정치를 3D 디텍터 내 소프트 어텐션 메커니즘으로 통합하여 검출의 강인성을 향상시킨다.
  • 단지 스테레오 이미지만을 사용하여 KITTI 3D 객체 검출 벤치마크에서 최신 기술 수준의 성능을 입증한다.

제안 방법

  • 스테레오 매칭 네트워크는 전경 픽셀과 배경 픽셀을 위한 별도의 디코더를 사용하며, 이는 세그멘테이션 마스크를 통해 분할된다.
  • 학습 중에 포인트 클라우드 손실이 적용되어 객체의 형태를 유지하고, 특히 먼 거리나 복잡한 객체의 깊이 추정 정확도를 향상시킨다.
  • 깊이 추정 네트워크에서 유도된 신뢰도 맵은 포인트 클라우드에 추가 채널로 추가되어 3D 디텍터 내 소프트 어텐션 메커니즘으로 기능한다.
  • 3D 객체 디텍터는 신뢰도가 강화된 포인트 클라우드를 처리하여 정확도가 높고 고신뢰도의 깊이 포인트에 집중하고, 노이즈가 많거나 모호한 포인트는 억제한다.
  • 전체 파이프라인은 엔드 투 엔드로 학습되며, 깊이 추정 및 3D 검출 브랜치가 함께 최적화된다.
  • 세그멘테이션 마스크를 활용해 깊이 추정 중 전경과 배경을 분리함으로써 객체 특화된 깊이 패턴 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1전경 및 배경 픽셀에 대해 별도의 깊이 추정을 수행할 경우 스테레오 기반 시스템에서 3D 객체 검출 성능이 향상되는가?
  • RQ2깊이 예측에서 유도된 신뢰도 추정치를 소프트 어텐션 메커니즘으로 통합할 경우 3D 디텍터의 강인성과 정확도가 향상되는가?
  • RQ3포인트 클라우드 손실을 적용한 분할된 깊이 추정은 먼 거리나 과제가 되는 객체의 깊이 추정 정확도에 어떤 영향을 미치는가?
  • RQ4고품질의 세그멘테이션 마스크를 사용할 경우 이 방법의 성능 상한선은 어느 정도인가?

주요 결과

  • 제안된 방법은 KITTI 벤치마크에서 자동차에 대해 0.7 IoU 기준 57.58%의 AP를 달성하여 다음으로 우수한 방법보다 1.4% 높은 성능을 기록했다.
  • 보행자에 대해서는 다음으로 최고의 스테레오 기반 방법보다 AP가 6.7% 향상되었다.
  • 자전거 기사에 대해서는 AP가 12.7% 향상되어 소형 및 과제가 되는 객체 클래스에서 뚜렷한 성과를 보였다.
  • 절단 실험 결과, 분할된 깊이 추정만으로도 AP가 1.81% 향상되고 AP_BEV는 1.31% 향상되었다.
  • 포인트 클라우드 손실을 추가하면 AP는 2.27% 향상되고 AP_BEV는 0.29% 향상되었다.
  • 신뢰도를 소프트 어텐션 메커니즘으로 통합하면 AP는 1.02% 향상되고 AP_BEV는 1.73% 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.