Skip to main content
QUICK REVIEW

[논문 리뷰] 3dDepthNet: Point Cloud Guided Depth Completion Network for Sparse Depth and Single Color Image

Rui Xiang, Feng Zheng|arXiv (Cornell University)|2020. 03. 20.
3D Surveying and Cultural Heritage참고 문헌 50인용 수 8
한 줄 요약

3dDepthNet은 LiDAR 완성 네트워크를 통해 3D 포인트 클러스터를 먼저 완성한 후, 밀도 높은 3D 투영도, 희박한 깊이 정보, RGB 입력을 융합하기 위해 수정된 인코더-디코더 아키텍처를 사용하는 새로운 3D에서 2D로의 거친-세밀한 깊이 완성 네트워크를 제안한다. 이는 고정밀도, 부드러운 밀도 높은 깊이 예측을 가능하게 하며, 희박함에 대해 뛰어난 내성성을 보인다. KITTI에서 최고의 성능을 달성한다.

ABSTRACT

In this paper, we propose an end-to-end deep learning network named 3dDepthNet, which produces an accurate dense depth image from a single pair of sparse LiDAR depth and color image for robotics and autonomous driving tasks. Based on the dimensional nature of depth images, our network offers a novel 3D-to-2D coarse-to-fine dual densification design that is both accurate and lightweight. Depth densification is first performed in 3D space via point cloud completion, followed by a specially designed encoder-decoder structure that utilizes the projected dense depth from 3D completion and the original RGB-D images to perform 2D image completion. Experiments on the KITTI dataset show our network achieves state-of-art accuracy while being more efficient. Ablation and generalization tests prove that each module in our network has positive influences on the final results, and furthermore, our network is resilient to even sparser depth.

연구 동기 및 목표

  • 로봇 공학 및 자율 주행을 위한 희박한 LiDAR 스캔과 단일 색상 이미지로부터 밀도 높고 부드러운 깊이 이미지를 생성하는 문제를 해결하기 위해.
  • 희박한 깊이 정보와 RGB 데이터 간의 모odal 비일치성과 특징 불일치 문제를 극복하기 위해.
  • 새로운 3D에서 2D로의 밀도화 파이프라인을 통해 3D 기하학적 구조를 활용하여 깊이 완성 정확도와 효율성을 향상시키기 위해.
  • 매우 희박한 깊이 입력에 대한 내성성을 향상시켜 극도로 희박한 LiDAR 데이터에서도 신뢰할 수 있는 성능을 유지하기 위해.
  • 깊이 연속성과 물체 경계를 유지하는 기하학적으로 의미 있는, 학습 가능한 완성 과정을 제공하기 위해.

제안 방법

  • 네트워크는 두 단계의 3D에서 2D로의 거친-세밀한 밀도화 파이프라인을 사용한다: 먼저 3D 공간에서 포인트 클러스터를 완성하고, 그 다음 2D 이미지 공간에서 깊이를 보정한다.
  • LiDAR 완성 네트워크는 국소 기하학적 정보와 전역적 맥락을 활용하여 희박한 LiDAR 포인트를 기하학적으로 정보화된 패치 및 조정을 통해 밀도 높은 3D 포인트 클러스터를 생성한다.
  • 깊이 완성 네트워크는 수정된 인코더-디코더 아키텍처를 사용하며, 3D 완성에서 유도된 투영된 밀도 높은 깊이, 원본 희박한 깊이, RGB 이미지를 이중 깊이 및 RGB-D 입력 채널을 통해 융합한다.
  • 네트워크는 깊이 예측을 위한 L1 및 스무스 L1 손실을 조합한 다중 작업 손실을 사용하여 엔드 투 엔드로 훈련된다.
  • 공간 관계를 유지하고 완성 과정에서 기하학적 일관성을 향상시키기 위해 좌표 기반 특징 인코딩을 통합한다.
  • 깊이와 색상 간의 단위 및 척도 일관성에 해를 끼칠 수 있는 간단한 연결을 피함으로써, 다양한 모odal 간의 효과적인 특징 융합을 가능하게 한다.

실험 결과

연구 질문

  • RQ1순수하게 2D 기반 방법과 비교할 때, 3D 포인트 클러스터 완성이 깊이 완성의 정확도와 내성성에 기여하는가?
  • RQ2직접 2D 이미지 완성과 비교할 때, 3D에서 2D로의 거친-세밀한 밀도화 파이프라인은 성능과 효율성 면에서 어떻게 비교되는가?
  • RQ3네트워크는 1/256의 샘플링 비율과 같은 극도로 희박한 깊이 입력에 얼마나 잘 일반화되는가?
  • RQ4기하학적으로 의미 있는 3D 완성이 최종 깊이 맵에서 경계 보존을 향상시키고 잡음 요소를 줄이는가?
  • RQ53D에서 2D 투영 과정에서 먼 물체가 가까운 물체를 관통하는 '침습 문제'는 어떻게 처리되는가?

주요 결과

  • 3dDepthNet은 KITTI 검증 세트에서 RMSE 693.23, iRMSE 208.96을 기록하며 최신 기술 수준의 성능을 달성하여 이전 방법들을 능가한다.
  • 절단 실험 결과, LiDAR 완성 네트워크와 깊이 완성 네트워크 모두 최종 성능 향상에 기여하며, 전체 모델이 가장 우수한 성능을 보였다.
  • 희박한 입력에 대해서도 네트워크가 잘 일반화되며, 1/16, 1/64, 1/256 샘플링 비율에서 다른 방법들을 능가하여 극도의 희박함에 대한 저항성을 입증했다.
  • LiDAR 완성 네트워크의 패치 및 기하학적 조정 메커니즘이 의미 있는 3D 완성을 가능하게 하여 후속 2D 보정을 향상시켰다.
  • 깊이 완성 네트워크는 투영된 깊이 맵에서 침입 문제를 효과적으로 완화하여 먼 물체에서 유도된 잘못된 내부 포인트를 억제하는 데 성공했다.
  • 이전 최신 기술 수준의 방법들보다 더 효율적이며, 파라미터 수 742.28K, 이미지당 추론 시간 2.52ms를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.