Skip to main content
QUICK REVIEW

[논문 리뷰] Conf-Net: Toward High-Confidence Dense 3D Point-Cloud with Error-Map Prediction

Hamid Hekmatian, Jingfu Jin|arXiv (Cornell University)|2019. 07. 23.
Advanced Vision and Imaging참고 문헌 29인용 수 9
한 줄 요약

Conf-Net는 희박한 LiDAR 데이터로부터 조밀한 깊이 맵과 픽셀 단위의 오차 맵을 동시에 예측하는 엔드 투 엔드 딥 러닝 방법을 제안한다. 이는 상당히 낮은 RMSE를 기록하면서도 높은 신뢰도의 반조밀한 3D 포인트 클라우드를 가능하게 한다. 학습 중에 직접 오차 신호를 학습함으로써, RGB 가이던스 없이도 399mm의 RMSE를 달성하며, 이는 최신 기술 대비 60% 낮은 수준이다. 또한 단일 카메라 깊이 추정으로의 확장성도 효과적으로 확보한다.

ABSTRACT

This work proposes a method for depth completion of sparse LiDAR data using a convolutional neural network which can be used to generate semi-dense depth maps and "almost" full 3D point-clouds with significantly lower root mean squared error (RMSE) over state-of-the-art methods. We add an "Error Prediction" unit to our network and present a novel and simple end-to-end method that learns to predict an error-map of depth regression task. An "almost" dense high-confidence/low-variance point-cloud is more valuable for safety-critical applications specifically real-world autonomous driving than a full point-cloud with high error rate and high error variance. Using our predicted error-map, we demonstrate that by up-filling a LiDAR point cloud from 18,000 points to 285,000 points, versus 300,000 points for full depth, we can reduce the RMSE error from 1004 to 399. This error is approximately 60% less than the state-of-the-art and 50% less than the state-of-the-art with RGB guidance (we did not use RGB guidance in our algorithm). In addition to analyzing our results on Kitti depth completion dataset, we also demonstrate the ability of our proposed method to extend to new tasks by deploying our "Error Prediction" unit to improve upon the state-of-the-art for monocular depth estimation. Codes and demo videos are available at http://github.com/hekmak/Conf-net.

연구 동기 및 목표

  • 안전이 중요한 자율 주행 응용 분야에서 희박한 LiDAR 데이터로부터 고신뢰도의 조밀한 3D 포인트 클라우드를 생성하기 위해.
  • 특히 RGB 가이던스 없이도 극도로 희박한 상황(95% 이상 데이터 손실)에서 깊이 보완의 높은 분산과 불확실성을 해결하기 위해.
  • 직접적인 학습 신호로 픽셀 단위의 오차 맵을 예측함으로써 불확실성 추정을 향상시키고, 예측의 신뢰도 기반 필터링을 가능하게 하기 위해.
  • 오차 예측 모듈이 다른 회귀 과제, 예를 들어 단일 카메라 깊이 추정과 같은 과제로 일반화될 수 있음을 보여주기 위해.
  • 기존 네트워크에 대한 아키텍처 변경을 최소화하면서도 불확실성 인식 깊이 예측을 위한 즉시 사용 가능한 솔루션을 제공하기 위해.

제안 방법

  • U-Net 유사한 인코더-디코더 네트워크를 사용하는 다중 작업 학습 프레임워크를 도입하여, 엔드 투 엔드 방식으로 조밀한 깊이와 픽셀 단위의 오차 맵을 동시에 예측한다.
  • 학습 중에 진짜 깊이 오차를 직접 지도 신호로 포함하는 새로운 손실 함수를 사용함으로써, 네트워크가 오차 추정을 직접 학습할 수 있도록 한다.
  • 깊이 손실과 오차 맵 손실 간의 균형을 맞추기 위해 비율 기반 정규화 기법을 적용하여 학습의 안정성과 수렴 성능을 향상시킨다.
  • 예측된 오차 맵을 활용해 저신뢰도 깊이 예측을 필터링함으로써, 희박한 입력에서 고신뢰도의 반조밀한 3D 포인트 클라우드를 생성한다.
  • 손실 가중치를 수동 조정하는 대신 비율 기반 정규화를 도입하고 오차 맵 손실을 추가함으로써 오차 예측 유닛을 단일 카메라 깊이 추정으로 확장한다.
  • 오차 맵을 사용해 신뢰도 임계값을 설정함으로써, 사용자가 포인트 클라우드의 밀도와 예측 정확도 사이에서 트레이드오���을 설정할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1딥 뉴럴 네트워크는 깊이 보완 중에 자신의 픽셀 단위 오차 맵을 예측할 수 있는가? 이는 불확실성 추정을 향상시키는가?
  • RQ2실제 오차 신호(불확실성 또는 신뢰도 대체 신호가 아닌)로부터 학습함으로써 더 정확하고 신뢰할 수 있는 깊이 예측이 가능해지는가?
  • RQ3예측된 오차 맵을 활용해 기존의 전점 클라우드 방법보다 정확도와 신뢰도 면에서 뛰어난 고신뢰도 반조밀한 3D 포인트 클라우드를 생성할 수 있는가?
  • RQ4오차 예측 모듈은 아키텍처의 대대적 개편 없이도 다른 깊이 회귀 과제, 예를 들어 단일 카메라 깊이 추정과 같은 과제로 효과적으로 이식 가능한가?
  • RQ5제안된 방법의 성능은 RMSE, MAE 및 신뢰도 기반 필터링 측면에서 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • 18,000점에서 285,000점으로의 업샘플링 시, 기준 희박한 LiDAR의 RMSE 1004mm에서 Conf-Net은 399mm로 감소하여, RGB 가이던스 없이도 최신 기술 대비 60% 낮은 성능을 기록한다.
  • Kitti 깊이 보완 벤치마크에서, RGB 가이던스 없이도 300mm의 RMSE를 달성하여 이전 최신 기술 대비 정확도에서 50% 향상되었다.
  • 200mm 오차 임계값을 적용함으로써, 포인트 클라우드의 93.52%를 유지하면서도 RMSE를 468mm로 낮추어 밀도와 정확도 사이의 효과적인 트레이드오프를 입증했다.
  • 간접적인 불확실성 추정보다 오차 맵 예측이 더 정확하고 맥락적으로 의미 있는 것으로 확인되었으며, 깊이 보완과 단일 카메라 깊이 추정 모두에서 뛰어난 성능을 보였다.
  • NYU Depth 데이터셋에서, Alhashim 등이 제안한 단일 카메라 깊이 모델에 오차 예측 유닛을 통합함으로써, 100mm 임계값에서 0.365의 RMSE를 달성하여 이전 모든 방법보다 낮은 성능을 기록했다.
  • 이 방법은 매우 모듈러하다: 기존 네트워크에 오차 맵 헤드와 손실 함수를 추가하려면 손실 함수 수정만으로도 가능하며, 기존의 신뢰도 기반 방법과 달리 전체 재구현이 필요로 하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.