Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-Supervised Deep Learning for Monocular Depth Map Prediction

Yevhen Kuznietsov, Jörg Stückler|arXiv (Cornell University)|2017. 02. 09.
Advanced Vision and Imaging참고 문헌 22인용 수 90
한 줄 요약

이 논문은 희소 LiDAR 깊이 감독과 비감독 스테레오 이미지 정합 손실을 결합한 반감독 학습 접근법을 제시하여 단안 깊이 추정용 딥 리주얼 인코더-디코더를 학습시키고 KITTI에서 최첨단 결과를 달성한다.

ABSTRACT

Supervised deep learning often suffers from the lack of sufficient training data. Specifically in the context of monocular depth map prediction, it is barely possible to determine dense ground truth depth images in realistic dynamic outdoor environments. When using LiDAR sensors, for instance, noise is present in the distance measurements, the calibration between sensors cannot be perfect, and the measurements are typically much sparser than the camera images. In this paper, we propose a novel approach to depth map prediction from monocular images that learns in a semi-supervised way. While we use sparse ground-truth depth for supervised learning, we also enforce our deep network to produce photoconsistent dense depth maps in a stereo setup using a direct image alignment loss. In experiments we demonstrate superior performance in depth map prediction from single images compared to the state-of-the-art methods.

연구 동기 및 목표

  • 실외 장면에 대한 밀집된 실제 깊이 데이터의 부족을 해결한다.
  • 희소 LiDAR 측정값과 비감독 스테레오 단서를 함께 활용한다.
  • 감독, 비감독, 규제(term) 항을 결합한 반감독 손실을 개발한다.
  • 높은 디테일의 깊이 맵을 위한 긴 스킵 연결이 있는 심층 잔차 인코더-디코더를 활용한다.
  • KITTI 데이터셋에서 최첨단 성능을 시연하고 ablations를 분석한다.

제안 방법

  • 단일 RGB 이미지에서 ResNet-50 기반 인코더-디코더와 긴 스킵 연결을 사용하여 각 픽셀의 역깊이를 예측한다.
  • 희소 LiDAR에서 투영된 감독 깊이 잔차, 스테레오 쌍 전반의 비감독 광측정(이미지 정합) 손실, 깊이 스무딩 규제 용어를 포함하는 통합 반감독 손실로 학습한다.
  • 감독Term에 대해 적응적 델타를 사용하여 큰 잔차를 강조하는 berHu 손실을 사용한다.
  • 왼쪽-오른쪽 뷰 간 대칭적 광측정 일관성을 강제하되 명시적 왼쪽-오른쪽 시차 제약은 사용하지 않는다.
  • ImageNet 프리트레인된 인코더로 초기화하고 수렴을 돕기 위해 감독Term을 점진적으로 페이드인한다.
  • KITTI에서 표준 지표(RMSE, RMSE log, 임계값에서의 정확도, ARD, SRD)를 사용하고 최첨단과 비교한다.

실험 결과

연구 질문

  • RQ1LiDAR로부터의 희소한 실제 깊이를 비감독 스테레오 광측정 손실과 효과적으로 결합하여 단일 이미지 깊이 예측기를 학습할 수 있는가?
  • RQ2반감독 프레임워크가 순수 감독 또는 순수 비감독 접근법과 비교하여 깊이 정확도와 수렴 속도를 향상시키는가?
  • RQ3아키텍처 선택(긴 스킵 연결, berHu 손실, 대칭 손실)이 깊이 맵의 품질에 미치는 영향은 무엇인가?
  • RQ4KITTI를 넘어 다른 야외 데이터셋에 모델이 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 반감독 접근법이 KITTI에서 최첨단 깊이 예측을 달성하고 여러 지표에서 이전 방법을 능가한다.
  • 비감독 이미지 정합 손실을 사용하면 특히 실제 데이터가 희박한 먼 거리에서 성능이 향상된다.
  • 감독 항에서 berHu 손실은 L2 손실보다 더 깨끗하고 노이즈가 적은 깊이 맵을 만들어낸다.
  • 긴 스킵 연결 및 비감독 항의 가우시안 스무딩은 수렴 속도와 깊이 맵의 디테일에 기여한다.
  • 완전 반감독 모델(Ours)은 KITTI 테스트 0-80 m 구간에서 RMSE 4.621, RMSE log 0.189, delta<1.25 0.862, delta<1.25^2 0.960, delta<1.25^3 0.986를 달성한다(상한 80 m).
  • 순수 감독 버전은 성능이 더 떨어진다(RMSE 4.815, RMSE log 0.194, delta<1.25 0.845, delta<1.25^2 0.957, delta<1.25^3 0.987).
  • 순수 비감독 버전은 KITTI 0-80 m에서 성능이 저조하다(RMSE 8.700, RMSE log 0.367, delta<1.25 0.752, delta<1.25^2 0.904, delta<1.25^3 0.952).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.