Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Learning for Single View Depth and Surface Normal Estimation

Huangying Zhan, Chamara Saroj Weerasekera|arXiv (Cornell University)|2019. 03. 01.
Advanced Vision and Imaging참고 문헌 44인용 수 7
한 줄 요약

이 논문은 깊이-노멀 일致성이라는 소프트 제약 조건을 사용하여 단일 이미지 깊이 및 표면 노멀 추정을 위한 자기지도 학습 프레임워크를 제안한다. 이는 기하적 추론을 향상시키며, 스테레오 및 시간적 일관성을 활용함으로써 KITTI 벤치마크에서 깊이-부드러움 기반 자기지도 학습 방법보다 유의미하게 뛰어난 표면 노멀 예측 성능을 달성한다.

ABSTRACT

In this work we present a self-supervised learning framework to simultaneously train two Convolutional Neural Networks (CNNs) to predict depth and surface normals from a single image. In contrast to most existing frameworks which represent outdoor scenes as fronto-parallel planes at piece-wise smooth depth, we propose to predict depth with surface orientation while assuming that natural scenes have piece-wise smooth normals. We show that a simple depth-normal consistency as a soft-constraint on the predictions is sufficient and effective for training both these networks simultaneously. The trained normal network provides state-of-the-art predictions while the depth network, relying on much realistic smooth normal assumption, outperforms the traditional self-supervised depth prediction network by a large margin on the KITTI benchmark. Demo video: https://youtu.be/ZD-ZRsw7hdM

연구 동기 및 목표

  • 자기지도 학습 깊이 추정에서 조각별로 부드러운 깊이 가정의 한계를 해결하기 위해, 이는 앞면 평행 평면 아티팩트를 유발한다.
  • 예측된 깊이 맵에서 노멀을 유도하는 것보다 전용 컨volution 신경망을 훈련시켜 표면 노멀 추정을 향상시키기 위해.
  • 단일 이미지 자기지도 학습에서 깊이 이동 스케일의 모호성을 제거하기 위해 스테레오 이미지 시퀀스를 사용하여 메트릭 시각적 오도메트리 추정.
  • 역깊이와 예측된 노멀 간의 소프트 일관성 제약 조건을 통해 깊이 및 노멀 예측 정확도를 향상시키기 위해.
  • 시간 기반 기하학적 일관성과 함께 공동 학습이 깊이-부드러움 사전 지식보다 뛰어난 성능을 내는지 확인하기 위해.

제안 방법

  • 스테레오 이미지 시퀀스에서 2프레임 시각적 오도메트리, 깊이 예측, 표면 노멀 예측을 공동으로 최적화하는 자기지도 학습 프레임워크.
  • 역깊이와 표면 노멀 간의 기하학적 일관성을 강제하는 소프트 일관성 손실을 통해 깊이 및 노멀 예측을 정규화.
  • 표면 노멀 네트워크는 깊이 예측과 별도로 훈련되어, 깊이에서 도출된 노멀보다 더 정확하고 노이즈가 적은 노멀 추정이 가능하다.
  • 예측된 자가 운동을 기반으로 연속된 영상 프레임 간의 일관성이 없는 깊이 및 노멀 예측을 방지하기 위해 시간적 일관성을 강제.
  • 스케일 모호성을 피하기 위해 메트릭 스케일을 복원하기 위해 스테레오 데이터를 사용.
  • 예측된 자가 운동과 깊이를 기반으로 하는 미분 가능 워핑 연산을 사용하여 광학 일관성을 기반으로 네트워크를 지도 학습.

실험 결과

연구 질문

  • RQ1깊이 및 표면 노멀 예측의 공동 학습이 자기지도 단일 이미지 3D 재구성에서 기하학적 추론을 향상시키는가?
  • RQ2예측된 깊이 맵에서 노멀을 유도하는 것보다 전용 노멀 예측 네트워크를 사용하는 것이 성능을 높이는가?
  • RQ3깊이-노멀 일치성이라는 소프트 제약 조건이 기존의 깊이-부드러움 정규화를 넘어서 깊이 및 노멀 예측을 향상시키는가?
  • RQ4영상 시퀀스 간의 시간적 기하학적 일관성을 통합함으로써 예측 정확도가 추가로 향상되는가?
  • RQ5스테레오 기반 시각적 오도메트리 학습이 자기지도 깊이 추정에서 스케일 모호성을 제거하는가?

주요 결과

  • 제안된 방법은 KITTI 스플릿에서 평균 표면 노멀 오차 30.23°를 달성하여 이전 작업인 Yang 등 [11] (35.69°) 및 Yang 등 [12] (37.44°)를 뛰어넘었다.
  • 중위 표면 노멀 오차를 19.11°로 감소시켜 기준 방법 대비 상당히 향상된 노멀 추정 품질을 입증했다.
  • 예측된 깊이 맵에서 도출된 노멀보다 더 현실적인 부드러운 노멀 가정 덕분에 전통적인 자기지도 깊이 네트워크보다 큰 격차로 성능 향상을 보였다.
  • 시각적 및 정량적 비교를 통해 전용 노멀 CNN을 사용함으로써 깊이에서 유도된 노멀보다 더 높은 품질의 노멀을 얻을 수 있음을 입증했다.
  • 시간적 일관성을 통합함으로써 성능이 추가로 향상되었으며, 평균 오차는 30.37°에서 30.23°로, 중위 오차는 19.13°에서 19.11°로 감소했다.
  • 시각 결과는 예측된 노멀이 깊이에서 도출된 노멀보다 평면 영역에서 더 매끄럽고 가장자리를 더 잘 유지한다는 것을 확인했다. 반면 깊이에서 유도된 노멀은 노이즈가 많고 아티팩트가 뚜렷하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.