Skip to main content
QUICK REVIEW

[논문 리뷰] ENG: End-to-end Neural Geometry for Robust Depth and Pose Estimation using CNNs

Thanuja Dharmasiri, Andrew Spek|arXiv (Cornell University)|2018. 07. 16.
Advanced Vision and Imaging참고 문헌 36인용 수 10
한 줄 요약

이 논문은 단안 또는 스테레오 이미지 쌍으로부터 깊이, 광학 흐름, 카메라 자세를 동시에 예측하는 종단간(end-to-end) 딥 러닝 프레임워크를 제안한다. 기하학적 제약 조건과 신뢰도 추정을 통합함으로써, 깊이 예측에 대해 NYUv2 및 KITTI 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 자세 및 흐름 예측에서도 이전 방법들을 능가한다. 특히 광학 흐름 예측에 대해 학습된 신뢰도 행렬을 도입하여 새로운 기여를 이룬다.

ABSTRACT

Recovering structure and motion parameters given a image pair or a sequence of images is a well studied problem in computer vision. This is often achieved by employing Structure from Motion (SfM) or Simultaneous Localization and Mapping (SLAM) algorithms based on the real-time requirements. Recently, with the advent of Convolutional Neural Networks (CNNs) researchers have explored the possibility of using machine learning techniques to reconstruct the 3D structure of a scene and jointly predict the camera pose. In this work, we present a framework that achieves state-of-the-art performance on single image depth prediction for both indoor and outdoor scenes. The depth prediction system is then extended to predict optical flow and ultimately the camera pose and trained end-to-end. Our motion estimation framework outperforms the previous motion prediction systems and we also demonstrate that the state-of-the-art metric depths can be further improved using the knowledge of pose.

연구 동기 및 목표

  • RGB 이미지에서 종단간 방식으로 깊이, 광학 흐름, 카메라 자세를 예측하는 통합된 딥 러닝 프레임워크를 개발하는 것.
  • 기하학적 인지 학습을 활용하여 실내(NYUv2) 및 실외(KITTI) 데이터셋에서 단일 이미지 깊이 예측 성능을 향상시키는 것.
  • 예측된 깊이 및 흐름을 중간 지도 신호로 활용하여 운동 예측 정확도를 향상시키는 것.
  • 광학 흐름 예측의 불확실성을 나타내는 완전한 정보 행렬을 예측하는 데 효과적인 신경망 모듈을 도입하는 것.

제안 방법

  • 프레임워크는 단계적으로 학습되며, 먼저 스케일 연결이 있는 밀집 컨volution 네트워크 아키텍처를 사용해 단일 이미지에서 깊이를 예측한다.
  • 다음으로, 스테레오 이미지 쌍과 그 예측된 깊이 맵을 입력으로 받아 광학 흐름과 픽셀 단위의 신뢰도 점수를 생성하는 흐름 예측 네트워크를 구동한다.
  • 자세 예측 모듈은 흐름 및 깊이 예측 결과를 바탕으로 상대적 카메라 운동을 나타내는 SE(3) 변환의 로그 표현을 회귀한다.
  • 전체적으로 밀집 블록 아키텍처와 연결 스케일 연결을 활용하여 특징 재사용과 개선된 기울기 흐름을 가능하게 한다.
  • 각각 깊이 손실, 흐름 손실, 자세 손실로 구성된 다중 작업 손실을 적절히 가중하여 종단간으로 학습한다.
  • 광학 흐름 예측의 불확실성을 추정하는 데 사용할 수 있는 픽셀 단위의 2x2 공분산 행렬을 출력하는 신뢰도 행렬 예측 헤드를 도입한다.

실험 결과

연구 질문

  • RQ1단계별 접근 방식과 비교해 종단간 딥 러닝 프레임워크가 깊이, 광학 흐름, 카메라 자세를 동시에 더 정확하게 예측할 수 있는가?
  • RQ2예측된 깊이를 중간 지도 신호로 포함시킴으로써 후속 운동 예측 작업의 성능 향상이 이루어지는가?
  • RQ3신경망이 광학 흐름 예측의 전반적인 신뢰도 행렬을 효과적으로 학습하여 어려운 영역에서의 강건성을 향상시킬 수 있는가?
  • RQ4기본 기준 데이터셋에서 깊이 및 운동 예측 성능을 고려할 때, 제안된 방법은 최신 기술 수준의 모델들과 비교해 어떻게 성능을 내는가?

주요 결과

  • 모델은 단일 이미지 깊이 예측에서 최신 기술 수준의 성능을 달성하였으며, 실내(NYUv2) 및 실외(KITTI) 데이터셋 모두에서 이전 방법들을 능가한다.
  • 이전의 딥 러닝 기반 접근 방식과 비교해 TUM 및 KITTI 벤치마크에서 카메라 자세 예측 정확도가 크게 향상되었다.
  • 예측된 깊이를 보조 지도 신호로 포함시킴으로써 메트릭 깊이 예측 성능에 측정 가능한 향상이 있었으며, 기하학적 일致성의 가치를 입증하였다.
  • 이 방법은 광학 흐름 예측에 대해 전면적인 2x2 정보 행렬을 학습하는 데 있어 최초의 시도였으며, 스칼라 신뢰도 점수보다 더 강건한 불확실성 추정을 제공한다.
  • 다중 작업 학습을 통한 종단간 학습 체계는 각 작업의 일반화 능력과 성능 향상에 기여하여 고립된 학습 방식보다 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.