Skip to main content
QUICK REVIEW

[논문 리뷰] Every Pixel Counts: Unsupervised Geometry Learning with Holistic 3D Motion Understanding

Zhenheng Yang, Peng Wang|arXiv (Cornell University)|2018. 06. 27.
Advanced Vision and Imaging참고 문헌 50인용 수 10
한 줄 요약

이 논문은 카메라 자기 운동, 픽셀 단위 3D 객체 운동(스포츠 플로우), 그리고 이동 중인 객체 분할을 동시에 모델링하여 단안 영상의 깊이 추정 및 3D 운동 이해를 향상시키는 자기지도 학습 프레임워크를 제안한다. 가시화 가능한 통합 3D 운동 해석기(HMP)를 사용하여 광학 흐름, 깊이 예측, 카메라 자세, 분할 마스크를 통합하여 일관성을 강제함으로써, KITTI 2015에서 깊이, 스트림 플로우, 이동 중인 객체 분할 분야에서 최고 성능을 달성한다.

ABSTRACT

Learning to estimate 3D geometry in a single image by watching unlabeled videos via deep convolutional network has made significant process recently. Current state-of-the-art (SOTA) methods, are based on the learning framework of rigid structure-from-motion, where only 3D camera ego motion is modeled for geometry estimation.However, moving objects also exist in many videos, e.g. moving cars in a street scene. In this paper, we tackle such motion by additionally incorporating per-pixel 3D object motion into the learning framework, which provides holistic 3D scene flow understanding and helps single image geometry estimation. Specifically, given two consecutive frames from a video, we adopt a motion network to predict their relative 3D camera pose and a segmentation mask distinguishing moving objects and rigid background. An optical flow network is used to estimate dense 2D per-pixel correspondence. A single image depth network predicts depth maps for both images. The four types of information, i.e. 2D flow, camera pose, segment mask and depth maps, are integrated into a differentiable holistic 3D motion parser (HMP), where per-pixel 3D motion for rigid background and moving objects are recovered. We design various losses w.r.t. the two types of 3D motions for training the depth and motion networks, yielding further error reduction for estimated geometry. Finally, in order to solve the 3D motion confusion from monocular videos, we combine stereo images into joint training. Experiments on KITTI 2015 dataset show that our estimated geometry, 3D motion and moving object masks, not only are constrained to be consistent, but also significantly outperforms other SOTA algorithms, demonstrating the benefits of our approach.

연구 동기 및 목표

  • 기존의 비지도 깊이 추정 방법이 강체 영역을 가정하는 한계를 해결하기 위해, 영상 내 비강체 이동 객체를 명시적으로 모델링한다.
  • 픽셀 단위 3D 스트림 플로우 및 막힘 인식 운동 모델링을 통합하여 깊이 추정의 안정성과 정확도를 향상시킨다.
  • 깊이, 광학 흐름, 카메라 운동, 이동 중인 객체 분할을 동시에 최적화하는 통합형 차별 가능한 프레임워크를 개발한다.
  • 단안 영상에서의 깊이-운동 모호성을 제거하기 위해 훈련 과정에 스테레오 이미지 쌍을 통합한다.
  • 모든 픽셀의 운동이 명시적으로 설명되는 통합 3D 시나리오 이해를 가능하게 하여, 시각 합성에서의 광학 오차를 감소시킨다.

제안 방법

  • 2D 광학 흐름, 예측된 카메라 자세, 깊이 맵, 이동 중인 객체 분할 마스크를 융합하는 통합 3D 운동 해석기(HMP)를 도입한다.
  • 카메라 자세와 타겟 깊이를 사용해 강체 배경의 3D 운동을 계산하고, 광학 흐름과 양측 깊이 맵을 사용해 막힘 모델링을 포함한 전체 영상의 3D 스트림 플로우를 계산한다.
  • 차별 가능한 제약 조건을 적용: 막힘 없이 강체 영역에서는 배경 3D 유동과 전체 3D 유동의 차이가 0이 되어야 하고, 이동 중인 객체 영역에서는 공간적으로 매끄러운 잔차가 비영이 되어야 한다.
  • 이러한 제약 조건을 기반으로 다중 작업 손실을 설계하여 깊이 및 운동 네트워크를 엔드 투 엔드로 지도한다.
  • 깊이-운동 모호성을 제거하고 일반화 성능을 향상시키기 위해 단안 훈련 파이프라인에 스테레오 이미지 쌍을 통합한다.
  • 단일 이미지 깊이 예측을 위한 깊이 네트워크, 카메라 자세 및 객체 마스크를 위한 운동 네트워크, 보조 지도 신호로 광학 흐름 네트워크를 갖춘 이중 스트림 아키텍처를 구현한다.

실험 결과

연구 질문

  • RQ1이동 중인 객체가 있는 단안 영상에서 픽셀 단위 3D 객체 운동을 명시적으로 모델링하면 비지도 깊이 추정 성능이 향상되는가?
  • RQ2광학 흐름, 깊이, 카메라 운동 간의 3D 운동 일관성을 어떻게 강제하여 훈련 안정성과 기하학 추정 성능을 향상시킬 수 있는가?
  • RQ3깊이, 스트림 플로우, 이동 중인 객체 분할을 함께 학습하면 별도의 지도 학습에 비해 성능 향상 정도는 어느 정도인가?
  • RQ4깊이-운동 모호성을 제거하기 위해 스테레오 데이터를 활용하면 단안 비지도 학습에서 깊이 추정 성능이 향상되는가?
  • RQ5강체 배경과 이동 중인 객체 운동을 모두 모델링하는 통합 3D 운동 해석기(HMP)가 더 정확하고 안정적인 기하학 재구성 결과를 도출하는가?

주요 결과

  • 제안된 방법은 KITTI 2015 벤치마크에서 기존의 비지도 및 지도 학습 방법을 모두 능가하는 최고 성능을 달성하여 깊이, 스트림 플로우, 이동 중인 객체 분할 분야에서 SOTA 성능을 기록했다.
  • HMP 모듈은 기하학 추정 성능을 크게 향상시켜 KITTI 2015 스트림 플로우 벤치마크에서 D1 오차를 23.62로, D2 오차를 27.38로 감소시켰다.
  • 운동 마스크를 사용한 이동 중인 객체 분할은 평균 IoU가 52.25%를 기록하여 기준 방법들(예: 잔여 광학 흐름 기반 GMM의 50.83%, 설명 가능성 마스크의 41.95%)을 초월했다.
  • 배경과 이동 중인 객체 모두에 대해 3D 운동을 명시적으로 모델링함으로써 시각 합성에서의 광학 오차를 감소시켜 더 안정적인 훈련을 가능하게 하였다.
  • 스테레오 이미지를 함께 학습한 결과 단안 학습에 비해 성능 향상이 뚜렷했으며, 비지도 깊이 학습에서 다중 모odal 지도의 유용성을 입증하였다.
  • HMP 모듈을 제거하거나 단안 데이터로만 훈련할 경우 성능 저하가 심각하게 발생하여 통합 3D 운동 해석의 중요성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.