Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Unsupervised Learning of Optical Flow and Depth by Watching Stereo Videos

Yang Wang, Zhenheng Yang|arXiv (Cornell University)|2018. 10. 08.
Advanced Vision and Imaging참고 문헌 18인용 수 14
한 줄 요약

이 논문은 기하학적 제약 조건과 상호 감독을 활용하여 스테레오 영상에서 동시적으로 광학 흐름, 깊이, 자율 주행 운동을 학습하는 통합된 비지도 학습 프레임워크를 제안한다. 정적 영역에서 깊이와 자율 주행 운동으로부터 유도된 강성 흐름을 광학 흐름의 보조 신호로 사용하고, 강성 정렬 모듈을 통해 자율 주행 운동을 보정함으로써 KITTI에서 최신 기준 성능을 달성하였으며, 이전 비지도 방법 대비 광학 흐름 오차를 50% 감소시켰고, 지도 학습 기반 기준 수준의 성능을 달성하였다.

ABSTRACT

Learning depth and optical flow via deep neural networks by watching videos has made significant progress recently. In this paper, we jointly solve the two tasks by exploiting the underlying geometric rules within stereo videos. Specifically, given two consecutive stereo image pairs from a video, we first estimate depth, camera ego-motion and optical flow from three neural networks. Then the whole scene is decomposed into moving foreground and static background by compar- ing the estimated optical flow and rigid flow derived from the depth and ego-motion. We propose a novel consistency loss to let the optical flow learn from the more accurate rigid flow in static regions. We also design a rigid alignment module which helps refine ego-motion estimation by using the estimated depth and optical flow. Experiments on the KITTI dataset show that our results significantly outperform other state-of- the-art algorithms. Source codes can be found at https: //github.com/baidu-research/UnDepthflow

연구 동기 및 목표

  • 동적인 환경에서 비지도 깊이 및 광학 흐름 추정의 한계를 극복하기 위해 스테레오 영상을 활용해 두 작업을 공동으로 학습하는 것.
  • 스테레오 쌍 간의 기하학적 일관성과 시간적 운동을 활용해 깊이 및 자율 주행 운동 추정을 향상시키는 것.
  • 정적 영역에서 더 신뢰할 수 있는 강성 흐름(깊이 및 자율 주행 운동에서 유도)을 보조 신호로 사용해 광학 흐름 정확도를 향상시키는 것.
  • 광학 흐름 대응 관계를 통해 재구성된 3D 포인트 클라우드를 강성 정렬 모듈을 통해 정렬함으로써 자율 주행 운동 추정을 개선하는 것.
  • 흐름과 강성 흐름 간의 차이를 기반으로 하는 운동 세분화를 통해 움직이는 정적 배경과 이동하는 정적 배경을 구분함으로써 운동 세분화 성능을 향상시키는 것.

제안 방법

  • 프레임워크는 두 개의 연속된 스테레오 이미지 쌍에서 깊이, 광학 흐름, 자율 주행 운동을 동시에 추정하기 위해 세 개의 딥 네트워크를 사용한다.
  • 추정된 광학 흐름과 깊이 및 자율 주행 운동에서 유도된 강성 흐름을 비교하여 운동 세분화 마스크를 생성함으로써 움직이는 물체를 식별한다.
  • 흐름 일관성 모듈은 정적 영역에서 광학 흐름이 강성 흐름과 일치하도록 강제하여 흐름 정확도를 향상시킨다.
  • 강성 정렬 모듈은 광학 흐름 대응 관계에서 재구성된 3D 포인트 클라우드를 강성으로 정렬함으로써 자율 주행 운동을 보정한다.
  • 학습은 세 단계로 진행된다: 스테레오 전용 깊이 추정, 시간 일관성과 함께 자율 주행 운동 및 흐름 보정, 운동 세분화 및 모듈 통합을 포함한 전체 공동 최적화.
  • 손실 함수는 스테레오 일관성, 광학 흐름 재구성, 운동 세분화 인식 손실을 조합하여 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1스테레오 영상에서 깊이 및 광학 흐름을 공동으로 학습함으로써 기하학적 제약 조건을 활용하면 성능 향상이 가능할까?
  • RQ2깊이 및 자율 주행 운동에서 유도된 강성 흐름을 정적 영역의 광학 흐름 추정에 어떻게 활용할 수 있을까?
  • RQ3광학 흐름에서 유도된 포인트 클라우드 대응 관계를 개선하기 위해 강성 정렬 모듈이 자율 주행 운동 추정을 향상시킬 수 있을까?
  • RQ4흐름과 강성 흐름 간의 차이를 기반으로 한 운동 세분화가 전체 시스템의 강인성에 어느 정도 기여할까?
  • RQ5지표가 없는 비지도 스테레오 기반 학습이 지도 학습 기반 방법과 비슷한 성능을 달성할 수 있을까?

주요 결과

  • 이 방법은 이전 최고의 비지도 방법 대비 KITTI 2012에서 광학 흐름 오차를 50% 감소시켰고, 지도 학습 기반 기준 수준의 성능을 달성하였다.
  • 전체 모델은 KITTI 2015 깊이 추정에서 이전의 모든 비지도 스테레오 기반 방법을 능가하였으며, 평균 IoU 0.56과 가중치가 부여된 IoU 0.88을 기록하였다.
  • 강성 정렬 모듈은 자율 주행 운동 추정을 크게 향상시켰으며, 절대 궤적 오차를 감소시키고 이 모듈이 없는 방법보다 뛰어난 성능을 보였다.
  • 흐름 일관성 모듈은 특히 평면 영역에서 더 매끄럽고 선명한 경계를 가진 광학 흐름 예측을 가능하게 하여 정성적 비교에서 확인되었다.
  • 운동 세분화 성능은 약간 향상되었으며, 평균 IoU 0.56과 픽셀 정확도 0.82를 기록하여 동적 환경 처리 능력 향상 여지를 보여주었다.
  • 제거 실험 결과, 강성 정렬 및 흐름 일관성 모듈이 깊이, 흐름, 오도메트리 작업 전반에서 최적 성능을 내기 위해 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.