Skip to main content
QUICK REVIEW

[논문 리뷰] ProFlow: Learning to Predict Optical Flow

Daniel Maurer, Andrés Bruhn|arXiv (Cornell University)|2018. 06. 03.
Advanced Vision and Imaging참고 문헌 13인용 수 11
한 줄 요약

ProFlow는 실시간으로 후방 흐름에서 전방 흐름으로의 공간적으로 변형된 운동 모델을 학습하는 컨volution 신경망(CNN)을 사용하여 비지도, 온라인 학습 방식으로 광학 흐름을 예측한다. 기존 방법들이 사전 학습된 모델이나 강성 운동 가정에 의존하는 것과 달리, ProFlow는 프레임 단위로 적응하여 막힘과 비강성 운동에서 성능을 향상시키며, MPI Sintel에서 최신 기술 수준(SOTA) 성능을 달성하고 KITTI 및 Sintel 벤치마크에서 일관되게 27% 향상된 성능을 기록한다.

ABSTRACT

Temporal coherence is a valuable source of information in the context of optical flow estimation. However, finding a suitable motion model to leverage this information is a non-trivial task. In this paper we propose an unsupervised online learning approach based on a convolutional neural network (CNN) that estimates such a motion model individually for each frame. By relating forward and backward motion these learned models not only allow to infer valuable motion information based on the backward flow, they also help to improve the performance at occlusions, where a reliable prediction is particularly useful. Moreover, our learned models are spatially variant and hence allow to estimate non-rigid motion per construction. This, in turns, allows to overcome the major limitation of recent rigidity-based approaches that seek to improve the estimation by incorporating additional stereo/SfM constraints. Experiments demonstrate the usefulness of our new approach. They not only show a consistent improvement of up to 27% for all major benchmarks (KITTI 2012, KITTI 2015, MPI Sintel) compared to a baseline without prediction, they also show top results for the MPI Sintel benchmark -- the one of the three benchmarks that contains the largest amount of non-rigid motion.

연구 동기 및 목표

  • 기존 광학 흐름 방법들이 강성 운동 모델이나 사전 학습된 네트워크에 의존함으로써 막힘과 비강성 운동에서 어려움을 겪는 한계를 해결하기 위해.
  • 현재 시퀀스에서 직접 운동 모델을 학습하여 비강성 및 비자기 운동 시나리오에서도 시간적 일관성을 활용할 수 있도록 하기 위해.
  • 학습된 공간적으로 변형된 매핑을 사용해 후방 흐름으로부터 전방 흐름을 예측하여 막힘 영역에서의 흐름 추정을 향상시키기 위해.
  • 대규모 지도 데이터셋이 필요 없도록, 시퀀스 자체의 초기 흐름 추정치를 사용해 비지도, 온라인 방식으로 운동 모델을 학습함으로써 이를 해결하기 위해.
  • 특히 MPI Sintel과 같은 도전적인 비강성 운동 시나리오에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 방법은 광학 흐름 추정 과정 중에 비지도, 온라인 방식으로 후방 흐름에서 전방 흐름으로의 공간적으로 변형된 CNN 기반 매핑을 학습한다.
  • 운동 모델은 동일한 시퀀스의 초기 전방 및 후방 흐름 추정치를 사용해 프레임 단위로 학습되며, 외부 데이터셋에 의존하지 않는다.
  • 방법은 후방 흐름을 입력으로 사용해 전방 흐름을 예측함으로써 일관성을 강제하고 막힘 영역에서의 신뢰성을 향상시킨다.
  • 하드 제약 조건이 적용되며, 후방 흐름이 유효한 정보를 제공하는 곳에서는 예측된 전방 흐름이 원래 전방 흐름으로 대체된다. 특히 막힘 영역에서 유리하다.
  • 예측 이후 품질을 향상시키기 위해 인painting과 최적화를 통한 보완 단계를 포함한다.
  • 지도 데이터 없이, 전방 및 후방 흐름 간의 일관성만을 지도 신호로 사용해 엔드 투 엔드로 모델을 학습한다.

실험 결과

연구 질문

  • RQ1현재 시퀀스의 자체 흐름 추정치로부터 비지도, 온라인 방식으로 CNN 기반 운동 모델을 효과적으로 학습할 수 있는가?
  • RQ2학습된 공간적으로 변형된 운동 모델은 막힘 영역과 비강성 운동 영역에서 광학 흐름 추정을 향상시킬 수 있는가?
  • RQ3제안된 방법은 예측 없이 다양한 벤치마크에서 베이스라인 방법을 초월하는가? 특히 비강성 운동 시나리오에서 성능이 뛰어나게 되는가?
  • RQ4스테레오 또는 SfM 제약 조건에 의존하지 않고도 표준 광학 흐름 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5장면 콘텐츠와 운동 복잡도가 변화함에 따라 방법의 성능는 어떻게 변화하는가?

주요 결과

  • ProFlow는 예측 없이 기준선 대비 모든 주요 벤치마크(KITTI 2012, KITTI 2015, MPI Sintel)에서 27%의 상대적 향상을 달성한다.
  • MPI Sintel 벤치마크에서 ProFlow는 세분화 또는 기하 제약 조건을 사용하는 방법들조차 포함한 모든 방법들 중 최고 성능를 기록한다.
  • KITTI 2012에서 4.49% Out-All 오차, KITTI 2015에서 13.86% Fl-bg 오차를 기록하며, PWC-Net과 UnFlow를 모두 능가한다.
  • MPI Sintel final에서 ProFlow는 5.017의 전반 오차를 기록하여, Scene-Flow를 제외한 모든 방법들 중 1위를 차지한다.
  • 도전적인 비강성 운동 영역에서 일관된 성능 향상을 보이며, MPI Sintel unmatched 스플릿에서 24.736의 오차로 비견할 수 없는 성능를 기록한다.
  • 시퀀스당 약 112초의 런타임을 가지며, 이 중 50초는 운동 모델 학습 및 예측에 할애된다 (1226×370 해상도).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.