Skip to main content
QUICK REVIEW

[논문 리뷰] A Fusion Approach for Multi-Frame Optical Flow Estimation

Zhile Ren, Orazio Gallo|arXiv (Cornell University)|2018. 10. 23.
Advanced Vision and Imaging참고 문헌 49인용 수 5
한 줄 요약

이 논문은 이전 프레임의 광학 흐름 예측을 현재 프레임으로 왜곡하고, 이를 현재 프레임의 예측과 학습 가능한 융합 네트워크를 통해 통합함으로써 다중 프레임 광학 흐름 추정을 위한 새로운 융합 프레임워크를 제안한다. 이 방법은 장기적인 시간적 맥락을 효과적으로 활용하여 MPI Sintel 및 KITTI 2015 벤치마크에서 두 프레임 기반 기준선과 GRU 기반 다중 프레임 방법을 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

To date, top-performing optical flow estimation methods only take pairs of consecutive frames into account. While elegant and appealing, the idea of using more than two frames has not yet produced state-of-the-art results. We present a simple, yet effective fusion approach for multi-frame optical flow that benefits from longer-term temporal cues. Our method first warps the optical flow from previous frames to the current, thereby yielding multiple plausible estimates. It then fuses the complementary information carried by these estimates into a new optical flow field. At the time of writing, our method ranks first among published results in the MPI Sintel and KITTI 2015 benchmarks. Our models will be available on https://github.com/NVlabs/PWC-Net.

연구 동기 및 목표

  • 현재 광학 흐름 방법이 두 개의 연속 프레임에만 의존하는 한계를 해결하고자 하며, 더 긴 시간적 시퀀스가 더 풍부한 운동 맥락을 제공할 수 있음을 고려한다.
  • 두 프레임 기반 방법이 종종 실패하는 겹침 영역 및 경계 외부 픽셀과 같은 도전적인 영역에서의 흐름 추정을 향상시키고자 한다.
  • 모든 두 프레임 광학 흐름 모델을 입력으로 통합할 수 있는 유연하고 엔드 투 엔드로 훈련 가능한 프레임워크를 개발하고자 한다.
  • 다양한 왜곡된 흐름 예측을 융합하는 것이 단일 최고 예측을 선택하거나 순환 네트워크를 사용하는 것보다 더 나은 성능을 내는지 입증하고자 한다.

제안 방법

  • 역 왜곡을 사용하여 이전 프레임의 광학 흐름 예측을 현재 프레임으로 왜곡하여 공간적으로 정렬한다.
  • 왜곡된 과거 흐름과 현재 프레임의 흐름 예측을 전용 융합 네트워크에 입력하여 상보적인 정보를 학습적으로 통합한다.
  • 큰 수신장치를 가진 딥 네ural 네트워크를 사용하여 융합하여 흐름 후보자들 간의 맥락 인식된 집계를 가능하게 한다.
  • 기본 두 프레임 모델과 함께 융합 네트워크를 엔드 투 엔드로 훈련하여 흐름 추정과 융합의 공동 최적화를 가능하게 한다.
  • 현대적 두 프레임 모델의 가역성(예: PWC-Net)을 활용하여 전체 파이프라인을 거쳐 역전파를 허용한다.
  • 사전 훈련을 위해 가상 KITTI, Monkaa와 같은 합성 데이터셋을 사용한 후, 공개 벤치마크(KITTI 2015, Sintel)에서 융합 네트워크를 미세 조정한다.
Figure 1: Given a scene with challenging motions, even state-of-the-art two-frame optical flow methods fail to predict the correct motion. Our flow fusion approach offers an effective method to incorporate temporal information and improve the predicted flow.
Figure 1: Given a scene with challenging motions, even state-of-the-art two-frame optical flow methods fail to predict the correct motion. Our flow fusion approach offers an effective method to incorporate temporal information and improve the predicted flow.

실험 결과

연구 질문

  • RQ1두 프레임 기반 방법과 비교해 복잡한 광학 흐름 벤치마크에서 다수의 과거 프레임에서의 광학 흐름 예측을 통합하는 것이 성능 향상에 기여하는가?
  • RQ2학습 가능한 융합 메커니즘이 다수의 흐름 후보를 단순 선택 또는 평균화하는 것보다 우수한가?
  • RQ3운동 변화가 급격하거나 겹침 영역에서조차 장기적인 시간적 맥락을 융합 네트워크가 효과적으로 활용할 수 있는가?
  • RQ4제안된 융합 프레임워크는 최신 기술 수준의 두 프레임 광학 흐름 모델과 호환되고 효과적인가?
  • RQ5융합 접근법은 운동 경계와 겹침을 포함한 다양한 데이터셋과 운동 패턴에 대해 일반화 가능한가?

주요 결과

  • PWC-Fusion는 MPI Sintel 벤치마크에서 모든 발표된 방법들 중 최고 순위를 기록하며, 모든 두 프레임 기반 기준선을 능가한다.
  • KITTI 2015 벤치마크에서 PWC-Fusion는 당시 최신 기술 수준의 PWC-Net을 포함한 모든 두 프레임 광학 흐름 방법을 초월한다.
  • 융합 네트워크는 융합된 흐름이 양쪽 입력과 다를 경우 평균 종단 간 오차(EPE)를 3.93 감소시켜, 최고의 입력을 초월한 정확도 향상을 보여준다.
  • 겹침 및 경계 외부 영역에서는 융합된 흐름이 현재 프레임의 흐름보다 훨씬 낮은 EPE를 기록하여 과거 흐름 정보의 가치를 입증한다.
  • 모호한 영역에서 37.65%의 픽셀에서 융합된 흐름이 현재 흐름과 왜곡된 과거 흐름보다 더 우수한 결과를 내어, 더 뛰어난 추정치를 합성할 수 있음을 증명한다.
  • 시각적 결과는 운동 경계에서 일관된 향상이 나타나며, PWC-Net 단독으로 사용할 때보다 융합 방법이 더 정확하고 일관성 있는 흐름장을 생성함을 보여준다.
Figure 2: Architecture of the proposed fusion approach for three-frame optical flow estimation. The dashed line indicates that the PWC-Nets share the same weights. PWC-Net can be replaced with other two-frame flow methods like FlowNetS.
Figure 2: Architecture of the proposed fusion approach for three-frame optical flow estimation. The dashed line indicates that the PWC-Nets share the same weights. PWC-Net can be replaced with other two-frame flow methods like FlowNetS.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.