Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Deep Epipolar Flow for Stationary or Dynamic Scenes

Yiran Zhong, Pan Ji|arXiv (Cornell University)|2019. 04. 08.
Advanced Vision and Imaging참고 문헌 43인용 수 5
한 줄 요약

이 논문은 무 supervision으로서의 깊이 있는 에피포일 플로우(Deep Epipolar Flow)를 제안한다. 이는 정적 장면에 대해 낮은 질서 구조, 동적 장면에 대해 부분공간의 합집합을 사용하여 부드러운 에피포일 제약 조건을 통해 전역 기하 구조 제약 조건을 강제한다. 이 방법은 KITTI 2015(16.24% Fl)와 Sintel(청결한 버전에서 EPE 6.84)에서 최신 기준 성능을 달성하며, 지도 학습 기반의 기준에 가까이 다가가면서도 지도 학습에 필요한 참값 플로우를 사용하지 않는다.

ABSTRACT

Unsupervised deep learning for optical flow computation has achieved promising results. Most existing deep-net based methods rely on image brightness consistency and local smoothness constraint to train the networks. Their performance degrades at regions where repetitive textures or occlusions occur. In this paper, we propose Deep Epipolar Flow, an unsupervised optical flow method which incorporates global geometric constraints into network learning. In particular, we investigate multiple ways of enforcing the epipolar constraint in flow estimation. To alleviate a "chicken-and-egg" type of problem encountered in dynamic scenes where multiple motions may be present, we propose a low-rank constraint as well as a union-of-subspaces constraint for training. Experimental results on various benchmarking datasets show that our method achieves competitive performance compared with supervised methods and outperforms state-of-the-art unsupervised deep-learning methods.

연구 동기 및 목표

  • 반복 텍스처 및 음영 영역에서 무 supervision 딥 광학 플로우 방법의 성능 저하 문제를 해결하기 위해.
  • 참값 플로우에 의존하지 않고도 무 supervision 플로우 학습에 전역 에피포일 기하학을 통합하기 위해.
  • 다중 운동이 존재하는 동적 장면에서 '닭과 계란' 문제를 해결하기 위해, 낮은 질서 및 부분공간의 합집합 제약 조건을 통해 장면 기하학을 모델링하기 위해.
  • 무 supervision 학습 프레임워크 내에서 기하학적 사전 지식을 사용하여 정적 및 동적 장면에서의 일반화 및 정확도 향상시키기 위해.

제안 방법

  • 정적 장면에서 전역 강성 조건을 강제하기 위해 낮은 질서 구조에 기반한 부드러운 에피포일 제약 조건을 도입한다.
  • 동적 장면에서 다중 독립 운동을 모델링하기 위해 부분공간의 합집합 제약 조건을 제안하며, 고정된 기본 행렬 가정을 대체한다.
  • 이러한 제약 조건을 통해 무 supervision 학습 중에 에피포일 기하학을 강제하는 미분 가능한 손실 함수를 설계한다.
  • 이미지 워핑 손실, 스무스니스 정규화, 기하 제약 조건을 통합된 학습 목표로 조합한다.
  • 참값 supervision 없이도 끝에서 끝까지 학습 가능한 피라미드 기반 CNN 아키텍처를 사용한 이중 프레임 입력을 활용한다.
  • 실세계 데이터셋(KITTI VO)에서의 피니튜닝을 통해 도메인 특화 플로우 특성에 적응한다.

실험 결과

연구 질문

  • RQ1무 supervision 딥 광학 플로우 학습에서 전역 에피포일 기하학을 효과적으로 강제할 수 있는가? 특히 음영 및 반복 텍스처 영역에서 성능 향상에 기여하는가?
  • RQ2다중 운동이 존재하는 동적 장면에서 단일 기본 행렬이 실패하는 이유는 무엇이며, 이러한 복잡성을 더 잘 모델링할 수 있는 대체 기하학적 구조는 무엇인가?
  • RQ3낮은 질서 및 부분공간의 합집합 제약 조건을 부드럽고 미분 가능한 정규화 요소로 사용하여 참값 플로우 supervision 없이도 무 supervision 플로우 추정을 향상시킬 수 있는가?
  • RQ4기하학적 사전 지식을 통합할 경우, 표준 광학적 및 스무스니스 손실만 사용하는 것과 비교해 학습 과정에서 수렴 속도가 빨라지고 오차가 감소하는가?

주요 결과

  • KITTI 2015 벤치마크에서 제안된 방법은 종단 오차(EPE) 5.56과 플로우 정확도(Fl) 16.24%를 달성하였으며, 이는 이전 최고의 무 supervision 방법인 Back2Future Flow를 능가한다.
  • Sintel Clean 데이터셋에서 EPE 6.84를 기록하였으며, 이는 무 supervision 방법 중 최고 성능이며, 지도 학습 기반 모델의 성능에 근접한다.
  • 부분공간의 합집합 제약 조건은 낮은 질서 또는 딱딱한 기본 행렬 제약 조건보다 다중 운동이 존재하는 동적 장면을 더 효과적으로 처리할 수 있음을 보여준다.
  • 제거 분석 결과, 이미지 워핑과 부분공간 제약 조건을 조합한 경우 Sintel Final 데이터셋에서 다른 조합보다 더 빠른 수렴과 더 낮은 검증 오차를 기록한다.
  • KITTI 2015 및 Sintel Final 데이터셋에서의 피니튜닝은 성능 향상을 가져오며, Sintel 결과의 EPE는 6.15에서 3.94로 감소하여 도메인 적응의 이점을 보여준다.
  • 특히 피니튜닝 이후에는 SpyNet과 같은 지도 학습 네트워크와 경쟁 가능한 성능을 달성하여 실제 세계 및 합성 도메에 대한 강력한 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.