Skip to main content
QUICK REVIEW

[논문 리뷰] SelFlow: Self-Supervised Learning of Optical Flow

Pengpeng Liu, Michael R. Lyu|arXiv (Cornell University)|2019. 04. 19.
Advanced Vision and Imaging참고 문헌 50인용 수 14
한 줄 요약

SelFlow는 비정상적인 영역에서의 흐름 예측을 신뢰할 수 있는 비접촉 픽셀로부터 유도하여 환영된 막힘 영역에서의 흐름 학습을 안내하는 자기지도 학습 프레임워크를 제안한다. 단순한 CNN에서 슈퍼픽셀 기반 노이즈 주입과 다중 프레임 시간 모델링을 사용함으로써, 지도 학습 미세조정 이후 Sintel 벤치마크에서 4.26의 새로운 SOTA EPE를 달성하며, 이는 이전의 모든 방법들을 능가하는 최신 비지도 성능을 확보한다.

ABSTRACT

We present a self-supervised learning approach for optical flow. Our method distills reliable flow estimations from non-occluded pixels, and uses these predictions as ground truth to learn optical flow for hallucinated occlusions. We further design a simple CNN to utilize temporal information from multiple frames for better flow estimation. These two principles lead to an approach that yields the best performance for unsupervised optical flow learning on the challenging benchmarks including MPI Sintel, KITTI 2012 and 2015. More notably, our self-supervised pre-trained model provides an excellent initialization for supervised fine-tuning. Our fine-tuned models achieve state-of-the-art results on all three datasets. At the time of writing, we achieve EPE=4.26 on the Sintel benchmark, outperforming all submitted methods.

연구 동기 및 목표

  • 대규모 레이블이 부여된 데이터에 의존하지 않고 막힘 문제를 해결하는 것.
  • 비정상적인 영상 데이터를 활용해 정적 및 동적 환경 모두에서 강력한 광학 흐름을 학습할 수 있는 자기지도 학습 방법을 개발하는 것.
  • 합성 사전 훈련 데이터에 대한 의존도를 줄이고, 데이터셋에 특화된 훈련 스케줄링이 필요 없도록 하는 것.
  • 신뢰할 수 있는 비접촉 영역의 흐름 예측을 활용해 환영된 막힘 영역에서의 학습을 자기지도 방식으로 안내함으로써 비지도 광학 흐름 성능을 향상시키는 것.
  • 자기지도 사전 훈련이 지도 학습 벤치마크에서의 미세조정 성능을 향상시킬 수 있음을 입증하는 것.

제안 방법

  • 이 방법은 두 가지 브랜치로 구성된 네트워크를 사용한다: 비접촉 픽셀의 흐름을 추정하기 위해 광학적 손실 기반으로 훈련된 NOC-모델과, 막힘 영역의 흐름을 학습하는 OCC-모델.
  • 목표 프레임에서 무작위로 선택된 슈퍼픽셀를 변형하여 인위적인 막힘을 생성함으로써 새로운 막힘 상황을 시뮬레이션한다.
  • 자기지도 학습은 비접촉 영역에서의 NOC-모델 예측 결과를 사용하여 새로 생성된 막힘 영역에서 OCC-모델의 학습을 안내한다.
  • 간단한 CNN 아키텍처가 다중 프레임의 시간 정보를 통합하여 흐름 추정 정확도를 향상시킨다.
  • 훈련 중 신뢰할 수 없는 영역을 제외하기 위해 막힘 마스크를 포함한 광학적 손실을 적용한다.
  • 랜덤 슈퍼픽셀 변형을 통한 데이터 디스틸레이션을 활용하여 다양한 막힘 패턴을 생성함으로써 강력한 자기지도 학습을 실현한다.

실험 결과

연구 질문

  • RQ1지속적인 진동이 있는 자연적 막힘 상황에서 지도 학습에 필요한 진짜 레이블 없이도 자기지도 학습이 효과적으로 광학 흐름을 추정할 수 있는가?
  • RQ2비접촉 영역에서의 신뢰할 수 있는 흐름 예측 결과를 자기지도 학습을 통해 환영된 막힘 영역의 학습에 활용할 수 있는가?
  • RQ3다중 프레임 시간 정보를 통합하면 막힘 영역에서의 광학 흐름 추정 정확도가 향상되는가?
  • RQ4자기지도 사전 훈련 모델이 지도 미세조정을 위한 효과적인 초기화로 기능할 수 있는가? 이는 합성 사전 훈련 데이터에 대한 의존도를 줄일 수 있다.
  • RQ5슈퍼픽셀 기반 막힘 환영 전략은 성능 및 일반화 능력 측면에서 다른 노이즈 주입 전략과 비교해 어떻게 성과를 내는가?

주요 결과

  • 제안된 방법은 Sintel final 벤치마크에서 EPE 4.26을 달성하여, 제출된 모든 방법들 중에서 새로운 최고 성능을 기록했다.
  • KITTI 2012에서 비지도 모델은 EPE=1.69를 기록했으며, 이는 이전 최고의 비지도 방법인 DDFlow 대비 28.1%의 상대적 향상이다.
  • KITTI 2015에서 비지도 모델은 EPE=4.84를 기록했으며, DDFlow 대비 15.3%의 상대적 향상이다.
  • 지도 미세조정 이후, 모델은 KITTI 2012에서 Fl-all=6.19%와 KITTI 2015에서 Fl-all=8.42%를 달성하여, 이전의 모든 지도 학습 방법들을 능가했다.
  • 절단 실험 결과, 다중 프레임 입력과 자기지도 학습이 성능 향상에 크게 기여하며, 특히 막힘 영역에서 EPE-OCC가 Sintel Clean에서 26.63에서 22.06으로 감소함을 확인했다.
  • 자기지도 사전 훈련은 제한된 진짜 레이블 데이터가 존재하는 상황에서도 지도 미세조정 시 빠르고 안정적인 수렴을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.