Skip to main content
QUICK REVIEW

[논문 리뷰] Learning by Analogy: Reliable Supervision from Transformations for Unsupervised Optical Flow Estimation

Liang Liu, Jiangning Zhang|arXiv (Cornell University)|2020. 03. 29.
Advanced Vision and Imaging참고 문헌 52인용 수 11
한 줄 요약

이 논문은 변환된 입력과 원본 데이터의 변환된 예측에서 유도된 자기지도 학습 감독을 통해 훈련의 신뢰성을 향상시키는 새로운 비지도 광학 흐름 프레임워크를 제안한다. 표준 비지도 파이프라인을 변환된 데이터에 대한 추가적인 순방향 전파를 포함하도록 변형함으로써, 이 방법은 비지도 방법 중 최고 수준의 성능을 달성하고, 지도 학습 방법과 경쟁 가능한 결과를 내며, 더 적은 파라미터를 사용하고 다양한 데이터셋 간의 일반화 능력이 뛰어나다.

ABSTRACT

Unsupervised learning of optical flow, which leverages the supervision from view synthesis, has emerged as a promising alternative to supervised methods. However, the objective of unsupervised learning is likely to be unreliable in challenging scenes. In this work, we present a framework to use more reliable supervision from transformations. It simply twists the general unsupervised learning pipeline by running another forward pass with transformed data from augmentation, along with using transformed predictions of original data as the self-supervision signal. Besides, we further introduce a lightweight network with multiple frames by a highly-shared flow decoder. Our method consistently gets a leap of performance on several benchmarks with the best accuracy among deep unsupervised methods. Also, our method achieves competitive results to recent fully supervised methods while with much fewer parameters.

연구 동기 및 목표

  • 차폐, 저조도, 과노출와 같은 도전적인 환경에서 광학 일致성 손실의 신뢰성 부족 문제를 해결한다.
  • 지식 정렬 기반 비지도 흐름 학습의 한계, 즉 정체된 교사 모델과 다단계 훈련 복잡성 문제를 해결한다.
  • 지상 진술이 없고 복잡한 정규화가 필요 없이, 데이터 증강에서 유도된 신뢰할 수 있는 감독 신호를 제공하는 단일 네트워크 훈련을 가능하게 한다.
  • 도메인 특화 미세조정 없이, 예를 들어 CityScapes와 같은 실세계 영상 데이터와 같은 레이블이 없는 데이터에서 훈련함으로써 데이터셋 간의 일반화 능력을 향상시킨다.
  • 변환 기반 자기지도 학습이 공간 변환과 AutoAugment 정책을 포함한 다양한 증강 유형에 일반적으로 적용될 수 있음을 보여준다.

제안 방법

  • 원본 이미지에 대한 첫 번째 순방향 전파로 광학 흐름을 예측하고, 변환된(변형된) 이미지에 대한 두 번째 순방향 전파로 첫 번째 전파의 변환된 예측에서 자기지도 학습 신호를 생성하는 双중 순방향 전파 메커니즘을 도입한다.
  • 표준 비지도 훈련에서 증강된 데이터를 사용할 경우 발생하는 신뢰성 부족한 광학 일치 손실을 피하기 위해, 변환된 예측을 변환된 입력에 대한 신뢰할 수 있는 감독 신호로 사용한다.
  • 다중 프레임 입력을 지원하는 경량이며 고도로 공유된 광학 흐름 디코더를 설계하여, 더 긴 시퀀스에서 효율적이고 정확한 추정을 가능하게 한다.
  • 차폐, 저조도, 과노출, CPAB 및 AutoAugment 정책을 포함한 다양한 데이터 증강 기법을 훈련 파이프라인에 통합한다.
  • 교수-학생 정렬이나 다단계 최적화가 필요 없이, 전체 네트워크를 단일 단계에서 엔드 투 엔드로 훈련한다.
  • 공간 변환 전에 좌표 보정(예: 랜덤 줌)을 적용하여 잘못된 흐름 좌표를 방지하고, 수치적 안정성을 확보한다.

실험 결과

연구 질문

  • RQ1광학 일치성이 실패하는 도전적인 환경에서 변환 기반 자기지도 학습이 비지도 광학 흐름 훈련의 신뢰성을 향상시킬 수 있는가?
  • RQ2정체된 교사 모델을 사용하는 다단계 지식 정렬을 대체할 수 있는 단일 네트워크 프레임워크가 성능을 유지하거나 향상시킬 수 있는가?
  • RQ3다양한 증강 기법(예: 차폐, 노출 변화, 공간 왜곡)을 통합함으로써 비지도 광학 흐름 추정의 일반화 능력과 강건성 향상에 기여하는가?
  • RQ4이 프레임워크로 훈련된 경량 다중 프레임 광학 흐름 네트워크가 지도 학습 모델과 유사한 성능을 달성하면서도 훨씬 적은 파라미터를 사용할 수 있는가?
  • RQ5CityScapes와 같은 실세계 데이터에서 레이블이 없는 상태로 훈련된 후, 새로운 데이터셋으로의 일반화 능력은 어느 정도인가?

주요 결과

  • 제안된 방법은 표준 벤치마크에서 모든 딥 비지도 광학 흐름 방법 중 평균 종단 오차(AEPE)가 가장 낮으며, 이전의 비지도 모델을 능가한다.
  • Sintel 데이터셋에서, 이 방법은 3.50 AEPE(클린), 2.79 AEPE(최종), 전체 테스트 세트에서 3.73 AEPE를 기록하여 이전의 비지도 방법을 초월한다.
  • KITTI 2012와 KITTI 2015에서 각각 3.06과 9.04 AEPE를 기록하여 실세계 영상에서 뛰어난 성능을 보인다.
  • 레이블이 없는 CityScapes 데이터셋에서 훈련한 후, KITTI 2012에서 5.10 AEPE, KITTI 2015에서 5.22 AEPE를 기록하여, 많은 합성 데이터로 훈련된 모델들을 능가한다.
  • 실세계 데이터셋으로의 전이 시, 지도 학습 기반 PWC-Net보다 더 우수한 일반화 능력을 보이며, 도메인 적응 능력이 뛰어나다는 것을 시사한다.
  • AutoAugment 및 CPAB 변환과의 통합은 정확도를 추가로 향상시켜, 이 프레임워크가 복잡한 증강 정책과도 호환됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.