Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Motion Magnification by Backpropagating Through Optical Flow

Zhaoying Pan, Daniel Geng|arXiv (Cornell University)|2023. 11. 28.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 사전 훈련된 광학 흐름 네트워크를 통해 역전파하여 예측된 흐름을 원하는 요인으로 스케일링함으로써 미세한 비디오 운동을 확대하는 자기지도 학습 운동 확대 방법을 제안한다. 합성 데이터 없이 진짜로 레이블이 없는 비디오만으로 훈련하며, 실제 및 합성 비디오에서 최신 기술 수준(SOTA)의 성능을 달성하고, 테스트 시점 적응 및 사용자 제공 마스크를 통한 개체별 확대를 가능하게 한다.

ABSTRACT

This paper presents a simple, self-supervised method for magnifying subtle motions in video: given an input video and a magnification factor, we manipulate the video such that its new optical flow is scaled by the desired amount. To train our model, we propose a loss function that estimates the optical flow of the generated video and penalizes how far if deviates from the given magnification factor. Thus, training involves differentiating through a pretrained optical flow network. Since our model is self-supervised, we can further improve its performance through test-time adaptation, by finetuning it on the input video. It can also be easily extended to magnify the motions of only user-selected objects. Our approach avoids the need for synthetic magnification datasets that have been used to train prior learning-based approaches. Instead, it leverages the existing capabilities of off-the-shelf motion estimators. We demonstrate the effectiveness of our method through evaluations of both visual quality and quantitative metrics on a range of real-world and synthetic videos, and we show our method works for both supervised and unsupervised optical flow methods.

연구 동기 및 목표

  • 기존의 학습 기반 운동 확대 방법들이 감독을 위해 대규모 합성 데이터셋이 필요하다는 한계를 해결하기 위해.
  • 기존의 상용 광학 흐름 네트워크를 차분 가능한 감독 신호로 활용하여 맞춤형 훈련 데이터가 필요 없도록 하기 위해.
  • 예측된 광학 흐름에서 목표 확대 요인과의 편차를 페널티로 삼는 손실 함수를 제안함으로써 진짜로 레이블이 없는 비디오에서 자기지도 학습을 가능하게 하기 위해.
  • 세그멘테이션 마스크를 사용하여 사용자 가이드된 개체별 확대와 함께 테스트 시점 적응을 지원하기 위해.

제안 방법

  • 모델은 비디오 프레임 쌍과 확대 요인 α를 입력으로 받아, 광학 흐름을 α 배율로 스케일링한 새로운 프레임 쌍을 생성한다.
  • 차분 가능한 손실 함수는 생성된 비디오의 광학 흐름을 추정하고, 사전 훈련된 광학 흐름 네트워크를 사용하여 입력 흐름의 α 배율과의 편차를 페널티로 삼는다.
  • 훈련 과정에서 광학 흐름 네트워크를 통해 기울기를 역전파하여 이미지 생성 네트워크를 최적화한다.
  • 정규화 손실 함수는 입력 프레임과 생성된 프레임 간의 픽셀 단위 일致성을 장려함으로써 시각적 외관을 유지한다.
  • 테스트 시점 적응은 추론 중에 입력 비디오로 모델을 파인튜닝함으로써 품질 향상을 가능하게 한다.
  • 사용자 제공 세그멘테이션 마스크를 적용하여 특정 영역에 한해 흐름 스케일링을 제한함으로써 개체별 확대를 달성한다.

실험 결과

연구 질문

  • RQ1합성 데이터나 진짜로 확대된 쌍의 정답이 없는 조건에서 운동 확대를 자기지도 학습 방식으로 효과적으로 훈련시킬 수 있는가?
  • RQ2상용 광학 흐름 네트워크가 운동 확대에 대해 신뢰할 수 있고 차분 가능한 감독 신호로 기능할 수 있는가?
  • RQ3운동 정확도와 시각적 품질 측면에서, 이 방법은 감독 기반 베이스라인 및 라그랑주안 왜곡 방법과 비교해 어떻게 성능을 내는가?
  • RQ4테스트 시점 적응이 확대된 비디오의 품질 향상에 얼마나 기여하는가?
  • RQ5이 방법을 사용자가 선택한 개체에 한해 움직임을 확대하도록 확장할 수 있는가?

주요 결과

  • 제안된 방법은 정량적 지표와 시각적 품질 측면에서 모두 기존의 워핑 기반 방법과 감독 학습 접근법을 뛰어넘었으며, 특히 음영과 겹침이 있는 복잡한 시나리오에서 두각을 나타냈다.
  • 합성 비디오에서, 이 방법은 비디오 워핑 최소거리 기반 기준으로 0.61px의 운동 오차와 비디오 워핑 이중선형 기반 기준으로 0.57px의 운동 오차를 기록했으며, 이는 기존 기준보다 유의미하게 낮았다.
  • DeepFillv2 인painting을 사용했을 때, 이 방법은 하위픽셀 테스트 기준으로 0.66x의 확대 오차와 노이즈 테스트 기준으로 0.53x의 확대 오차를 기록했으며, 모든 기준 기반 방법보다 뛰어났다.
  • 테스트 시점 적응을 통해 운동 오차는 비디오 워핑 최소거리 기준에서 0.61px에서 0.53px로 감소했고, 비디오 워핑 이중선형 기준에서 0.57px에서 0.53px로 감소하여 일관된 품질 향상을 입증했다.
  • 어느 정도의 경우에서 기타 줄이나 나뭇가지와 같은 얇은 구조물의 움직임을 성공적으로 확대했지만, 이러한 영역에서 광학 흐름 추정 오류로 인해 가끔 실패하는 경우가 있었다.
  • 실패 사례는 주로 매끄럽거나 얇은 구조물 영역에서 잘못된 광학 흐름 예측가 발생했고, 이로 인해 오류가 확대된 것으로 나타나, 광학 흐름 네트워크의 정확성에 민감함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.