Skip to main content
QUICK REVIEW

[논문 리뷰] Across Scales & Across Dimensions: Temporal Super-Resolution using Deep Internal Learning

Liad Pollak Zuckerman, Eyal Naor|arXiv (Cornell University)|2020. 03. 19.
Advanced Image Processing Techniques참고 문헌 24인용 수 6
한 줄 요약

이 논문은 입력 저프레임 비디오에서 내부 예제만을 사용하여 비디오 전용 컨볼루션 신경망(CNN)을 훈련하는 딥 인터널 러닝을 활용한 제로샷 시간 초해상도(TSR) 방법을 제안한다. 시간-공간 패치를 다양한 척도와 공간-시간 차원 간(예: 공간과 시간를 교환함) 반복적으로 활용함으로써 상실된 고주기 성분을 복원하여 운동 블러와 앨리어싱을 효과적으로 제거한다. 이는 외부 데이터셋에서 훈련된 지도 학습 방법보다도 우수한 성능을 발휘한다.

ABSTRACT

When a very fast dynamic event is recorded with a low-framerate camera, the resulting video suffers from severe motion blur (due to exposure time) and motion aliasing (due to low sampling rate in time). True Temporal Super-Resolution (TSR) is more than just Temporal-Interpolation (increasing framerate). It can also recover new high temporal frequencies beyond the temporal Nyquist limit of the input video, thus resolving both motion-blur and motion-aliasing effects that temporal frame interpolation (as sophisticated as it maybe) cannot undo. In this paper we propose a "Deep Internal Learning" approach for true TSR. We train a video-specific CNN on examples extracted directly from the low-framerate input video. Our method exploits the strong recurrence of small space-time patches inside a single video sequence, both within and across different spatio-temporal scales of the video. We further observe (for the first time) that small space-time patches recur also across-dimensions of the video sequence - i.e., by swapping the spatial and temporal dimensions. In particular, the higher spatial resolution of video frames provides strong examples as to how to increase the temporal resolution of that video. Such internal video-specific examples give rise to strong self-supervision, requiring no data but the input video itself. This results in Zero-Shot Temporal-SR of complex videos, which removes both motion blur and motion aliasing, outperforming previous supervised methods trained on external video datasets.

연구 동기 및 목표

  • 낮은 프레임 레이트와 긴 노출 시간으로 인해 발생하는 운동 블러와 운동 앨리어싱을 다루는 프레임 보간 기법의 한계를 해결하기 위해.
  • 입력 비디오의 뉴퀴스트 한계를 초월하는 고주기 성분을 복원하는 진정한 시간 초해상도(TSR) 방법을 개발하기 위해.
  • 외부 데이터셋이 필요 없이 입력 비디오 자체만으로 훈련 가능한 제로샷 TSR을 가능하게 하기 위해.
  • 자기 지도 학습을 위해 공간-시간 소형 패치의 반복성(내부 및 공간-시간 차원 간)을 탐색하고 활용하기 위해.

제안 방법

  • 입력 저프레임 비디오에서 추출한 내부 예제만을 사용하여 비디오 전용 컨volutional 신경망(CNN)을 훈련한다.
  • 동일한 비디오 시퀀스 내에서 더 굵은 공간-시간 척도에서 훈련 예제를 추출한다(내차원 패치).
  • 공간과 시간 차원을 교환함으로써 교차 차원 패치 증강 기법을 도입하여 높은 공간 해상도를 활용해 시간 초해상도를 향상시킨다.
  • 내부 예측에서 고주기 해상도 비디오를 재구성하기 위해 다중 척도 역재구성 프레임워크를 사용한다.
  • 다양한 척도와 차원 간에 소형 공간-시간 패치의 반복성을 기반으로 한 자기 지도 학습 손실을 적용한다.
  • 각 비디오에 맞는 적응형 설정을 통해 내차원 대비 교차 차원 훈련 예제의 성능을 비교하기 위한 분석 연구를 수행한다.

실험 결과

연구 질문

  • RQ1스케일과 차원 간에 공간-시간 패치의 내부 반복성은 시간 초해상도를 위한 효과적인 자기 지도 학습을 가능하게 하는가?
  • RQ2공간과 시간을 교환한 교차 차원 패치 반복성은 내차원 반복성보다 더 유용한 훈련 신호를 제공하는가?
  • RQ3비디오 전용 내부 학습 접근법이 복잡한 비정형 운동에 대해 외부에서 훈련된 지도 학습 방법보다 우수한 성능을 내는가?
  • RQ4내부 학습이 비디오 보간이 실패할 경우에도 운동 블러와 운동 앨리어싱을 동시에 복원할 수 있는가?
  • RQ5다양한 비디오 특성(예: 정형 대비 비정형 운동)은 내부 훈련 데이터의 최적 설정(내차원 대비 교차 차원)에 어떤 영향을 미치는가?

주요 결과

  • 이 방법은 특히 비정형 운동 영역(예: 불꽃, 물, 후라후프)에서 복잡한 동적 장면에서 최첨단 지도 학습 방법인 Flawless보다 뛰어난 성능을 발휘한다.
  • 평균적으로 교차 차원 패치 증강은 내차원 훈련만을 사용할 경우 대비 PSNR를 0.28 dB, SSIM을 0.002, LPIPS를 0.002 향상시킨다.
  • 각 비디오에 대해 최적 설정(내차원, 교차 차원, 또는 둘 다)을 적용한 결과, PSNR는 34.33 dB, SSIM은 0.965, LPIPS는 0.032를 기록하여 추가적인 향상이 이루어졌다.
  • 큰 균일한 운동을 보이는 비디오(예: 낙하하는 다이아몬드)는 교차 차원 훈련에서 더 큰 이점을 얻었고, 점진적 또는 회전 운동을 보이는 비디오는 내차원 예제를 선호했다.
  • 실제 비디오(예: 회전하는 팬, 고속 이동하는 바퀴)에서 운동 앨리어싱과 블러를 성공적으로 복원하여, 기존 보간 기법이 실패한 경우에도 정확한 운동 방향과 선명함을 복원했다.
  • 분석 연구 결과, 평균적으로 교차 차원 패치 반복성이 내차원 반복성보다 더 정보가 풍부한 것으로 확인되었지만, 최적 성능을 내기 위해서는 비디오 특성에 맞는 설정 조정이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.