Skip to main content
QUICK REVIEW

[논문 리뷰] Enhanced Quadratic Video Interpolation

Yihao Liu, Liangbin Xie|arXiv (Cornell University)|2020. 09. 10.
Advanced Image Processing Techniques참고 문헌 24인용 수 5
한 줄 요약

이 논문은 최소 제곱법을 사용한 보정된 이차 유량 예측(RQFP)을 통해 원래 QVI 프레임워크를 개선한 향상된 이차 영상 보간(EQVI) 방법을 제안한다. 이는 고차원 특징 융합을 위한 잔차적 맥락 합성 네트워크(RCSN)와 학습 가능한 다중 해상도 융합 네트워크(MS-Fusion)를 포함한다. EQVI는 최신 기준 성능(SOTA)을 달성하여 AIM2020 영상 시간 초해상도 챌린지에서 1등을 차지했으며, QVI 대비 0.38dB의 PSNR 향상을 기록했고, REDS_VTSR 데이터셋에서 최근의 모든 SOTA 방법들을 능가했다.

ABSTRACT

With the prosperity of digital video industry, video frame interpolation has arisen continuous attention in computer vision community and become a new upsurge in industry. Many learning-based methods have been proposed and achieved progressive results. Among them, a recent algorithm named quadratic video interpolation (QVI) achieves appealing performance. It exploits higher-order motion information (e.g. acceleration) and successfully models the estimation of interpolated flow. However, its produced intermediate frames still contain some unsatisfactory ghosting, artifacts and inaccurate motion, especially when large and complex motion occurs. In this work, we further improve the performance of QVI from three facets and propose an enhanced quadratic video interpolation (EQVI) model. In particular, we adopt a rectified quadratic flow prediction (RQFP) formulation with least squares method to estimate the motion more accurately. Complementary with image pixel-level blending, we introduce a residual contextual synthesis network (RCSN) to employ contextual information in high-dimensional feature space, which could help the model handle more complicated scenes and motion patterns. Moreover, to further boost the performance, we devise a novel multi-scale fusion network (MS-Fusion) which can be regarded as a learnable augmentation process. The proposed EQVI model won the first place in the AIM2020 Video Temporal Super-Resolution Challenge.

연구 동기 및 목표

  • 큰 또는 복잡한 운동 상황에서 지속적인 잔상, 가로지르는 영상, 운동 정확도 부족 문제를 해결하기 위해.
  • 운동 추정 및 특징 활용을 향상시켜 이차 영상 보간(QVI) 방법을 개선하기 위해.
  • 형식 개선, 맥락 특징 학습, 다중 해상도 융합을 통해 성능을 향상시키는 보완적이고 모듈식 프레임워크를 개발하기 위해.
  • AIM2020 챌린지를 통해 검증된 영상 시간 초해상도에서 최신 기준 성능(SOTA)을 달성하기 위해.

제안 방법

  • 최소 제곱법을 사용한 보정된 이차 유량 예측(RQFP) 공식을 제안하여, 불완전한 데이터 샘플에서 발생하는 보간 오차를 보정함으로써 이차 운동 가정 하에서 운동 유량 정확도를 향상시킨다.
  • 사전 왜곡된 특징, 원본 이미지, 에지 맵을 고차원 공간에서 융합하는 잔차적 맥락 합성 네트워크(RCSN)를 도입하여 맥락 이해도를 향상시키고 잔상 문제를 감소시킨다.
  • 다른 해상도 수준의 출력을 결합하는 학습 가능한 다중 해상도 융합 네트워크(MS-Fusion)를 설계하여 후처리 보정 기능을 수행함으로써 PSNR를 향상시키지만, 약간의 SSIM 감소를 수반한다.
  • 순차적 훈련 전략을 적용: 먼저 QVI 베이스라인을 훈련하고, 이를 바탕으로 RCSN로 미세조정한 후, RQFP를 적용한 다음 최종적으로 MS-Fusion을 적용하여 성능을 극대화한다.
  • PSNR와 SSIM의 균형을 맞추기 위해 L1 손실과 라플라시안(L_lap) 손실을 조합한 하이브리드 손실 함수를 사용하며, 제거 실험을 통해 그 효과를 검증한다.
  • 맥락 모델링을 위해 사전 추출한 ResNet-18 특징을 활용하고, 최신 기술인 ScopeFlow 등의 광학 유량 네트워크에서 추출한 유량 정보를 통합하여 운동 추정 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1최소 제곱 기반의 보정된 이차 유량 예측 공식은 영상 보간에서 운동 추정 오차를 줄일 수 있는가?
  • RQ2고차원 맥락 특징은 복잡한 운동 상황에서 시각적 품질 향상과 잔상 감소에 얼마나 기여하는가?
  • RQ3학습 가능한 다중 해상도 융합 전략은 단일 해상도 예측을 초월해 PSNR를 추가로 향상시킬 수 있는가?
  • RQ4RQFP, RCSN, MS-Fusion와 같은 개별 구성 요소들이 결합되었을 때 성능 향상에 기여하는 정도는 어떠한가?

주요 결과

  • EQVI는 AIM2020 영상 시간 초해상도 챌린지에서 가장 높은 PSNR를 기록했으며, 2위와 3위 참가자들보다 각각 0.08dB와 0.5dB 높은 성능을 보였다.
  • 전체 EQVI 모델은 REDS_VTSR 데이터셋에서 원래 QVI 베이스라인 대비 PSNR가 0.38dB 향상되어 뚜렷한 성능 향상을 입증했다.
  • RQFP 구성 요소만으로도 RCSN 이후 미세조정 시 PSNR가 0.03dB 향상되어 운동 유량 추정 정확도 향상에 효과적임을 확인했다.
  • RCSN에 에지 및 이미지 특징을 통합함으로써 PSNR가 24.916dB에서 24.927dB로 향상되어 다중 모odal 입력이 맥락 모델링을 향상시킨다는 것을 보여주었다.
  • MS-Fusion 모듈은 PSNR를 향상시켰지만 약간의 SSIM 감소를 유발하여 지표 정확도와 시각적 품질 간의 상충 관계를 보여주었다.
  • L1과 라플라시안 손실의 조합이 가장 균형 잡힌 성능을 보였으며, PSNR 24.775, SSIM 0.717를 기록하여 단일 손실 기반 베이스라인을 모두 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.