Skip to main content
QUICK REVIEW

[論文レビュー] Zooming SlowMo: An Efficient One-Stage Framework for Space-Time Video Super-Resolution

Xiaoyu Xiang, Yapeng Tian|arXiv (Cornell University)|Apr 15, 2021
Advanced Image Processing Techniques参考文献 64被引用数 7
ひとこと要約

本論文では、ピクセルではなく特徴量を補間することで、低解像度・低フレームレート入力から高解像度・高フレームレート動画を直接再構築する1段階型の空間時間的動画スーパーエンヘンスフレームワーク「Zooming SlowMo」を提案する。可変的特徴量補間と可変的 ConvLSTM を用いて、時間的動きと空間的スーパーエンヘンスを同時に処理し、2段階型SOTA手法と比較して3倍速く、4倍もモデルサイズを小さくした状態で最先端の性能を達成した。

ABSTRACT

In this paper, we address the space-time video super-resolution, which aims at generating a high-resolution (HR) slow-motion video from a low-resolution (LR) and low frame rate (LFR) video sequence. A naïve method is to decompose it into two sub-tasks: video frame interpolation (VFI) and video super-resolution (VSR). Nevertheless, temporal interpolation and spatial upscaling are intra-related in this problem. Two-stage approaches cannot fully make use of this natural property. Besides, state-of-the-art VFI or VSR deep networks usually have a large frame reconstruction module in order to obtain high-quality photo-realistic video frames, which makes the two-stage approaches have large models and thus be relatively time-consuming. To overcome the issues, we present a one-stage space-time video super-resolution framework, which can directly reconstruct an HR slow-motion video sequence from an input LR and LFR video. Instead of reconstructing missing LR intermediate frames as VFI models do, we temporally interpolate LR frame features of the missing LR frames capturing local temporal contexts by a feature temporal interpolation module. Extensive experiments on widely used benchmarks demonstrate that the proposed framework not only achieves better qualitative and quantitative performance on both clean and noisy LR frames but also is several times faster than recent state-of-the-art two-stage networks. The source code is released in https://github.com/Mukosame/Zooming-Slow-Mo-CVPR-2020 .

研究の動機と目的

  • 空間時間的動画スーパーエンヘンス(STVSR)における2段階型手法の限界を解消すること。2段階型手法は、動画フレーム補間(VFI)と動画スーパーエンヘンス(VSR)を別々に処理するため、非効率的で最適でない性能となる。
  • STVSRにおける時間的補間と空間的拡大の相関関係を打ち破り、両者を統合した1つのエンドツーエンドで学習可能なフレームワークに統合すること。
  • 計算コストとモデルサイズを低減しながら、特に動きぼけやノイズなどの困難な状況下でも視覚的品質を維持または向上させること。
  • 再構築されたHR動画シーケンスにおける時間的整合性、特に直接的なLR監視が得られない中間フレームの整合性を向上させること。

提案手法

  • 入力のLR、LFRシーケンスから直接HRフレームを予測する1段階型STVSRフレームワークを提案。明示的なピクセルレベルの欠落LRフレーム補間を回避する。
  • 学習可能なオフセットを用いて、LRフレーム特徴量の時間的補間を学習する可変的特徴量補間モジュールを導入。局所的な時間的コンテキストと動きパターンを捉える。
  • 時間的コンテキストをグローバルに統合しながら、フレーム間で動きに適応した特徴量アライメントを実行する、新規の可変的 ConvLSTM を採用。
  • 特徴量補間をガイドするためのサイクル補間損失を用い、再構築精度と動きの整合性を向上。
  • 補間・統合された特徴量に対して深層スーパーエンヘンスネットワークを適用し、最終的なHRフレームを再構築。
  • 特にノイズが多い状況下でも特徴量補間の性能を強化するため、中間ガイド損失を適用。

実験結果

リサーチクエスチョン

  • RQ1時間的補間と空間的スーパーエンヘンスを同時にモデル化することで、1段階型フレームワークが2段階型STVSR手法を精度と効率の両面で上回れるか?
  • RQ2ピクセルレベルの補間と比較して、特徴量レベルの時間的補間は、動きの取り扱いと視覚的品質においてどのように異なるか?
  • RQ3可変的 ConvLSTM がSTVSRにおける時間的整合性と動きのロバスト性をどの程度向上できるか?
  • RQ4提案されたサイクル補間損失は、特徴量補間および全体のSTVSR性能を向上させるか?
  • RQ5ノイズや圧縮などの実世界の劣化要因に対して、モデルはどの程度の性能を示すか?

主な発見

  • Zooming SlowMo は、クリーンな環境とノイズあり環境の両方のSTVSRベンチマークで最先端の性能を達成。最近の2段階型手法(DAIN+EDVR)をPSNRとSSIMの両面で上回った。
  • DAIN+EDVRベースラインと比較して、推論速度が3倍以上速く、モデルサイズが4倍も小さく、優れた効率性を示した。
  • QF=10の圧縮を施したVid4データセットでは、ガイドなしでPSNR 22.03、SSIM 0.5216を維持し、ガイド損失を適用するとわずかにPSNR 21.99、SSIM 0.5204に改善され、ノイズ耐性が確認された。
  • アブレーションスタディにより、ガイド付き特徴量補間が動き処理を向上させ、特に高運動領域でぼやけを軽減しエッジの鋭さを向上させた。
  • 改善にもかかわらず、時間的整合性の問題は依然として存在する。中間フレーム(例:t)は隣接フレーム(t−1, t+1)よりもぼやけていることが判明し、再構築の難易度に内在的な不均衡があることが示唆された。
  • アニメーションされた手などの重度の物体変形に対しては、モデルが苦戦し、大きな幾何的変化が原因で再構築がぼやけることが判明。これにより、より変形に強いアライメント手法の必要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。