Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Deep Blind Video Super-Resolution

Haoran Bai, Jinshan Pan|arXiv (Cornell University)|Jan 19, 2022
Advanced Image Processing Techniques被引用 5
一句话总结

本文提出了一种自监督深度学习方法,用于盲视频超分辨率,该方法仅从低分辨率(LR)输入中联合估计模糊核和高分辨率(HR)视频帧,而无需依赖真实HR视频的监督。通过利用图像形成模型生成辅助配对数据,并引入光流模块,该方法实现了端到端训练,在基准数据集和真实视频上均取得了最先进性能,即使在缺乏HR监督的情况下,其结果也与有监督方法相当。

ABSTRACT

Existing deep learning-based video super-resolution (SR) methods usually depend on the supervised learning approach, where the training data is usually generated by the blurring operation with known or predefined kernels (e.g., Bicubic kernel) followed by a decimation operation. However, this does not hold for real applications as the degradation process is complex and cannot be approximated by these idea cases well. Moreover, obtaining high-resolution (HR) videos and the corresponding low-resolution (LR) ones in real-world scenarios is difficult. To overcome these problems, we propose a self-supervised learning method to solve the blind video SR problem, which simultaneously estimates blur kernels and HR videos from the LR videos. As directly using LR videos as supervision usually leads to trivial solutions, we develop a simple and effective method to generate auxiliary paired data from original LR videos according to the image formation of video SR, so that the networks can be better constrained by the generated paired data for both blur kernel estimation and latent HR video restoration. In addition, we introduce an optical flow estimation module to exploit the information from adjacent frames for HR video restoration. Experiments show that our method performs favorably against state-of-the-art ones on benchmarks and real-world videos.

研究动机与目标

  • 解决有监督视频超分辨率方法依赖预设模糊核的合成数据集所带来的局限性,这些数据集在真实世界视频上泛化能力较差。
  • 开发一种自监督学习框架,消除对成对HR-LR视频数据的依赖,仅使用真实LR视频即可进行训练。
  • 通过仅使用LR输入视频作为监督,联合估计模糊核与潜在HR帧,提升HR视频恢复的准确性。
  • 通过集成光流估计模块,利用相邻帧之间的运动一致性,增强帧间特征的一致性。
  • 在真实世界视频上验证该方法的有效性,此时真实HR数据不可用。

提出的方法

  • 该方法将视频超分辨率建模为自监督学习问题,仅使用LR输入视频作为监督信号,避免对成对HR数据的依赖。
  • 利用视频超分辨率的图像形成模型,从原始LR视频中生成辅助配对数据,从而约束网络学习到真实的HR视频和模糊核估计。
  • 对估计的模糊核施加稀疏先验,以防止训练过程中出现平凡解。
  • 集成光流估计模块,利用相邻帧之间的运动一致性,提升HR视频恢复质量。
  • 通过重建损失在端到端训练中比较原始LR帧与从估计HR帧和模糊核合成的LR帧。
  • 该方法支持使用非参考指标(如NIQE)对真实退化视频进行在线微调,从而在无真实标签监督的情况下提升泛化能力。

实验结果

研究问题

  • RQ1自监督学习框架能否在完全无成对HR-LR视频数据的情况下,有效解决盲视频超分辨率问题?
  • RQ2如何仅从LR视频中有效生成辅助配对数据,以约束HR视频与模糊核的估计?
  • RQ3联合估计模糊核与HR视频帧是否能优于假设已知或预设模糊核的方法?
  • RQ4在真实世界场景中,引入光流是否能提升重建HR视频帧的质量?
  • RQ5当缺乏真实HR视频时,所提方法能否实现与有监督方法相当的性能?

主要发现

  • 在SEDS和SPMCS等基准数据集上,该方法取得了最先进性能,在SPMCS上无HR监督下PSNR达27.77,SSIM达0.8184。
  • 在真实世界视频上,经在线微调后,该方法在非参考指标NIQE上得分12.483,优于使用EDVR等有监督基线方法的表现。
  • 该方法的FLOPs值为754.01G,显著低于EDVR的1480.57G,表明其在保持强大性能的同时具备高效率。
  • 使用真实退化视频进行在线微调可提升主观视觉质量,视觉对比与NIQE得分均证实了该方法在真实世界条件下的适应能力。
  • 当使用HR监督进行训练时,该方法达到PSNR 27.99与SSIM 0.8346,表明即使在缺乏此类监督时,其性能也能与有监督方法相当或近乎相当。
  • 消融实验表明,辅助数据生成与稀疏核正则化相结合,能有效防止平凡解并提升重建精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。