[论文解读] Zooming SlowMo: An Efficient One-Stage Framework for Space-Time Video Super-Resolution
该论文提出Zooming SlowMo,一种单阶段时空视频超分(STVSR)框架,通过插值特征而非像素,直接从低分辨率、低帧率输入重建高分辨率、高帧率视频。该方法结合可变形特征插值与可变形ConvLSTM,联合处理时序运动与空间超分,实现SOTA性能,且推理速度比两阶段SOTA方法快3倍,模型参数量小4倍。
In this paper, we address the space-time video super-resolution, which aims at generating a high-resolution (HR) slow-motion video from a low-resolution (LR) and low frame rate (LFR) video sequence. A naïve method is to decompose it into two sub-tasks: video frame interpolation (VFI) and video super-resolution (VSR). Nevertheless, temporal interpolation and spatial upscaling are intra-related in this problem. Two-stage approaches cannot fully make use of this natural property. Besides, state-of-the-art VFI or VSR deep networks usually have a large frame reconstruction module in order to obtain high-quality photo-realistic video frames, which makes the two-stage approaches have large models and thus be relatively time-consuming. To overcome the issues, we present a one-stage space-time video super-resolution framework, which can directly reconstruct an HR slow-motion video sequence from an input LR and LFR video. Instead of reconstructing missing LR intermediate frames as VFI models do, we temporally interpolate LR frame features of the missing LR frames capturing local temporal contexts by a feature temporal interpolation module. Extensive experiments on widely used benchmarks demonstrate that the proposed framework not only achieves better qualitative and quantitative performance on both clean and noisy LR frames but also is several times faster than recent state-of-the-art two-stage networks. The source code is released in https://github.com/Mukosame/Zooming-Slow-Mo-CVPR-2020 .
研究动机与目标
- 为解决两阶段STVSR方法在时空视频超分中的局限性,即分别执行视频帧插值(VFI)与视频超分(VSR),导致效率低下且性能不优。
- 通过将时序插值与空间上采样统一为单一端到端可训练框架,克服两者之间的相互依赖性。
- 在保持或提升视觉质量的同时,降低计算成本与模型大小,尤其在运动模糊与噪声等挑战性条件下表现更优。
- 提升重建高分辨率视频序列的时序一致性,尤其针对缺乏直接低分辨率监督的中间帧。
提出的方法
- 提出一种单阶段STVSR框架,跳过对缺失低分辨率帧的显式像素级插值,直接从输入的低分辨率、低帧率序列预测高分辨率帧。
- 引入可变形特征插值模块,学习通过可学习偏移量进行低分辨率帧特征的时序插值,捕捉局部时序上下文与运动模式。
- 采用新型可变形ConvLSTM,聚合全局时序上下文,同时在帧间实现运动感知的特征对齐。
- 使用循环插值损失引导特征插值,提升重建精度与时序一致性。
- 通过深度超分网络对插值与聚合后的特征进行最终高分辨率帧重建。
- 通过引导损失在中间阶段施加监督,强化特征插值性能,尤其在噪声条件下表现更优。
实验结果
研究问题
- RQ1单阶段框架是否能通过联合建模时序插值与空间超分,在准确率与效率上均超越两阶段STVSR方法?
- RQ2在运动处理与视觉质量方面,特征级时序插值与像素级插值相比有何差异?
- RQ3可变形ConvLSTM在多大程度上能提升STVSR中的时序一致性和运动鲁棒性?
- RQ4所提出的循环插值损失是否能增强特征插值与整体STVSR性能?
- RQ5该模型在真实世界退化(如噪声与压缩)下的表现如何?
主要发现
- Zooming SlowMo在干净与噪声STVSR基准上均达到SOTA性能,PSNR与SSIM均优于近期两阶段方法(如DAIN+EDVR)。
- 该模型推理速度比DAIN+EDVR基线快3倍以上,模型参数量小4倍,展现出卓越的效率优势。
- 在QF=10压缩条件下的Vid4数据集上,无引导时PSNR为22.03,SSIM为0.5216;加入引导损失后分别提升至21.99与0.5204,表明对噪声具有强鲁棒性。
- 消融实验证实,引导特征插值显著改善运动处理能力,尤其在高运动区域减少模糊,提升边缘锐度。
- 尽管性能提升,时序不一致性仍是问题——中间帧(如t)比相邻帧(t−1, t+1)更模糊,表明重建难度存在固有失衡。
- 模型在严重形变(如动画手部)情况下表现不佳,大尺度几何变化导致重建模糊,凸显对形变鲁棒对齐机制的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。