Skip to main content
QUICK REVIEW

[论文解读] Temporal Modulation Network for Controllable Space-Time Video Super-Resolution

Gang Xu, Jun Xu|arXiv (Cornell University)|Apr 21, 2021
Advanced Image Processing Techniques参考文献 47被引用 4
一句话总结

该论文提出了一种时空视频超分的时序调制网络(TMNet),通过时序调制模块(TMB)实现任意中间帧的插值,该模块利用时序参数动态调节可变形卷积核,实现可控的时空视频超分。方法通过局部时序特征对比(LFC)模块融合短期运动线索,通过双向可变形ConvLSTM融合长期上下文信息,在三个基准数据集上达到最先进性能,Vimeo-90K Fast数据集上PSNR高达37.04dB。

ABSTRACT

Space-time video super-resolution (STVSR) aims to increase the spatial and temporal resolutions of low-resolution and low-frame-rate videos. Recently, deformable convolution based methods have achieved promising STVSR performance, but they could only infer the intermediate frame pre-defined in the training stage. Besides, these methods undervalued the short-term motion cues among adjacent frames. In this paper, we propose a Temporal Modulation Network (TMNet) to interpolate arbitrary intermediate frame(s) with accurate high-resolution reconstruction. Specifically, we propose a Temporal Modulation Block (TMB) to modulate deformable convolution kernels for controllable feature interpolation. To well exploit the temporal information, we propose a Locally-temporal Feature Comparison (LFC) module, along with the Bi-directional Deformable ConvLSTM, to extract short-term and long-term motion cues in videos. Experiments on three benchmark datasets demonstrate that our TMNet outperforms previous STVSR methods. The code is available at https://github.com/CS-GangXu/TMNet.

研究动机与目标

  • 为解决现有STVSR方法仅能生成预定义中间帧的局限性,限制其在灵活广播场景中的应用。
  • 通过将可控时序调制引入可变形卷积,提升特征插值精度,实现任意帧率生成。
  • 通过融合短期与长期时序线索,增强运动建模能力,提升空间对齐与重建质量。
  • 实现高质量、时序一致的视频超分,减少伪影并提升感知质量。

提出的方法

  • 提出一种时序调制模块(TMB),将时序参数t转换为调制向量vt,以控制可变形卷积核采样,实现任意中间帧的插值。
  • 设计一种局部时序特征对比(LFC)模块,用于提取并比较多帧特征,实现准确的短期运动建模与空间对齐。
  • 采用双向可变形ConvLSTM,捕捉整个视频序列中的长期运动变化。
  • 实施两阶段时序特征融合策略:首先通过LFC进行局部融合,再通过全局特征融合(GFF)进行全局融合,有效结合短期与长期线索。
  • 在Pixel-Shuffle层之前,将高分辨率特征𝒮𝐻与初始低分辨率特征𝒮𝐿进行融合,以保留运动与结构细节。
  • 在Vimeo-90K、Adobe240fps与Vid4数据集上,使用L1损失进行端到端训练。

实验结果

研究问题

  • RQ1深度学习模型能否在时空视频超分中实现任意中间帧的插值,而非仅限于固定帧率输出?
  • RQ2如何有效建模相邻帧的运动线索,以提升特征插值与重建质量?
  • RQ3结合局部与全局时序特征融合对STVSR性能有何影响?
  • RQ4同时引入高分辨率与初始低分辨率特征是否能提升最终重建质量?

主要发现

  • TMNet在三个基准数据集上达到最先进性能,Vimeo-90K Fast数据集上PSNR达37.04dB,优于先前方法。
  • 消融实验表明LFC模块至关重要:在Vid4上移除后性能下降0.07dB,在Vimeo-Fast上最高下降0.17dB。
  • 引入非线性层的TMB略优于线性变体,在Adobe240fps上分别达到26.95dB与26.93dB,表明非线性在时序调制中的优势。
  • 将高质量特征𝒮𝐻与初始特征𝒮𝐿融合,可在各数据集上提升PSNR 0.07–0.12dB,验证了特征拼接策略的有效性。
  • 两阶段融合(LFC → GFF)至关重要:若顺序颠倒(GFF → LFC),由于长期信号噪声过大,导致训练崩溃。
  • TMNet支持在任意期望帧率下灵活插值,例如生成间隔0.3、0.5与0.7处的帧,而先前方法受限于固定中间帧。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。