Skip to main content
QUICK REVIEW

[论文解读] Space-Time-Aware Multi-Resolution Video Enhancement

Muhammad Haris, Greg Shakhnarovich|arXiv (Cornell University)|Mar 30, 2020
Advanced Image Processing Techniques参考文献 57被引用 4
一句话总结

本文提出STARnet,一种用于联合时空超分辨率(ST-SR)的深度学习框架,可同时提升视频在空间和时间维度上的分辨率。通过利用多分辨率特征学习中空间与时间之间的相互依赖关系,以及从低分辨率特征到高分辨率特征的直接跳跃连接,STARnet在多个基准测试中实现了ST-SR、S-SR和T-SR任务的最先进性能,显著优于顺序或独立的方法。

ABSTRACT

We consider the problem of space-time super-resolution (ST-SR): increasing spatial resolution of video frames and simultaneously interpolating frames to increase the frame rate. Modern approaches handle these axes one at a time. In contrast, our proposed model called STARnet super-resolves jointly in space and time. This allows us to leverage mutually informative relationships between time and space: higher resolution can provide more detailed information about motion, and higher frame-rate can provide better pixel alignment. The components of our model that generate latent low- and high-resolution representations during ST-SR can be used to finetune a specialized mechanism for just spatial or just temporal super-resolution. Experimental results demonstrate that STARnet improves the performances of space-time, spatial, and temporal video super-resolution by substantial margins on publicly available datasets.

研究动机与目标

  • 为解决现有超分辨率方法将空间和时间上采样独立处理的局限性。
  • 开发一种统一的深度学习框架,联合优化空间和时间超分辨率以提升性能。
  • 利用高分辨率空间细节与高帧率运动信息之间的互补关系,增强视频重建质量。
  • 通过微调同一模型实现迁移学习,用于独立的空间或时间超分辨率任务。
  • 证明在多分辨率下联合学习可提升大范围和细微运动估计的准确性。

提出的方法

  • STARnet采用多分辨率编码器-解码器架构,在低分辨率和高分辨率时空表示中学习特征。
  • 网络通过从低分辨率输入到高分辨率输出的直接跳跃连接(图1中的紫色箭头),实现ST-SR的端到端联合优化。
  • 通过多分辨率间的侧向连接联合优化空间和时间特征,提升运动估计与重建保真度。
  • 模型利用光流和残差学习在上采样过程中改善对齐与特征优化。
  • 共享主干网络支持对独立S-SR或T-SR任务进行微调,使模型继承ST-SR感知的表征。
  • 框架支持$4\times$空间和$2\times$时间上采样,消融实验验证了多分辨率学习的贡献。

实验结果

研究问题

  • RQ1联合学习空间与时间超分辨率是否能超越顺序或独立处理方式,实现更优的视频重建?
  • RQ2多分辨率特征学习如何增强对视频中大范围与细微运动的建模能力?
  • RQ3与级联方法相比,从低分辨率到高分辨率的直接跳跃连接在多大程度上提升了ST-SR性能?
  • RQ4单个ST-SR模型是否可通过有效微调实现独立S-SR或T-SR任务并获得性能提升?
  • RQ5利用高分辨率空间细节是否能改善时间插值,反之亦然?

主要发现

  • STARnet在Vimeo90K数据集上实现ST-SR的PSNR为39.13,SSIM为0.991,优于RBPN与DAIN的最佳组合0.38dB。
  • STAR-S(微调用于S-SR)在Vimeo90K上相比DBPN提升1.19dB,相比DBPN-MI提升0.87dB,相比RBPN提升0.55dB。
  • STAR-T$_{\text{HR}}$在原始分辨率下实现T-SR的最先进性能,相比ToFlow和DAIN,纹理更清晰,运动区域模糊更少。
  • STAR-T$_{\text{LR}}$(在低分辨率输入上微调)在细微运动插值任务中优于STAR-T$_{\text{HR}}$与SOTA方法,在S-LR数据集上实现39.30的PSNR与0.991的SSIM。
  • 视觉结果表明,与ToFlow和DAIN相比,STARnet产生的伪影和模糊更少,尤其在运动区域更优,如图7中红箭头所示。
  • 在多分辨率下的联合学习使大范围运动(在S-LR上)与细微运动(在S-HR上)的估计均更准确,解决了单分辨率方法的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。