Skip to main content
QUICK REVIEW

[论文解读] Video Super-Resolution with Recurrent Structure-Detail Network

Takashi Isobe, Xu Jia|arXiv (Cornell University)|Aug 2, 2020
Advanced Image Processing Techniques参考文献 31被引用 15
一句话总结

该论文提出了一种循环视频超分辨率网络RSDN,通过两流循环模块将帧分解为结构和细节分量分别处理。该方法通过引入隐状态自适应模块,增强了对外观变化和误差累积的鲁棒性,实现了更高的效率,在多个基准测试中达到最先进性能,且显著更快。

ABSTRACT

Most video super-resolution methods super-resolve a single reference frame with the help of neighboring frames in a temporal sliding window. They are less efficient compared to the recurrent-based methods. In this work, we propose a novel recurrent video super-resolution method which is both effective and efficient in exploiting previous frames to super-resolve the current frame. It divides the input into structure and detail components which are fed to a recurrent unit composed of several proposed two-stream structure-detail blocks. In addition, a hidden state adaptation module that allows the current frame to selectively use information from hidden state is introduced to enhance its robustness to appearance change and error accumulation. Extensive ablation study validate the effectiveness of the proposed modules. Experiments on several benchmark datasets demonstrate the superior performance of the proposed method compared to state-of-the-art methods on video super-resolution.

研究动机与目标

  • 开发一种高效且有效的循环视频超分辨率方法,利用长时序依赖关系,而无需显式运动估计。
  • 解决滑动窗口方法的局限性,后者存在冗余计算和高延迟问题。
  • 通过实现隐状态信息的选择性使用,提升循环视频超分辨率在外观变化和误差累积下的鲁棒性。
  • 与现有最先进方法相比,实现重建质量与推理速度之间更好的平衡。

提出的方法

  • 使用可学习的分解模块将输入视频帧分解为结构和细节分量。
  • 结构和细节分量通过共享权重的两个并行、交错的流在双流结构-细节模块(SD模块)中处理。
  • 由多个SD模块组成的循环单元以流式方式处理序列,跨帧保持隐状态。
  • 隐状态自适应模块计算当前帧与隐状态各通道之间的相关性,以实现对相关历史特征的选择性关注。
  • 通过可学习滤波器和时间维度上的特征聚合,隐式建模运动,避免显式运动补偿。
  • 网络采用结合L1损失和感知损失的联合损失进行训练,以增强结构保真度和视觉质量。

实验结果

研究问题

  • RQ1循环视频超分辨率网络是否能在保持高推理效率的同时,性能优于滑动窗口方法?
  • RQ2在共享循环架构中,如何有效分离并处理结构与细节分量以提升重建质量?
  • RQ3隐状态自适应是否能提升长期视频超分辨率中对外观变化和误差累积的鲁棒性?
  • RQ4两流结构-细节设计在多大程度上能增强超分辨率视频中的高频细节恢复与边缘锐度?

主要发现

  • 在Vid4数据集上,RSDN使用5个SD模块时,Y通道PSNR达到27.61 dB,优于大多数先前方法。
  • 使用9个SD模块时,RSDN在Vid4数据集上的Y通道PSNR达到27.92 dB,相比5模块版本提升0.31 dB,且FLOP增加极少。
  • 在UDM10数据集上,RSDN 9-128达到最先进性能,PSNR相比PFNL高出0.61 dB,且速度提升3倍。
  • 在Vimeo-90K-T数据集上,RSDN 9-128的速度是EDVR-L的6倍,且PSNR仅略有落后。
  • 定性结果表明,RSDN生成的边缘更清晰,细节更丰富,且伪影更少,优于DUF和RBPN等方法。
  • 时间一致性分析表明,RSDN生成的时序轮廓更平滑、更锐利,表明运动一致性得到改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。