Skip to main content
QUICK REVIEW

[论文解读] VESR-Net: The Winning Solution to Youku Video Enhancement and Super-Resolution Challenge

Jiale Chen, Xu Tan|arXiv (Cornell University)|Mar 4, 2020
Advanced Image Processing Techniques参考文献 20被引用 14
一句话总结

VESR-Net 是一种用于视频增强与超分辨率的神经网络,引入了独立的非局部模块以实现高效的跨帧特征融合,并采用通道注意力残差块(CARB)以提升特征重建质量。该方法在 Youku-VESR 挑战赛中表现最佳,相较于 EDVR 实现了 0.41 dB 的 PSNR 提升,且具有更优的效率。

ABSTRACT

This paper introduces VESR-Net, a method for video enhancement and super-resolution (VESR). We design a separate non-local module to explore the relations among video frames and fuse video frames efficiently, and a channel attention residual block to capture the relations among feature maps for video frame reconstruction in VESR-Net. We conduct experiments to analyze the effectiveness of these designs in VESR-Net, which demonstrates the advantages of VESR-Net over previous state-of-the-art VESR methods. It is worth to mention that among more than thousands of participants for Youku video enhancement and super-resolution (Youku-VESR) challenge, our proposed VESR-Net beat other competitive methods and ranked the first place.

研究动机与目标

  • 为解决工业级视频应用中的真实世界视频退化问题,例如 Youku 在线视频平台中的实际场景。
  • 开发一种能够有效融合帧间时序信息,同时保持计算效率的视频超分辨率模型。
  • 通过捕捉帧间长距离依赖关系并增强每帧内的特征表示,提升重建质量。
  • 在具有复杂退化特性的现实、多样化数据集上,超越现有最先进方法的表现。

提出的方法

  • VESR-Net 采用独立的非局部(Separate NL)模块,显式建模跨视频帧的长程时空关系,以提升特征融合效果。
  • 通过通道注意力残差块(CARB)自适应地重新校准重建路径中的通道特征,以增强特征表示能力。
  • 网络处理连续 7 帧图像,以 4× 超分辨率重建中心帧,采用带有跳跃连接的编码器-解码器结构。
  • 模型采用端到端训练方式,以中心目标帧的 L1 损失进行优化,使用 Adam 优化器并配合学习率衰减策略。
  • 双分支结构将 PCD(金字塔交叉阶段可变形)卷积与 Separate NL 模块结合,以增强时空特征聚合能力。
  • 评估了两种变体:VESR-Net small(20 个 CARB)与 VESR-Net(40 个 CARB),并进行了各组件贡献的消融实验。

实验结果

研究问题

  • RQ1独立的非局部模块是否能在不增加计算成本的前提下,有效捕捉视频帧间的长距离依赖?
  • RQ2在超分辨率任务中,将通道注意力引入残差块是否能提升视频帧的重建质量?
  • RQ3在真实退化视频上,VESR-Net 与 EDVR 及其他 SOTA 方法相比,在 PSNR、FLOPs 和参数效率方面表现如何?
  • RQ4独立非局部模块与 CARB 模块在单独及联合使用时,对性能提升的贡献程度如何?
  • RQ5所提出方法是否能有效泛化至真实世界退化场景,而不仅限于如双三次下采样等合成退化?

主要发现

  • VESR-Net 在 Youku-VESR 挑战赛排行榜上取得最高分 37.851,领先第二名 0.2 分。
  • 在第二阶段数据集上,模型 PSNR 达到 35.97 dB,优于 EDVR(35.75 dB)与 EDVR small(35.47 dB),且 FLOPs 与参数量更低。
  • 消融实验表明,仅使用独立非局部模块即可使 PSNR 相较于 EDVR small 提升 0.28 dB,且计算开销极低。
  • 通道注意力残差块(CARB)在保持相近模型规模与 FLOPs 的前提下,相较 EDVR small 提升了 0.23 dB 的 PSNR。
  • 联合使用独立非局部模块与 CARB 模块,相较 EDVR small 实现了 0.41 dB 的 PSNR 提升,证明二者具有协同增效作用。
  • 定性结果表明,VESR-Net 能够成功恢复如字幕等精细细节,在视觉保真度上优于 EDVR。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。