Skip to main content
QUICK REVIEW

[论文解读] MuCAN: Multi-Correspondence Aggregation Network for Video Super-Resolution

Wenbo Li, Xin Tao|arXiv (Cornell University)|Jul 23, 2020
Advanced Image Processing Techniques参考文献 46被引用 15
一句话总结

MuCAN 提出了一种新颖的视频超分辨率网络,通过多对应聚合提升时空特征对齐。它引入了时间多对应聚合模块(TM-CAM),利用多个相似块实现鲁棒的运动补偿;同时引入跨尺度非局部对应聚合模块(CN-CAM),以挖掘跨尺度的自相似性,从而在 REDS、Vimeo-90K 和 Vid4 数据集上实现最先进性能,相比之前方法提升最高达 0.25dB。

ABSTRACT

Video super-resolution (VSR) aims to utilize multiple low-resolution frames to generate a high-resolution prediction for each frame. In this process, inter- and intra-frames are the key sources for exploiting temporal and spatial information. However, there are a couple of limitations for existing VSR methods. First, optical flow is often used to establish temporal correspondence. But flow estimation itself is error-prone and affects recovery results. Second, similar patterns existing in natural images are rarely exploited for the VSR task. Motivated by these findings, we propose a temporal multi-correspondence aggregation strategy to leverage similar patches across frames, and a cross-scale nonlocal-correspondence aggregation scheme to explore self-similarity of images across scales. Based on these two new modules, we build an effective multi-correspondence aggregation network (MuCAN) for VSR. Our method achieves state-of-the-art results on multiple benchmark datasets. Extensive experiments justify the effectiveness of our method.

研究动机与目标

  • 为解决基于光流的运动估计在视频超分辨率中的局限性,其易出错且对错位敏感。
  • 通过利用帧间与帧内对应关系,挖掘自然图像中跨帧和跨尺度的相似块。
  • 通过聚合多个对应特征而非依赖单像素对应关系,提升高分辨率视频重建质量。
  • 通过新型边缘感知损失函数,提升重建帧的边缘质量。
  • 开发一种轻量化、端到端可训练的网络,使其在真实世界视频数据上具有良好泛化能力。

提出的方法

  • 提出时间多对应聚合模块(TM-CAM),为每个像素在帧间识别最相似的 K 个特征块,实现不依赖光流的鲁棒运动补偿。
  • 在 TM-CAM 中设计像素自适应聚合策略,根据相似性和空间一致性动态加权多个对应候选。
  • 设计跨尺度非局部对应聚合模块(CN-CAM),以利用单帧内不同特征尺度间的自相似性,增强细节恢复能力。
  • 在 CN-CAM 中采用可学习的非局部注意力机制,聚合跨尺度的非局部相似区域特征,提升纹理与结构重建质量。
  • 引入边缘感知损失(EAL),在训练中强调边缘区域,使输出结果具有更清晰、更精确的高频细节。
  • 将所有模块整合为一个端到端可训练网络(MuCAN),联合优化对齐、特征聚合与重建过程。

实验结果

研究问题

  • RQ1在视频超分辨率中,利用跨帧的多个对应块是否能相比单像素光流估计提升运动补偿的鲁棒性?
  • RQ2在单帧内利用不同空间尺度间的自相似性,是否能提升重建高分辨率视频帧的质量?
  • RQ3多对应聚合策略是否能降低对运动估计误差的敏感性,并提升在挑战性视频序列上的性能?
  • RQ4跨尺度非局部对应模块的集成对细粒度纹理与结构细节恢复有何影响?
  • RQ5边缘感知损失在多大程度上提升了超分视频帧中边缘的锐度与感知质量?

主要发现

  • MuCAN 在 REDS 数据集上达到最先进性能,在 ×4 设置下相比之前最先进方法至少提升 0.17dB PSNR。
  • 在 Vimeo-90K 数据集上,与 DUF 和 RBPN 相比,MuCAN 在 RGB 通道上提升 1.2dB PSNR,在 Y 通道上提升 0.25dB PSNR。
  • 跨尺度非局部对应聚合模块(CN-CAM)使 PSNR 提升 0.12dB,视觉结果表明在窗户、建筑等重复图案区域具有更优的细节恢复能力。
  • 边缘感知损失(EAL)使边缘更清晰、更精细,该结论得到 REDS 数据集上视觉对比与定量指标的验证。
  • MuCAN 在真实世界视频数据上泛化良好,未产生视觉伪影,而 EDVR 在分布偏移下出现性能退化。
  • 消融实验表明,TM-CAM 与 CN-CAM 均对性能提升有显著贡献,其中 TM-CAM 展现出对运动估计误差的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。