[论文解读] On the Generalization of BasicVSR++ to Video Deblurring and Denoising
该论文通过将BasicVSR++的长期特征传播和光流引导可变形对齐机制适配到输入输出分辨率相同的任务中,将其推广至视频去模糊和去噪任务。通过应用步幅卷积下采样输入并降低光流计算分辨率,该框架在参数量减少高达79%、推理速度提升44倍的同时,实现了最先进性能,证明了循环视频恢复架构的广泛适用性。
The exploitation of long-term information has been a long-standing problem in video restoration. The recent BasicVSR and BasicVSR++ have shown remarkable performance in video super-resolution through long-term propagation and effective alignment. Their success has led to a question of whether they can be transferred to different video restoration tasks. In this work, we extend BasicVSR++ to a generic framework for video restoration tasks. In tasks where inputs and outputs possess identical spatial size, the input resolution is reduced by strided convolutions to maintain efficiency. With only minimal changes from BasicVSR++, the proposed framework achieves compelling performance with great efficiency in various video restoration tasks including video deblurring and denoising. Notably, BasicVSR++ achieves comparable performance to Transformer-based approaches with up to 79% of parameter reduction and 44x speedup. The promising results demonstrate the importance of propagation and alignment in video restoration tasks beyond just video super-resolution. Code and models are available at https://github.com/ckkelvinchan/BasicVSR_PlusPlus.
研究动机与目标
- 探究BasicVSR++在视频超分任务中的成功是否可推广至其他视频恢复任务。
- 开发一种基于BasicVSR++的高效、通用框架,适用于去模糊、去噪等多种视频恢复任务。
- 在降低计算成本的同时保持高性能,通过输入分辨率降低和优化特征处理实现。
- 证明循环式、基于传播的架构可在显著更优效率下实现与基于Transformer的模型相当或更优的精度。
提出的方法
- 引入步幅卷积对输入帧进行下采样,适用于输入输出分辨率相同的任务,以减少空间维度和计算负载。
- 对光流计算应用分辨率降低策略,进一步降低计算成本,同时保持对齐精度。
- 保留BasicVSR++的核心组件:用于长期特征传输的二阶网格传播机制,以及用于鲁棒特征对齐的光流引导可变形卷积。
- 通过帧间共享特征空间与循环处理机制,利用长期时序依赖性。
- 采用Charbonnier损失以提升训练稳定性,并在处理异常值方面优于ℓ₂损失。
- 采用学习率热身与余弦退火的训练调度策略,并在初期固定光流网络权重以稳定训练。
实验结果
研究问题
- RQ1BasicVSR++的架构能否超越视频超分任务,推广至其他视频恢复任务?
- RQ2在视频去模糊与去噪任务中,输入分辨率降低对性能与效率有何影响?
- RQ3基于循环卷积的框架能否在参数更少、推理更快的前提下,实现与基于Transformer的模型相当的性能?
- RQ4在变化输入下采样因子时,模型效率与恢复质量之间的权衡关系如何?
主要发现
- 在GoPro数据集上,BasicVSR++在视频去模糊任务中达到SOTA性能,PSNR为34.61 dB,SSIM为0.9566,优于EDVR与DBLRNet等先前方法。
- 在DVD数据集上,BasicVSR++实现PSNR 37.59 dB与SSIM 0.9566,展现出在运动去模糊任务中的强大性能。
- 在Set8数据集的视频去噪任务中,BasicVSR++采用↓2下采样时,PSNR达34.17 dB,SSIM达0.9238,较PaCNet提升1.49 dB与0.0292,且速度提升147倍。
- 采用↓4下采样时,BasicVSR++性能与基于Transformer的模型(如VRT与VSRT)相当,参数量仅980万,1280×720分辨率下推理时间131ms,相较VRT的3560万参数与243ms具有显著优势。
- 与基于Transformer的方法相比,该框架实现高达79%的参数减少与44倍的速度提升,同时保持具有竞争力的性能。
- 定性结果表明,BasicVSR++ ↓4可恢复其他方法无法复现的细节(如文字'6600'),表明其在边缘与纹理重建方面具有更优能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。