[论文解读] Video Deblurring by Fitting to Test Data
本文提出了一种新颖的视频去模糊方法,通过利用同一视频中的清晰帧,直接将深度卷积网络拟合到测试视频上,从而消除域差距问题。通过在内部视频数据上使用模糊生成策略和损失重加权进行训练,该方法在保持性能的同时,实现了最先进(SOTA)的去模糊质量与时间一致性,并通过元学习实现了100倍的速度提升。
Motion blur in videos captured by autonomous vehicles and robots can degrade their perception capability. In this work, we present a novel approach to video deblurring by fitting a deep network to the test video. Our key observation is that some frames in a video with motion blur are much sharper than others, and thus we can transfer the texture information in those sharp frames to blurry frames. Our approach heuristically selects sharp frames from a video and then trains a convolutional neural network on these sharp frames. The trained network often absorbs enough details in the scene to perform deblurring on all the video frames. As an internal learning method, our approach has no domain gap between training and test data, which is a problematic issue for existing video deblurring approaches. The conducted experiments on real-world video data show that our model can reconstruct clearer and sharper videos than state-of-the-art video deblurring approaches. Code and data are available at https://github.com/xrenaa/Deblur-by-Fitting.
研究动机与目标
- 为了解决视频去模糊中的域差距问题,即在合成数据上训练的模型在真实世界视频上表现不佳的问题。
- 开发一种自监督、测试数据感知的去模糊流水线,无需大规模预训练数据集。
- 利用视频内部统计特性,提升真实世界运动模糊视频的去模糊质量与时间一致性。
- 通过应用元学习(MAML)加速视频去模糊的训练过程,同时不牺牲性能。
- 收集并发布一个公开的真实世界视频去模糊数据集,用于基准测试。
提出的方法
- 该方法在运动模糊视频中识别出清晰帧,并利用它们作为监督信号,训练一个轻量级CNN用于去模糊。
- 通过在清晰帧上应用对称模糊核,模拟真实世界的运动模糊,生成逼真的训练样本对。
- 采用损失重加权方案,突出高频区域,以在训练过程中保留精细细节。
- 在模糊生成过程中应用反伽马校正,以更好地匹配真实世界的模糊特性。
- 使用元学习(MAML)初始化网络,将每段视频的训练时间从数小时缩短至约5分钟。
- 该方法还可作为后处理步骤,用于优化现有去模糊模型的输出结果。
实验结果
研究问题
- RQ1仅在测试视频的内部清晰帧上进行训练的深度学习模型,是否能实现优于域偏移问题的去模糊性能?
- RQ2对称模糊核与损失重加权的使用,对时间一致性和视觉质量有何影响?
- RQ3元学习在多大程度上能加速拟合测试数据的过程,同时保持去模糊质量?
- RQ4所提出的方法能否泛化到真实世界自动驾驶与机器人视频场景?
- RQ5内部学习方法是否在真实世界视频数据上优于现有的最先进方法?
主要发现
- 在未使用损失重加权的情况下,该方法在用户偏好测试中的得分为66.0%,而使用对称核与反伽马校正后,提升至84.0%。
- 在所有对比方法中,该方法的形变误差最低(0.2630),表明其具有更优的时间一致性。
- 用户研究表明,86.0%的参与者更偏好经过本方法流水线后处理的STFAN结果。
- 采用MAML的加速版本将训练时间从数小时缩短至每视频约5分钟,且性能损失可忽略。
- 在真实世界数据上的定量指标与用户研究中,该方法显著优于DeblurGAN-v2、EDVR与STFAN。
- 本文公开发布了包含70段视频的真实世界视频去模糊数据集,供未来基准测试使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。