[论文解读] Towards Rolling Shutter Correction and Deblurring in Dynamic Scenes
本文提出了首个基于学习的方法JCD,用于动态场景下的联合滚轴快门校正与去模糊,结合双向形变流进行运动补偿,以及非形变去模糊流通过可变形注意力模块实现细节恢复。该方法在新提出的BS-RSCD数据集和合成的Fastec-RS数据集上均达到最先进性能,在定量指标与视觉质量上均优于现有方法。
Joint rolling shutter correction and deblurring (RSCD) techniques are critical for the prevalent CMOS cameras. However, current approaches are still based on conventional energy optimization and are developed for static scenes. To enable learning-based approaches to address real-world RSCD problem, we contribute the first dataset, BS-RSCD, which includes both ego-motion and object-motion in dynamic scenes. Real distorted and blurry videos with corresponding ground truth are recorded simultaneously via a beam-splitter-based acquisition system. Since direct application of existing individual rolling shutter correction (RSC) or global shutter deblurring (GSD) methods on RSCD leads to undesirable results due to inherent flaws in the network architecture, we further present the first learning-based model (JCD) for RSCD. The key idea is that we adopt bi-directional warping streams for displacement compensation, while also preserving the non-warped deblurring stream for details restoration. The experimental results demonstrate that JCD achieves state-of-the-art performance on the realistic RSCD dataset (BS-RSCD) and the synthetic RSC dataset (Fastec-RS). The dataset and code are available at https://github.com/zzh-tech/RSCD.
研究动机与目标
- 为解决动态场景中联合滚轴快门校正与去模糊(RSCD)缺乏真实数据集的问题。
- 克服现有RSC与去模糊方法在联合应用时的局限性,因架构缺陷导致无法同时处理畸变与模糊。
- 开发一种统一的深度学习模型,有效结合滚轴快门校正与去模糊,适用于真实世界的动态场景。
- 通过使用新型真实数据集(BS-RSCD)建立未来基于学习的RSCD研究基准,该数据集通过分束镜系统采集。
提出的方法
- 提出BS-RSCD数据集,首个真实世界RSCD基准数据集,通过分束镜系统同步采集滚轴快门(RS)畸变与模糊视频,以及全局快门(GS)真实值。
- 设计JCD模型,包含两个关键分支:双向形变流用于精确位移补偿,非形变去模糊流用于保留精细细节。
- 采用可变形注意力模块,在多尺度上融合形变流与去模糊流的特征,实现自适应特征聚合。
- 采用端到端训练,结合多尺度损失函数,包含L1、感知损失(LPIPS)与对抗损失,以提升真实感与细节恢复能力。
- 应用双向形变以比单向方法更准确地估计运动场,提升几何一致性。
- 提出新颖架构,通过解耦与融合互补处理路径,避免GSD方法常见的几何畸变与RSC方法的模糊恢复失败。
实验结果
研究问题
- RQ1深度学习模型能否在同时存在自运动与物体运动的动态场景中,有效实现滚轴快门畸变校正与运动模糊视频去模糊?
- RQ2与独立的RSC或GSD网络相比,双向形变流与非形变去模糊流的融合如何提升性能?
- RQ3所提出的可变形注意力模块在特征融合、几何结构保持与细节保留方面提升程度如何?
- RQ4在真实世界RSCD数据集上训练的模型是否能泛化到未见过的相机设备与真实视频序列?
- RQ5在评估RSCD性能时,感知指标(如LPIPS)与传统指标(PSNR、SSIM)相比表现如何?
主要发现
- JCD在BS-RSCD数据集上达到最先进性能,PSNR为26.42 dB,SSIM为0.778,LPIPS为0.107,优于所有基线方法。
- 在Fastec-RS合成数据集上,JCD实现PSNR 24.84 dB,SSIM 0.778,LPIPS 0.107,展现出强大的泛化能力与鲁棒性。
- 消融实验表明,移除中间去模糊分支(w/o ms)后,BS-RSCD上PSNR下降1.58 dB,证明其在细节恢复中的关键作用。
- 移除可变形卷积层(w/o dcn)后,BS-RSCD上LPIPS增加0.011,表明该组件有效减少几何伪影。
- 仅使用单向形变流(w/o bs)导致BS-RSCD上PSNR下降0.58 dB,LPIPS增加0.015,表明双向运动估计具有显著优势。
- 跨相机测试表明,模型在第三方相机(FLIR与EO)上表现良好,证明其具备强大的域泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。