[论文解读] Semi-Supervised Video Deraining with Dynamical Rain Generator
本文提出了一种基于动态雨滴生成器的半监督视频去雨方法,该生成器通过由深度神经网络参数化的发射模型和转移模型,将雨层建模为时空过程。通过联合利用标注的合成数据和未标注的真实雨天视频,该方法提升了对真实世界条件的泛化能力,在合成数据和真实数据基准上均取得了最先进性能,尤其在处理复杂多样的雨滴模式方面表现优异。
While deep learning (DL)-based video deraining methods have achieved significant success recently, they still exist two major drawbacks. Firstly, most of them do not sufficiently model the characteristics of rain layers of rainy videos. In fact, the rain layers exhibit strong physical properties (e.g., direction, scale and thickness) in spatial dimension and natural continuities in temporal dimension, and thus can be generally modelled by the spatial-temporal process in statistics. Secondly, current DL-based methods seriously depend on the labeled synthetic training data, whose rain types are always deviated from those in unlabeled real data. Such gap between synthetic and real data sets leads to poor performance when applying them in real scenarios. Against these issues, this paper proposes a new semi-supervised video deraining method, in which a dynamic rain generator is employed to fit the rain layer, expecting to better depict its insightful characteristics. Specifically, such dynamic generator consists of one emission model and one transition model to simultaneously encode the spatially physical structure and temporally continuous changes of rain streaks, respectively, which both are parameterized as deep neural networks (DNNs). Further more, different prior formats are designed for the labeled synthetic and unlabeled real data, so as to fully exploit the common knowledge underlying them. Last but not least, we also design a Monte Carlo EM algorithm to solve this model. Extensive experiments are conducted to verify the superiorities of the proposed semi-supervised deraining model.
研究动机与目标
- 为解决合成雨天视频数据与真实雨天视频数据之间的差距,该差距限制了基于深度学习的去雨方法的泛化能力。
- 通过统计时空过程建模雨层的内在时空特性,如方向、尺度、厚度、速度和加速度。
- 开发一种半监督学习框架,利用标注的合成数据与未标注的真实雨天视频之间的共享知识。
- 提升在真实世界去雨场景中的鲁棒性与泛化能力,因为仅使用合成数据时性能表现不足。
提出的方法
- 引入一种动态雨滴生成器,由用于空间外观的发射模型和用于雨痕时间动态的转移模型组成,两者均由深度神经网络参数化。
- 模型采用基于蒙特卡洛的期望最大化(EM)算法,通过优化似然项和基于马尔可夫随机场(MRF)的正则化项来学习参数。
- 采用半监督学习范式,联合使用标注的合成数据和未标注的真实雨天视频以提升泛化能力。
- 为合成数据和真实数据设计了不同的先验格式,以利用其潜在的共同知识,同时考虑分布差异。
- 目标函数中的似然项用于建模在给定观测到的雨天视频条件下雨层的概率,而MRF先验则在帧间强制实现空间一致性。
- 超参数ρ控制来自真实标签的监督与MRF先验之间的权衡,ρ = 0.5被选为达到最佳平衡。
实验结果
研究问题
- RQ1将雨层建模为时空过程是否能相比静态或纯合成建模方式,提升视频去雨性能?
- RQ2在半监督框架中,如何有效利用未标注的真实雨天视频,以实现超越合成数据的泛化能力?
- RQ3引入具有发射模型和转移模型的动态雨滴生成器,对处理多样化和复杂的真实世界雨滴模式有何影响?
- RQ4MRF先验如何在防止对合成数据过拟合的同时,提升在真实数据上的性能?
主要发现
- 所提出的S2VD方法在合成数据和真实世界基准上均达到最先进性能,在合成数据上相比仅使用MSE的基线方法提升了1.01 dB的PSNR。
- 添加似然项和MRF正则化项使SSIM提升0.0071,且在视觉对比中显示出对真实数据的泛化能力增强。
- S2VD在训练期间未见过的真实雨天视频上泛化良好,NTURain真实测试集上的视觉结果表现更优。
- 该方法对多样化雨滴模式表现出鲁棒性,在复杂真实世界场景中尤其优于现有方法。
- 消融实验证实,每个组件——似然项、MRF先验和半监督学习——均对性能提升有显著贡献。
- 失败案例出现在大范围相机运动或密集雨痕情况下,表明当前MRF先验在建模极端动态方面存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。