[论文解读] Efficient Multi-Stage Video Denoising with Recurrent Spatio-Temporal Fusion
该论文提出EMVD,一种高效的多阶段视频去噪框架,通过可学习的、可逆的变换实现循环时空融合,从而在保持或提升性能的同时降低计算复杂度。通过在变换域中依次应用时间融合、空间去噪和优化阶段,EMVD在移动片上系统(SoC)上实现了720p视频的实时去噪,仅需5.38 GFLOPs和36ms推理时间,性能优于当前最先进方法,即使后者计算复杂度高出364倍。
In recent years, denoising methods based on deep learning have achieved unparalleled performance at the cost of large computational complexity. In this work, we propose an Efficient Multi-stage Video Denoising algorithm, called EMVD, to drastically reduce the complexity while maintaining or even improving the performance. First, a fusion stage reduces the noise through a recursive combination of all past frames in the video. Then, a denoising stage removes the noise in the fused frame. Finally, a refinement stage restores the missing high frequency in the denoised frame. All stages operate on a transform-domain representation obtained by learnable and invertible linear operators which simultaneously increase accuracy and decrease complexity of the model. A single loss on the final output is sufficient for successful convergence, hence making EMVD easy to train. Experiments on real raw data demonstrate that EMVD outperforms the state of the art when complexity is constrained, and even remains competitive against methods whose complexities are several orders of magnitude higher. Further, the low complexity and memory requirements of EMVD enable real-time video denoising on commercial SoC in mobile devices.
研究动机与目标
- 解决当前基于深度学习的视频去噪方法计算复杂度过高,难以实现在移动设备上的实时部署问题。
- 通过结构化的多阶段处理流程,利用视频中的时空相关性,在不牺牲性能的前提下降低模型复杂度。
- 设计一种训练友好的架构,使每个阶段能自然收敛而无需显式监督,从而提升可解释性与可控性。
- 在商业移动SoC上实现低内存占用的实时推理,同时保持具有竞争力的PSNR和SSIM指标。
提出的方法
- EMVD采用三阶段架构:时间融合、空间去噪和时空优化,各阶段均基于可学习且可逆的线性算子生成的变换域表示进行处理。
- 时间融合阶段通过递归机制融合历史帧,以在去噪前降低噪声。
- 空间去噪阶段在变换域中对融合帧应用基于CNN的去噪器,以消除残余噪声。
- 优化阶段通过自适应增强去噪输出中的高频细节,利用时空上下文信息。
- 所有阶段共享一个可学习且可逆的变换,用于解耦颜色与频率分量,从而提升精度并降低复杂度。
- 仅在最终输出上使用单一端到端损失进行训练,无需为各阶段提供辅助监督。
实验结果
研究问题
- RQ1与现有深度学习方法相比,多阶段视频去噪框架是否能在显著降低计算复杂度的前提下实现最先进性能?
- RQ2与非递归的多帧方法相比,递归的时空融合机制在长期时间一致性与性能方面表现如何?
- RQ3可学习且可逆的变换在视频去噪中能在多大程度上同时提升模型精度与效率?
- RQ4此类轻量化架构是否能在不造成显著质量下降的前提下,实现在商用移动SoC上的实时性能?
主要发现
- 在CRVD数据集上,EMVD在5.38 GFLOPs下实现38.27 dB PSNR和0.9722 SSIM,优于EDVR(37.43 dB)和FastDVDnet,且复杂度仅为后者的1/5.7。
- 在5.38 GFLOPs下,EMVD比RViDeNet(79 GFLOPs)高出0.84 dB PSNR,且在华为P40 Pro手机上推理速度更快4.9倍,内存占用减少6.5倍。
- EMVD在仅5.38 GFLOPs的复杂度下,仍比25倍大的RViDeNet模型保持0.03 dB的PSNR优势,证明其在低复杂度下具备强大的性能效率。
- 在SRVD数据集上,EMVD展现出更优的时间稳定性,随时间推移的PSNR增益高于多帧基线方法,尤其在长序列中表现更优。
- EMVD在商用移动SoC(华为P40 Pro)上实现约30 fps的实时性能,720p视频处理仅需36 ms,内存占用仅112 MB DDR。
- 该模型的递归设计使其在动态场景中收敛更快,仅处理几帧后,PSNR性能即优于其他方法超过2 dB。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。