[论文解读] Deep Convolutional Neural Network for Multi-modal Image Restoration and Fusion
本文提出CU-Net,一种源自新型多模态卷积稀疏编码(MCSC)模型的深度卷积神经网络,用于联合解决多模态图像恢复(MIR)与融合(MIF)问题。通过可学习的卷积稀疏编码模块显式分离各模态间的共用特征与特有特征,CU-Net在多种任务(如RGB引导的深度超分辨率和闪光辅助去噪)中实现了最先进的性能,具备快速推理速度与小型模型尺寸。
In this paper, we propose a novel deep convolutional neural network to solve the general multi-modal image restoration (MIR) and multi-modal image fusion (MIF) problems. Different from other methods based on deep learning, our network architecture is designed by drawing inspirations from a new proposed multi-modal convolutional sparse coding (MCSC) model. The key feature of the proposed network is that it can automatically split the common information shared among different modalities, from the unique information that belongs to each single modality, and is therefore denoted with CU-Net, i.e., Common and Unique information splitting network. Specifically, the CU-Net is composed of three modules, i.e., the unique feature extraction module (UFEM), common feature preservation module (CFPM), and image reconstruction module (IRM). The architecture of each module is derived from the corresponding part in the MCSC model, which consists of several learned convolutional sparse coding (LCSC) blocks. Extensive numerical results verify the effectiveness of our method on a variety of MIR and MIF tasks, including RGB guided depth image super-resolution, flash guided non-flash image denoising, multi-focus and multi-exposure image fusion.
研究动机与目标
- 解决现有深度学习方法在多模态图像处理中缺乏可解释性及对模态间依赖关系显式建模的局限性。
- 通过构建图像级别的多模态卷积稀疏编码(MCSC)模型,克服传统稀疏编码方法效率低下与局部块级建模的不足。
- 设计一个统一的深度学习框架,通过单一、可解释的架构同时解决多模态图像恢复(MIR)与多模态图像融合(MIF)任务。
- 实现共用特征(跨模态共享)与特有特征(模态特异)的自动分离,以提升MIR与MIF任务中的性能与泛化能力。
提出的方法
- 提出一种新型多模态卷积稀疏编码(MCSC)模型,通过两个卷积字典(一个用于共用特征,一个用于特有特征)表示每一模态,实现在图像级别对模态间依赖关系的联合建模。
- 基于MCSC模型设计CU-Net架构,包含三个模块:特有特征提取模块(UFEM)、共用特征保持模块(CFPM)与图像重建模块(IRM),每个模块均源自MCSC模型中的对应组件。
- 采用堆叠的可学习卷积稀疏编码(LCSC)块实现各模块,其中滤波器(E和F)通过反向传播端到端学习,实现可微分的特征提取与稀疏编码。
- 采用双流编码-解码结构并引入跳跃连接,以保留空间细节并有效融合模态特异与共享表征。
- 采用L2损失进行重建任务与感知损失进行图像质量优化,通过Adam自适应优化策略进行端到端训练。
- 在每个LCSC块中引入残差学习策略以稳定训练并提升收敛性,同时在特征域中通过软阈值化执行收缩操作。
实验结果
研究问题
- RQ1基于结构化多模态稀疏编码模型构建的深度神经网络架构,是否在多模态图像恢复与融合任务中相比纯数据驱动方法展现出更优性能与更强可解释性?
- RQ2在多种MIR与MIF任务中,模态间共用与特有特征的显式分离能在多大程度上提升性能?
- RQ3在多个基准任务中,所提出的基于MCSC的网络架构在精度、速度与模型尺寸方面相较于现有SOTA方法表现如何?
- RQ4各组件(如UFEM、CFPM、IRM)及超参数(如滤波器尺寸、网络深度)对CU-Net整体性能的贡献如何?
主要发现
- CU-Net在六项多样化的多模态图像处理任务中达到SOTA性能,包括RGB引导的深度超分辨率、闪光辅助非闪光图像去噪,以及多焦点/多曝光图像融合。
- 在RGB引导的深度图像超分辨率任务中,CU-Net在仅231 KB模型尺寸下实现45.12 dB的PSNR与0.9940的SSIM,优于现有方法且推理速度更快。
- 该方法具备极快的推理速度,在GTX 1080 Ti GPU上处理1320×1080图像仅需0.85秒,所有任务均实现亚秒级推理时间。
- 消融实验表明,共用与特有特征分离机制以及基于LCSC的模块对性能至关重要,滤波器尺寸与网络深度的消融分析均显示一致性能增益。
- 网络在不同模态与任务间泛化能力出色,随着网络深度增加,RMSE从2.07降至1.81,PSNR从43.88 dB提升至45.12 dB。
- 该架构的可解释性——源于MCSC模型——使我们能更深入理解特征学习动态,这与纯粹经验性的CNN设计形成鲜明对比。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。