Skip to main content
QUICK REVIEW

[论文解读] Joint Image Filtering with Deep Convolutional Networks

Yijun Li, Jia‐Bin Huang|arXiv (Cornell University)|Oct 11, 2017
Advanced Vision and Imaging参考文献 46被引用 7
一句话总结

本文提出了一种基于深度学习的联合图像滤波框架,采用三个卷积子网络,联合处理目标图像与引导图像,以选择性地传输一致的结构细节,同时抑制噪声和不一致的纹理。该模型在RGB/深度数据上进行训练,能有效泛化至多种模态,如闪光/非闪光和RGB/近红外,实现了深度上采样与跨模态去噪的最先进性能,且推理效率高。

ABSTRACT

Joint image filters leverage the guidance image as a prior and transfer the structural details from the guidance image to the target image for suppressing noise or enhancing spatial resolution. Existing methods either rely on various explicit filter constructions or hand-designed objective functions, thereby making it difficult to understand, improve, and accelerate these filters in a coherent framework. In this paper, we propose a learning-based approach for constructing joint filters based on Convolutional Neural Networks. In contrast to existing methods that consider only the guidance image, the proposed algorithm can selectively transfer salient structures that are consistent with both guidance and target images. We show that the model trained on a certain type of data, e.g., RGB and depth images, generalizes well to other modalities, e.g., flash/non-Flash and RGB/NIR images. We validate the effectiveness of the proposed joint filter through extensive experimental evaluations with state-of-the-art methods.

研究动机与目标

  • 解决传统联合滤波器仅依赖引导图像而可能传递不一致或冗余结构的局限性。
  • 开发一种数据驱动的、端到端可训练的框架,联合建模目标图像与引导图像,以提升结构一致性。
  • 在无需微调的情况下,实现对不同图像模态(如RGB/深度、闪光/非闪光、RGB/近红外)的泛化能力。
  • 减少对人工设计目标函数和迭代优化的依赖,实现更快且更一致的滤波。

提出的方法

  • 该方法采用三个子网络:CNN_T 和 CNN_G 分别从目标图像和引导图像中提取特征。
  • 将两幅图像的特征拼接后输入第三个网络 CNN_F,该网络学习选择性地传输显著且一致的结构。
  • 使用跳跃连接,强制网络学习退化目标图像与真实值之间的残差,从而提升训练稳定性和性能。
  • 整个网络通过大规模RGB/深度数据集进行端到端训练,无需分阶段训练。
  • 网络架构设计为对模态变化具有鲁棒性,可迁移至未见过的数据类型,如闪光/非闪光或RGB/近红外图像对。
  • 对网络深度和融合层位置等超参数进行消融实验,以在模型大小与性能之间取得平衡,最优深度设定为 d=3。

实验结果

研究问题

  • RQ1基于深度学习的联合滤波器是否能在结构传输方面超越依赖固定、手工设计滤波器的传统方法?
  • RQ2在一种模态(如RGB/深度)上训练的模型,能否在其他模态(如闪光/非闪光或RGB/近红外)上实现良好泛化?
  • RQ3与仅使用引导图像的方法相比,联合建模目标图像与引导图像在多大程度上能提升滤波性能?
  • RQ4网络架构(包括跳跃连接与特征融合)在多大程度上影响模型抑制不一致纹理的能力?
  • RQ5在准确率与计算成本之间,网络深度与性能之间的权衡关系如何?

主要发现

  • 所提出的模型在NYUv2数据集上的深度上采样任务中实现了5.86 cm的最先进RMSE,优于先前方法。
  • 在SUN RGB-D数据集上,模型实现了具有竞争力的性能,RMSE为5.86 cm,展现出强大的泛化能力。
  • 尽管仅在RGB/深度数据上进行训练,该模型在未见过的模态(如闪光/非闪光和RGB/近红外图像对)上也表现出良好的泛化性能。
  • 当引导图像中存在细小纹理(如瓷器或地毯上的纹理)时,性能有所下降,表明对精细细节存在过度平滑现象。
  • 最优架构中,每个子网络的深度设定为 d=3,可在模型大小与性能之间取得平衡,d=5时模型大小为11.4 MB。
  • 消融实验表明,在第三层进行特征融合(3/3–3)可获得最佳性能,RMSE为5.86 cm,优于浅层或深层配置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。