Skip to main content
QUICK REVIEW

[论文解读] TransMEF: A Transformer-Based Multi-Exposure Image Fusion Framework using Self-Supervised Multi-Task Learning

Linhao Qu, Shaolei Liu|arXiv (Cornell University)|Dec 2, 2021
Image Enhancement Techniques被引用 13
一句话总结

TransMEF 提出了一种基于 Transformer 的多曝光图像融合框架,采用自监督多任务学习,在无需真实融合图像作为监督信号的情况下,利用大规模自然图像数据集进行训练。通过在编码器中结合 CNN 与 Transformer 模块,并设计三项自监督重建任务,该方法在最新基准数据集上的客观与主观评估中均达到最先进性能。

ABSTRACT

In this paper, we propose TransMEF, a transformer-based multi-exposure image fusion framework that uses self-supervised multi-task learning. The framework is based on an encoder-decoder network, which can be trained on large natural image datasets and does not require ground truth fusion images. We design three self-supervised reconstruction tasks according to the characteristics of multi-exposure images and conduct these tasks simultaneously using multi-task learning; through this process, the network can learn the characteristics of multi-exposure images and extract more generalized features. In addition, to compensate for the defect in establishing long-range dependencies in CNN-based architectures, we design an encoder that combines a CNN module with a transformer module. This combination enables the network to focus on both local and global information. We evaluated our method and compared it to 11 competitive traditional and deep learning-based methods on the latest released multi-exposure image fusion benchmark dataset, and our method achieved the best performance in both subjective and objective evaluations.

研究动机与目标

  • 解决基于深度学习的 MEF 方法中大规模多曝光数据集缺乏以及真实融合图像稀缺的问题。
  • 克服 CNN 在图像融合任务中建模长距离依赖关系能力有限的局限。
  • 通过在大规模自然图像数据集上使用自监督重建任务进行训练,提升特征的泛化能力与鲁棒性。
  • 在不依赖真实融合标签的监督信号条件下,实现多曝光图像融合的最先进性能。

提出的方法

  • 该框架采用编码器-解码器架构,在 ImageNet 和 MS-COCO 上通过自监督多任务学习进行训练。
  • 基于多曝光图像的特性,设计了三项自监督重建任务:亮度重建、纹理重建与边缘保持。
  • 编码器将 CNN 模块用于局部特征提取,同时引入视觉 Transformer 模块以建模长距离依赖关系。
  • 融合过程包括对两幅源图像进行编码,融合其特征图,并通过解码生成最终的融合图像。
  • 多任务学习联合优化三项重建任务,以增强特征学习与泛化能力。
  • 网络在自然图像上进行预训练,并在 MEF 基准数据集上进行微调,无需成对的真实融合标签。

实验结果

研究问题

  • RQ1自监督多任务学习是否能有效训练多曝光图像融合网络,而无需真实融合图像?
  • RQ2在编码器中结合 CNN 与 Transformer 模块是否能通过捕捉局部与全局图像依赖关系,提升性能?
  • RQ3所提出的重建任务是否能增强在自然图像数据集上的特征学习与泛化能力,从而提升下游 MEF 任务的表现?
  • RQ4在近期基准数据集上,该方法在客观指标与视觉质量方面与最先进方法相比表现如何?

主要发现

  • 在最新的多曝光图像融合基准数据集上,TransMEF 在主观与客观评估中均优于所比较的 12 种方法,表现最佳。
  • 该方法在包括 PSNR、SSIM、VIF、Q^A/BF 和 Q^G 在内的 12 项客观指标上,全面超越其余 11 种对比的主流传统与深度学习方法。
  • 视觉对比显示,TransMEF 在室内外场景中均能保持最优的亮度、对比度与细节保留效果,优于 DWT、DeepFuse 和 U2Fusion 等方法。
  • 自监督重建任务显著提升了特征学习能力,使模型能够在无真实标签的情况下,有效利用大规模自然图像数据集进行预训练。
  • 混合 CNN-Transformer 编码器能够更好地建模长距离依赖关系,从而生成更连贯、视觉上更自然的融合图像。
  • 该框架展现出强大的泛化与鲁棒性,即使不使用真实融合标签进行微调,仍能达到最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。