[论文解读] Multimodal Sensor Fusion In Single Thermal image Super-Resolution
本文提出了一种基于残差网络并结合感知损失与对抗损失的深度学习框架,通过融合高分辨率可见(RGB)图像与低分辨率热成像图实现单张热成像图超分辨率。该方法显著提升了视觉质量与高频细节恢复能力,在新基准数据集上的定量指标与人类感知评估中均优于当前最先进模型。
With the fast growth in the visual surveillance and security sectors, thermal infrared images have become increasingly necessary ina large variety of industrial applications. This is true even though IR sensors are still more expensive than their RGB counterpart having the same resolution. In this paper, we propose a deep learning solution to enhance the thermal image resolution. The following results are given:(I) Introduction of a multimodal, visual-thermal fusion model that ad-dresses thermal image super-resolution, via integrating high-frequency information from the visual image. (II) Investigation of different net-work architecture schemes in the literature, their up-sampling methods,learning procedures, and their optimization functions by showing their beneficial contribution to the super-resolution problem. (III) A bench-mark ULB17-VT dataset that contains thermal images and their visual images counterpart is presented. (IV) Presentation of a qualitative evaluation of a large test set with 58 samples and 22 raters which shows that our proposed model performs better against state-of-the-arts.
研究动机与目标
- 解决在监控与工业应用中因高分辨率热成像传感器成本高昂而导致的低分辨率热成像问题。
- 克服传统超分辨率方法因依赖MSE损失函数而无法恢复高频细节的局限性。
- 通过多模态传感器融合,利用高分辨率可见图像来补充低分辨率热成像图中缺失的高频内容。
- 构建一个新的基准数据集(ULB17-VT),以支持热成像超分辨率方法的评估与比较。
- 通过大规模主观评估研究引入人类感知因素,使视觉质量超越PSNR/SSIM等传统指标。
提出的方法
- 提出一种多模态融合框架,将低分辨率热成像图与高分辨率可见光图像输入深度残差网络以实现超分辨率重建。
- 结合内容损失(MSE)与对抗损失,以保留低频内容并增强高频细节。
- 引入预训练VGG网络的感知损失,以提升结构相似性与视觉保真度。
- 采用残差学习机制以稳定训练过程并改善超分辨率网络中的特征表示能力。
- 设计双分支结构,包含共享卷积层与模态特异性卷积层,以有效融合视觉与热成像特征。
- 开展大规模主观评估,共22名评分者参与,测试58张图像,采用投票机制根据输出图像与真实图像的视觉相似性对模型性能进行排名。
实验结果
研究问题
- RQ1高分辨率可见图像能否被有效用于提升低分辨率热成像图的超分辨率质量?
- RQ2与单模态方法相比,可见光与热成像数据的多模态融合在高频细节恢复方面有何优势?
- RQ3感知损失与对抗损失在多大程度上能提升视觉质量,使其超越传统PSNR/SSIM指标?
- RQ4在人类视觉感知与客观指标方面,所提模型与当前最先进方法相比表现如何?
- RQ5不同网络架构与损失函数对热成像超分辨率性能有何影响?
主要发现
- 所提出的VTSRCNN与VTSRGAN模型在ULB17-VT基准数据集上分别达到51.727 dB的PSNR与0.9434的SSIM,优于所有当前最先进方法。
- 在包含22名评分者与58张测试图像的大规模主观评估中,VTSRCNN获得39%的总票数支持,VTSRGAN获得17%,表明人类对融合模型有明显偏好。
- 图8中的彩色投票流向图证实,多模态融合模型在排名上始终高于单模态或非融合模型。
- 采用对抗损失与感知损失显著提升了视觉质量,相比仅使用MSE的基线模型,有效减少了模糊并增强了纹理细节。
- ULB17-VT基准数据集提供了成对的可见光与热成像图像,为未来方法的可靠评估与比较提供了标准化数据集。
- 由于传感器错位或物体位移导致重建图像中出现伪影,表明在实际部署中需进一步提升同步精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。