[论文解读] Segmenting Objects in Day and Night:Edge-Conditioned CNN for Thermal Image Semantic Segmentation
本文提出了一种新型的深度学习架构——边缘条件卷积神经网络(EC-CNN),通过门控特征逐元素变换(GFT)层自适应地整合边缘先验知识,从而提升热成像语义分割性能。EC-CNN采用端到端训练,在新提出的SODA基准上实现了最先进性能,显著提升了mIoU和像素准确率,同时保持了高效的推理速度。
Despite much research progress in image semantic segmentation, it remains challenging under adverse environmental conditions caused by imaging limitations of visible spectrum. While thermal infrared cameras have several advantages over cameras for the visible spectrum, such as operating in total darkness, insensitive to illumination variations, robust to shadow effects and strong ability to penetrate haze and smog. These advantages of thermal infrared cameras make the segmentation of semantic objects in day and night. In this paper, we propose a novel network architecture, called edge-conditioned convolutional neural network (EC-CNN), for thermal image semantic segmentation. Particularly, we elaborately design a gated feature-wise transform layer in EC-CNN to adaptively incorporate edge prior knowledge. The whole EC-CNN is end-to-end trained, and can generate high-quality segmentation results with the edge guidance. Meanwhile, we also introduce a new benchmark dataset named "Segment Objects in Day And night"(SODA) for comprehensive evaluations in thermal image semantic segmentation. SODA contains over 7,168 manually annotated and synthetically generated thermal images with 20 semantic region labels and from a broad range of viewpoints and scene complexities. Extensive experiments on SODA demonstrate the effectiveness of the proposed EC-CNN against the state-of-the-art methods.
研究动机与目标
- 为解决热红外图像语义分割中的挑战,此类图像常因热交叉和传感器噪声导致分辨率低、对比度差、边界模糊。
- 为热成像语义分割开发一个稳健的深度学习基线模型,因为此前尚无公开基准。
- 提出一种新颖的网络架构,有效融合边缘先验知识,以提升在复杂热成像条件下的分割精度。
- 建立一个全面、大规模的基准数据集(SODA),包含7,168张标注的热成像图像和20个语义类别,以支持可靠评估与未来研究。
提出的方法
- 提出一种基于DeepLabv3构建的新型EC-CNN架构,通过门控特征逐元素变换(GFT)层引入边缘先验知识,以引导语义分割。
- 设计GFT层以基于边缘概率图对特征图执行自适应、可学习的仿射变换,实现动态特征调制。
- 在GFT层中引入门控机制,以抑制噪声边缘预测,增强对不可靠边缘信息的鲁棒性。
- 采用混合数据生成策略:人工标注2,168张真实热成像图像,并利用图像到图像翻译技术合成5,000张额外图像,以扩展数据集规模。
- 在SODA数据集上使用像素级标注,通过监督学习对整个EC-CNN模型进行端到端训练。
- 采用标准指标(mIoU、像素准确率、推理速度)和消融研究验证设计选择的有效性。
实验结果
研究问题
- RQ1如何在深度神经网络中有效且自适应地整合边缘先验知识,以提升热成像语义分割性能?
- RQ2在语义分割网络架构中,边缘引导模块的最佳放置位置是什么?
- RQ3在特征变换层中引入门控机制,对提升热数据中噪声边缘预测的鲁棒性有何影响?
- RQ4所提出的EC-CNN在热成像语义分割任务中相比现有最先进方法的性能提升程度如何?
- RQ5大规模、高质量标注的基准在推动热成像语义分割研究方面发挥了何种作用?
主要发现
- EC-CNN模型在SODA基准上的平均交并比(mIoU)达到61.3%,相比基线模型DeepLabv3提升了0.5%。
- 像素准确率从基线的82.3%提升至83.6%,表明门控机制在过滤噪声边缘信息方面的有效性。
- 将GFT层插入最浅的残差块(conv2_x)时性能最佳,表明低层次边缘先验对热成像分割最为有益。
- EC-CNN保持了接近基线的推理速度,单张图像在GTX TITAN XP GPU上的平均推理时间为0.13–0.17秒,计算开销极低。
- 消融研究证实,门控机制显著提升了对噪声边缘的鲁棒性,当门控激活时,像素准确率提升1.3%。
- SODA数据集包含7,168张标注图像和20个语义类别,为评估热成像分割方法提供了全面且多样的基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。