Skip to main content
QUICK REVIEW

[论文解读] IRSAM: Advancing Segment Anything Model for Infrared Small Target Detection

Mingjin Zhang, Yuchun Wang|arXiv (Cornell University)|Jul 10, 2024
Infrared Target Detection Methodologies被引用 4
一句话总结

本文提出IRSAM,一种针对红外小目标检测(IRSTD)的新型分割一切模型(SAM)改进方法,通过在编码器中引入基于小波的Perona-Malik扩散(WPMD)模块以增强特征表示,并采用粒度感知解码器(GAD)实现多粒度特征融合。该方法在NUAA-SIRST、NUDT-SIRST和IRSTD-1K基准上达到最先进性能,显著优于原始SAM及先前最先进方法。

ABSTRACT

The recent Segment Anything Model (SAM) is a significant advancement in natural image segmentation, exhibiting potent zero-shot performance suitable for various downstream image segmentation tasks. However, directly utilizing the pretrained SAM for Infrared Small Target Detection (IRSTD) task falls short in achieving satisfying performance due to a notable domain gap between natural and infrared images. Unlike a visible light camera, a thermal imager reveals an object's temperature distribution by capturing infrared radiation. Small targets often show a subtle temperature transition at the object's boundaries. To address this issue, we propose the IRSAM model for IRSTD, which improves SAM's encoder-decoder architecture to learn better feature representation of infrared small objects. Specifically, we design a Perona-Malik diffusion (PMD)-based block and incorporate it into multiple levels of SAM's encoder to help it capture essential structural features while suppressing noise. Additionally, we devise a Granularity-Aware Decoder (GAD) to fuse the multi-granularity feature from the encoder to capture structural information that may be lost in long-distance modeling. Extensive experiments on the public datasets, including NUAA-SIRST, NUDT-SIRST, and IRSTD-1K, validate the design choice of IRSAM and its significant superiority over representative state-of-the-art methods. The source code are available at: github.com/IPIC-Lab/IRSAM.

研究动机与目标

  • 为解决自然图像与红外图像之间的域差距问题,该差距限制了预训练SAM在红外小目标检测(IRSTD)中的性能。
  • 提升红外图像中的特征表示能力,特别是针对信噪比低、边缘模糊的小目标。
  • 在编码器中增强边缘保持与噪声抑制能力,同时在解码器中提升多尺度与多粒度特征融合能力。
  • 通过轻量化、高效的架构设计,结合迁移学习,实现在IRSTD基准上的优越零样本与微调性能。

提出的方法

  • WPMD模块将Perona-Malik扩散方程中的梯度项替换为基于小波的变换,以更好地在红外图像中保持边缘并抑制噪声。
  • WPMD模块被集成到SAM视觉Transformer编码器的多个阶段中,以在不同抽象层次上优化特征提取。
  • 粒度感知解码器(GAD)通过双向Transformer机制,融合来自浅层与深层编码器特征,提升不同目标尺度与形状下的掩码表示能力。
  • 模型基于Mobile-SAM构建,以降低计算成本与模型大小,同时保持高性能。
  • 编码器采用改进的ViT-Tiny主干网络,并在多层中插入WPMD模块,以增强结构特征学习能力。
  • 解码器采用双向注意力机制,整合多粒度特征,提升对小目标与复杂目标的分割精度。

实验结果

研究问题

  • RQ1尽管存在自然图像与红外图像之间的域差距,预训练的分割一切模型(SAM)是否能被有效适配于红外小目标检测?
  • RQ2在温度变化细微、信噪比低的红外图像中,如何进一步提升边缘保持与噪声抑制能力?
  • RQ3如何最优地融合编码器输出的多粒度特征,以增强对小目标与结构复杂目标的掩码表示?
  • RQ4与原始SAM及现有最先进方法相比,集成基于小波的扩散模块与多粒度解码器对性能有何影响?

主要发现

  • IRSAM在NUAA-SIRST数据集上取得80.78的IoU分数,显著优于Mobile-SAM基线模型(75.84)及其他最先进方法。
  • 消融实验表明,若移除WPMD模块,IoU下降2.05分,且误报率(Fa)从3.95上升至11.18,证明其在边缘保持中的关键作用。
  • GAD模块通过融合浅层与深层特征,实现最高性能(IoU: 80.78,nIoU: 78.39),优于仅使用浅层或深层特征的配置。
  • 在编码器中使用四个WPMD模块可获得最佳性能,其特征图显示更强的目标激活与更低的噪声水平,优于使用更少模块的情况。
  • 可视化对比结果表明,IRSAM在保持精细结构细节与抑制背景杂波方面优于拉普拉斯与Sobel基边缘检测方法。
  • 在IRSTD-1K与NUDT-SIRST数据集中,IRSAM在客观指标(IoU、nIoU)与主观评估中均达到最先进水平,证实其在多样化红外成像条件下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。