[论文解读] IRSAM: Advancing Segment Anything Model for Infrared Small Target Detection
本文提出IRSAM,一种针对红外小目标检测(IRSTD)的新型分割一切模型(SAM)改进方法,通过在编码器中引入基于小波的Perona-Malik扩散(WPMD)模块以增强特征表示,并采用粒度感知解码器(GAD)实现多粒度特征融合。该方法在NUAA-SIRST、NUDT-SIRST和IRSTD-1K基准上达到最先进性能,显著优于原始SAM及先前最先进方法。
The recent Segment Anything Model (SAM) is a significant advancement in natural image segmentation, exhibiting potent zero-shot performance suitable for various downstream image segmentation tasks. However, directly utilizing the pretrained SAM for Infrared Small Target Detection (IRSTD) task falls short in achieving satisfying performance due to a notable domain gap between natural and infrared images. Unlike a visible light camera, a thermal imager reveals an object's temperature distribution by capturing infrared radiation. Small targets often show a subtle temperature transition at the object's boundaries. To address this issue, we propose the IRSAM model for IRSTD, which improves SAM's encoder-decoder architecture to learn better feature representation of infrared small objects. Specifically, we design a Perona-Malik diffusion (PMD)-based block and incorporate it into multiple levels of SAM's encoder to help it capture essential structural features while suppressing noise. Additionally, we devise a Granularity-Aware Decoder (GAD) to fuse the multi-granularity feature from the encoder to capture structural information that may be lost in long-distance modeling. Extensive experiments on the public datasets, including NUAA-SIRST, NUDT-SIRST, and IRSTD-1K, validate the design choice of IRSAM and its significant superiority over representative state-of-the-art methods. The source code are available at: github.com/IPIC-Lab/IRSAM.
研究动机与目标
- 为解决自然图像与红外图像之间的域差距问题,该差距限制了预训练SAM在红外小目标检测(IRSTD)中的性能。
- 提升红外图像中的特征表示能力,特别是针对信噪比低、边缘模糊的小目标。
- 在编码器中增强边缘保持与噪声抑制能力,同时在解码器中提升多尺度与多粒度特征融合能力。
- 通过轻量化、高效的架构设计,结合迁移学习,实现在IRSTD基准上的优越零样本与微调性能。
提出的方法
- WPMD模块将Perona-Malik扩散方程中的梯度项替换为基于小波的变换,以更好地在红外图像中保持边缘并抑制噪声。
- WPMD模块被集成到SAM视觉Transformer编码器的多个阶段中,以在不同抽象层次上优化特征提取。
- 粒度感知解码器(GAD)通过双向Transformer机制,融合来自浅层与深层编码器特征,提升不同目标尺度与形状下的掩码表示能力。
- 模型基于Mobile-SAM构建,以降低计算成本与模型大小,同时保持高性能。
- 编码器采用改进的ViT-Tiny主干网络,并在多层中插入WPMD模块,以增强结构特征学习能力。
- 解码器采用双向注意力机制,整合多粒度特征,提升对小目标与复杂目标的分割精度。
实验结果
研究问题
- RQ1尽管存在自然图像与红外图像之间的域差距,预训练的分割一切模型(SAM)是否能被有效适配于红外小目标检测?
- RQ2在温度变化细微、信噪比低的红外图像中,如何进一步提升边缘保持与噪声抑制能力?
- RQ3如何最优地融合编码器输出的多粒度特征,以增强对小目标与结构复杂目标的掩码表示?
- RQ4与原始SAM及现有最先进方法相比,集成基于小波的扩散模块与多粒度解码器对性能有何影响?
主要发现
- IRSAM在NUAA-SIRST数据集上取得80.78的IoU分数,显著优于Mobile-SAM基线模型(75.84)及其他最先进方法。
- 消融实验表明,若移除WPMD模块,IoU下降2.05分,且误报率(Fa)从3.95上升至11.18,证明其在边缘保持中的关键作用。
- GAD模块通过融合浅层与深层特征,实现最高性能(IoU: 80.78,nIoU: 78.39),优于仅使用浅层或深层特征的配置。
- 在编码器中使用四个WPMD模块可获得最佳性能,其特征图显示更强的目标激活与更低的噪声水平,优于使用更少模块的情况。
- 可视化对比结果表明,IRSAM在保持精细结构细节与抑制背景杂波方面优于拉普拉斯与Sobel基边缘检测方法。
- 在IRSTD-1K与NUDT-SIRST数据集中,IRSAM在客观指标(IoU、nIoU)与主观评估中均达到最先进水平,证实其在多样化红外成像条件下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。