Skip to main content
QUICK REVIEW

[논문 리뷰] IRSAM: Advancing Segment Anything Model for Infrared Small Target Detection

Mingjin Zhang, Yuchun Wang|arXiv (Cornell University)|2024. 07. 10.
Infrared Target Detection Methodologies인용 수 4
한 줄 요약

이 논문은 인프라레드 소형 목표물 탐지(IRSTD)를 위한 세그먼테이션 어芮브 모델(SAM)의 새로운 변형인 IRSAM을 제안한다. 인코더에 웨이블릿 기반 페라-말리 디퓨전(WPMD) 블록을 도입하여 특징 표현을 향상시키고, 다중 군집도 특징 융합을 위한 균형감각 디코더(GAD)를 적용하였다. 이 방법은 NUAA-SIRST, NUDT-SIRST, IRSTD-1K 벤치마크에서 최신 기술(SOTA) 성능을 달성하여 기존의 순수한 SAM 및 이전의 SOTA 방법들을 뛰어넘었다.

ABSTRACT

The recent Segment Anything Model (SAM) is a significant advancement in natural image segmentation, exhibiting potent zero-shot performance suitable for various downstream image segmentation tasks. However, directly utilizing the pretrained SAM for Infrared Small Target Detection (IRSTD) task falls short in achieving satisfying performance due to a notable domain gap between natural and infrared images. Unlike a visible light camera, a thermal imager reveals an object's temperature distribution by capturing infrared radiation. Small targets often show a subtle temperature transition at the object's boundaries. To address this issue, we propose the IRSAM model for IRSTD, which improves SAM's encoder-decoder architecture to learn better feature representation of infrared small objects. Specifically, we design a Perona-Malik diffusion (PMD)-based block and incorporate it into multiple levels of SAM's encoder to help it capture essential structural features while suppressing noise. Additionally, we devise a Granularity-Aware Decoder (GAD) to fuse the multi-granularity feature from the encoder to capture structural information that may be lost in long-distance modeling. Extensive experiments on the public datasets, including NUAA-SIRST, NUDT-SIRST, and IRSTD-1K, validate the design choice of IRSAM and its significant superiority over representative state-of-the-art methods. The source code are available at: github.com/IPIC-Lab/IRSAM.

연구 동기 및 목표

  • 자연 이미지와 인프라레드 이미지 간의 도메인 갭으로 인해 사전 학습된 SAM의 인프라레드 소형 목표물 탐지(IRSTD) 성능이 제한되는 문제를 해결하기 위해.
  • 저신호대잡음비율과 흐린 경계를 가지는 소형 목표물에 대해 특징 표현을 향상시키기 위해.
  • 인코더에서 경계 보존 및 노이즈 억제를 향상시키고, 디코더에서 다중 척도 및 다중 군집도 특징 융합을 개선하기 위해.
  • 경량이고 효율적인 아키텍처를 사용해 전이 학습을 통해 인프라레드 탐지 벤치마크에서 뛰어난 제로샷 및 미세조정 성능을 달성하기 위해.

제안 방법

  • WPMD 모듈은 페라-말리 디퓨전 방정식의 기울기 항을 웨이블릿 기반 변환으로 대체하여 인프라레드 이미지에서 경계 보존 및 노이즈 억제를 향상시킨다.
  • WPMD 블록은 SAM의 비전 트랜스포머 인코더의 여러 단계에 통합되어 다양한 추상화 수준에서 특징 추출을 정밀화한다.
  • 균형감각 디코더(GAD)는 양방향 트랜스포머를 통해 浅층 및 깊은 인코더 레이어의 특징을 융합하여 다양한 목표물 크기와 형태에서 마스크 표현을 향상시킨다.
  • 모델는 계산 비용과 모델 크기를 줄이기 위해 모바일-SAM 기반으로 구축되었으며, 높은 성능를 유지한다.
  • 인코더는 WPMD 블록을 여러 레이어에 삽입한 수정된 ViT-Tiny 백본을 사용하여 구조적 특징 학습을 향상시킨다.
  • 디코더는 다중 군집도 특징 융합을 향상시켜 소형 및 구조적으로 복잡한 목표물의 분할 정확도를 높이기 위해 이중 방향 어텐션 메커니즘을 활용한다.

실험 결과

연구 질문

  • RQ1자연 이미지와 인프라레드 이미지 간의 도메인 갭으로 인해 사전 학습된 세그먼테이션 어라이브 모델(SAM)이 인프라레드 소형 목표물 탐지에 효과적으로 적용될 수 있는가?
  • RQ2미세한 온도 변화와 저신호대잡음비율을 가지는 인프라레드 이미지에서 경계 보존 및 노이즈 억제를 어떻게 향상시킬 수 있는가?
  • RQ3인코더에서 다중 군집도 특징을 융합하는 최적의 방법은 무엇인가? 이는 소형 및 구조적으로 복잡한 목표물의 마스크 표현을 향상시키기 위함이다.
  • RQ4웨이블릿 기반 디퓨전 모듈과 다중 군집도 디코더를 통합했을 때, 기존의 순수한 SAM 및 기존의 SOTA 방법과 비교해 성능에 어떤 영향을 미치는가?

주요 결과

  • IRSAM은 NUAA-SIRST 데이터셋에서 IoU 점수 80.78을 기록하여 모바일-SAM 기준선(75.84) 및 기타 SOTA 방법들을 뛰어넘었다.
  • 제거 실험 결과, WPMD 모듈을 제거할 경우 IoU가 2.05점 감소하고, 거짓경고율(Fa)은 3.95에서 11.18로 증가하여, 경계 보존에서 이 모듈의 핵심적 역할을 입증했다.
  • 얕은 층과 깊은 층의 특징을 융합하는 GAD 모듈이 가장 높은 성능(이격점수: 80.78, nIoU: 78.39)을 기록했으며, 얕은 층 또는 깊은 층의 특징만 사용한 구성보다 뛰어난 성능을 보였다.
  • 인코더에 네 개의 WPMD 블록을 사용할 경우 최고의 성능를 기록했으며, 특징 맵에서 목표물 활성화가 강화되고 노이즈가 감소하는 것으로 확인되었다.
  • 시각적 비교 결과, IRSAM은 라플라시안 및 소벨 기반 경계 검출 방법보다 더 나은 세부 구조적 디테일 보존과 배경 잡음 억제 성능을 보였다.
  • IRSTD-1K 및 NUDT-SIRST 데이터셋에서 IRSAM은 객관적 지표(IoU, nIoU)와 주관적 평가 모두에서 최신 기술(SOTA) 성능을 기록하여 다양한 인프라레드 영상 조건에서의 강건성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.