Skip to main content
QUICK REVIEW

[논문 리뷰] Infrared Small-Dim Target Detection with Transformer under Complex Backgrounds

Fangcen Liu, Chenqiang Gao|arXiv (Cornell University)|2021. 09. 29.
Infrared Target Detection Methodologies참고 문헌 57인용 수 27
한 줄 요약

논문은 적외선 소형 표적 탐지를 위해 self-attention 기반 대범위 특징 상호작용, 판별적 표적 특징 강화 모듈, 그리고 표적 정보를 보존하는 U-넷 유사 디코더를 활용하는 트랜스포머 기반 프레임워크를 제안하여 MFIRST 및 SIRST 데이터셋에서 최첨단 결과를 달성한다.

ABSTRACT

The infrared small-dim target detection is one of the key techniques in the infrared search and tracking system. Since the local regions similar to infrared small-dim targets spread over the whole background, exploring the interaction information amongst image features in large-range dependencies to mine the difference between the target and background is crucial for robust detection. However, existing deep learning-based methods are limited by the locality of convolutional neural networks, which impairs the ability to capture large-range dependencies. Additionally, the small-dim appearance of the infrared target makes the detection model highly possible to miss detection. To this end, we propose a robust and general infrared small-dim target detection method with the transformer. We adopt the self-attention mechanism of the transformer to learn the interaction information of image features in a larger range. Moreover, we design a feature enhancement module to learn discriminative features of small-dim targets to avoid miss detection. After that, to avoid the loss of the target information, we adopt a decoder with the U-Net-like skip connection operation to contain more information of small-dim targets. Finally, we get the detection result by a segmentation head. Extensive experiments on two public datasets show the obvious superiority of the proposed method over state-of-the-art methods and the proposed method has stronger cross-scene generalization and anti-noise performance.

연구 동기 및 목표

  • 대상이 매우 작고 잡음과 쉽게 혼동되는 복잡한 배경하에서 강건한 적외선 소형 표적 탐지를 목표로 한다.
  • 이미지 토큰 간의 장거리 의존성을 모델링하기 위해 셀프 어텐션을 활용하여 CNN의 지역성 한계를 극복한다.
  • 전용 특징 강화 모듈을 통해 소형 표적의 판별 특징을 강화한다.
  • U-넷과 유사한 디코더를 통해 표적 정보를 보전하여 분할 기반 탐지를 개선한다.
  • 최첨단 방법들과 비교하여 우수한 성능과 교차 장면 일반화 능력을 입증한다.

제안 방법

  • 위치를 인코딩된 간결한 특징 토큰을 얻기 위해 ResNet-50 기반 특징 임베딩 모듈로 이미지를 임베딩한다.
  • k개의 인코더 층으로 구성된 합성 인코더를 사용하되 각 층은 다중-헤드 셀프 어텐션(MSA)과 특징 강화 모듈(FEM)을 포함하여 대범위 상호작용을 학습하고 소형 표적 특징을 강화한다.
  • U-넷 유사한 스킵 연결 디코더를 채용하여 특징을 업샘플링하고 융합하며 분할용 신뢰도 맵을 생성한다.
  • 시그모이드 기반 신뢰도 맵과 적응 임계처리를 최종 탐지에 적용한다. 손실은 클래스 불균형을 다루기 위해 IoU 목적함수를 포함하고 소형 표적 영역에 초점을 둔다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 CNN보다 복잡한 배경에서 아주 작은 적외선 표적을 구분하기 위해 대범위 상호작용을 포착할 수 있는가?
  • RQ2전용 특징 강화 모듈이 트랜스포머 프레임워크 내에서 소형 표적의 판별력을 향상시키는가?
  • RQ3U-넷 유사 디코더가 업샘플링 중 소형 표적 정보를 보존하는 데 도움이 되어 정확한 탐지를 가능하게 하는가?
  • RQ4제안된 방법이 교차 장면 시나리오와 가우시안 잡음 추가 하에서 기존 방법과 비교하여 어떤 성능을 보이는가?

주요 결과

  • 제안된 방법은 MFIRST와 SIRST 데이터셋에서 Pd, AUC, F1 점수 측면에서 대상 유형에 관계없이 최신 모델 기반 및 딥러닝 방법을 능가한다.
  • MFIRST에서 Pd 90.08% 및 AUC 89.34%를 달성하고 F1t 92.59% 및 F1p 64.59%를 얻었으며, SIRST에서는 Pd 100.00% 및 AUC 99.14%를 달성하고 F1t 98.62% 및 F1p 83.16%를 달성한다(소요 시간: 100장당 6.41초).
  • 소거 연구는 풀링 계층을 제거하면 성능이 저하되고, 특징 강화 모듈과 심층 인코더를 추가하면 MFIRST에서 Pd가 약 3.03%, AUC가 약 4.57% 향상됨을 보여준다.
  • 이 방법은 ACM 및 MDvsFA보다 교차 장면 일반화가 더 강하게 나타나는데, 예를 들어 MFIRST로 학습된 모델이 SIRST에서 테스트할 때 MDvsFA 대비 Pd 약 0.93%p, AUC 약 2.07%p 우수; SIRST로 학습된 모델이 MFIRST에서 테스트할 때 ACM 대비 Pd 약 20.52%p, AUC 약 23.53%p 우수하다.
  • 가우시안 잡음 하에서 제안된 방법은 더 우수한 강건성을 유지하며 잡음 분산이 증가함에 따라 경쟁 방법들에 비해 성능 저하가 느리게 나타난다.
  • 정성적 결과는 높은 잡음, 혼잡한 장면, 어두운 표적 등 매우 도전적인 배경에서 거짓경보가 적고 표적 보존이 더 우수함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.