Skip to main content
QUICK REVIEW

[논문 리뷰] MTU-Net: Multi-level TransUNet for Space-based Infrared Tiny Ship Detection

Tianhao Wu, Boyang Li|arXiv (Cornell University)|2022. 09. 28.
Infrared Target Detection Methodologies인용 수 15
한 줄 요약

이 논문은 공간 기반 적외선 미소 선박 탐지에 적합한 다중 수준 Vision Transformer-CNN 하이브리드 네트워크인 MTU-Net을 제안한다. 이는 새로운 CRRP 데이터 증강 방법과 FocalIoU 손실 함수를 활용하여 밝기가 약하고 크기가 작은, 변동성이 큰 목표물의 탐지 성능을 향상시킨다. 새로 도입된 NUDT-SIRST-Sea 데이터셋에서 MTU-Net은 64.14%의 IoU, 85.44%의 탐지 확률, 그리고 이미지당 11.72개의 잡음 신호를 기록하며 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Space-based infrared tiny ship detection aims at separating tiny ships from the images captured by earth orbiting satellites. Due to the extremely large image coverage area (e.g., thousands square kilometers), candidate targets in these images are much smaller, dimer, more changeable than those targets observed by aerial-based and land-based imaging devices. Existing short imaging distance-based infrared datasets and target detection methods cannot be well adopted to the space-based surveillance task. To address these problems, we develop a space-based infrared tiny ship detection dataset (namely, NUDT-SIRST-Sea) with 48 space-based infrared images and 17598 pixel-level tiny ship annotations. Each image covers about 10000 square kilometers of area with 10000X10000 pixels. Considering the extreme characteristics (e.g., small, dim, changeable) of those tiny ships in such challenging scenes, we propose a multi-level TransUNet (MTU-Net) in this paper. Specifically, we design a Vision Transformer (ViT) Convolutional Neural Network (CNN) hybrid encoder to extract multi-level features. Local feature maps are first extracted by several convolution layers and then fed into the multi-level feature extraction module (MVTM) to capture long-distance dependency. We further propose a copy-rotate-resize-paste (CRRP) data augmentation approach to accelerate the training phase, which effectively alleviates the issue of sample imbalance between targets and background. Besides, we design a FocalIoU loss to achieve both target localization and shape description. Experimental results on the NUDT-SIRST-Sea dataset show that our MTU-Net outperforms traditional and existing deep learning based SIRST methods in terms of probability of detection, false alarm rate and intersection over union.

연구 동기 및 목표

  • 장거리 촬영 거리와 광범위한 영상 커버리지로 인해 발생하는 극히 작은, 어두운, 변동성이 큰 선박을 공간 기반 적외선 영상에서 탐지하는 데 도전하는 것.
  • 기존의 단거리 SIRST 데이터셋과 방법론의 한계를 극복하여 공간 기반 환경에 일반화되지 못하는 문제를 해결하는 것.
  • 공간 기반 적외선 미소 선박 탐지에 적합한 대규모, 고해상도, 픽셀 수준의 레이블이 부여된 데이터셋을 개발하는 것.
  • 장거리 맥락적 의존성과 미소 목표물의 정확한 국소화 및 세그멘테이션을 효과적으로 포착할 수 있는 딥러닝 프레임워크를 설계하는 것.
  • 새로운 데이터 증강 및 손실 함수를 통해 복잡한 배경에서 잡음 신호를 줄이고 탐지 정확도를 향상시키는 것.

제안 방법

  • 지역적 및 장거리 의존성을 모두 포착하기 위해 컨볼루션 특징 맵과 Vision Transformer 블록을 조합한 다중 수준 특징 추출 모듈(MVTM)을 제안한다.
  • 맥락적 정보와 장거리 정보를 유지하면서 클래스 불균형 문제를 완화하기 위해 복사-회전-크기 조정-붙여넣기(CRRP) 데이터 증강 전략을 도입한다.
  • 고해상도 공간 기반 적외선 영상에서 계층적 다중 수준 특징을 추출하기 위해 Vision Transformer-CNN 하이브리드 인코더를 활용한다.
  • 어려운 샘플 마이닝과 IoU 최적화를 균형 있게 조절하여 미소 목표물의 국소화 정확도와 형태 기술 능력을 향상시키는 FocalIoU 손실 함수를 설계한다.
  • 제안된 손실 함수와 증강 기법을 사용하여 NUDT-SIRST-Sea 데이터셋에서 MTU-Net 모델을 엔드 투 엔드로 훈련시켜 탐지 성능의 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1장거리 촬영 거리와 광범위한 영상 커버리지로 인해 발생하는 극히 작은, 어두운 선박을 공간 기반 적외선 영상에서 탐지하기 위해 딥러닝 모델을 어떻게 적응시킬 수 있는가?
  • RQ2공간 기반 적외선 영상에서 클래스 불균형 문제를 효과적으로 완화하고 맥락적 정보를 유지하기 위해 어떤 데이터 증강 전략이 유용한가?
  • RQ3Vision Transformer와 CNN의 하이브리드 아키텍처가 표준 CNN보다 장거리 의존성을 더 효과적으로 포착하여 미소 목표물 탐지에 우월한가?
  • RQ4기존의 Focal 및 SoftIoU 손실 함수와 비교해 볼 때, 제안된 FocalIoU 손실 함수는 국소화 정확도와 형태 기술 능력에 어떻게 기여하는가?
  • RQ5제안된 MTU-Net 아키텍처는 새로운 대규모, 고해상도 공간 기반 적외선 선박 탐지 기준 데이터셋에서 탐지 성능을 얼마나 향상시키는가?

주요 결과

  • MTU-Net은 기준선인 Focal 손실(53.16%)과 SoftIoU 손실(62.00%)을 크게 능가하는 64.14%의 교차합집합률(IoU)을 기록한다.
  • 탐지 성공 확률(Pd)은 85.44%를 기록하며, Focal 손실 기준선 대비 0.74% 향상되어 미소 목표물에 대한 민감도가 향상됨을 보여준다.
  • 이미지당 잡음 신호 수는 11.72개로 감소하여 FocalIoU 손실이 배경 반응과 잡음 신호를 효과적으로 억제함을 입증한다.
  • CRRP 데이터 증강 방법은 장거리 맥락적 특징을 유지함으로써 잡음 신호를 감소시키고, 복잡한 배경에서의 일반화 능력을 향상시킨다.
  • NUDT-SIRST-Sea 데이터셋은 48장의 10000×10000 픽셀 영상으로 구성되며, 총 17,598개의 픽셀 수준 레이블을 포함하고 있으며, 기존 SIRST 데이터셋 중 평균 목표물 크기(1.7×1.7 픽셀)가 가장 작고, 신호 대 잡음비(SNR)가 가장 낮다.
  • 제안된 MTU-Net 모델은 CRRP 데이터 증강을 적용한 기준선 대비 IoU에서 11.96×10⁻⁶ 향상되고, 잡음 신호율은 5.05% 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.