[논문 리뷰] Local Contrast and Global Contextual Information Make Infrared Small Object Salient Again
이 논문은 중심 차분 합성곱(CDC)을 통해 局부 대비를 향상시키고, 빠른 푸리에 합성곱(FFC)을 통해 전역적 맥락을 포착하면서도 고해상도 특징을 유지하는 U-Net 기반 모델인 UCFNet을 제안한다. 이는 적외선 소형 객체 분할(ISOS)에 대해 최신 기준 성능을 달성하며, mIoU와 탐지 재현율을 크게 향상시키고 거짓 경고를 감소시킨다.
Infrared small object detection (ISOS) aims to segment small objects only covered with several pixels from clutter background in infrared images. It's of great challenge due to: 1) small objects lack of sufficient intensity, shape and texture information; 2) small objects are easily lost in the process where detection models, say deep neural networks, obtain high-level semantic features and image-level receptive fields through successive downsampling. This paper proposes a reliable detection model for ISOS, dubbed UCFNet, which can handle well the two issues. It builds upon central difference convolution (CDC) and fast Fourier convolution (FFC). On one hand, CDC can effectively guide the network to learn the contrast information between small objects and the background, as the contrast information is very essential in human visual system dealing with the ISOS task. On the other hand, FFC can gain image-level receptive fields and extract global information while preventing small objects from being overwhelmed.Experiments on several public datasets demonstrate that our method significantly outperforms the state-of-the-art ISOS models, and can provide useful guidelines for designing better ISOS deep models. Code are available at https://github.com/wcyjerry/BasicISOS.
연구 동기 및 목표
- 소형 객체가 충분한 강도, 형태, 질감 정보를 갖지 못하는 적외선 소형 객체 분할(ISOS) 문제를 해결하기 위해.
- 깊은 네트워크에서 과도한 다운샘플링으로 인해 소형 객체 정보가 손실되는 문제를 완화하기 위해.
- 더 높은 분할 정확도를 위해 국소 대비와 전역 맥락 정보를 효과적으로 통합하는 딥 러닝 모델을 설계하기 위해.
- 기존 최고 수준의 방법들을 능가하는 신뢰성 있고 일반화 능력이 뛰어난 ISOS용 백본을 제공하기 위해.
제안 방법
- 제안된 UCFNet 아키텍처는 중심 차분 합성곱(CDC)으로 개선된 U-Net 변종으로, 소형 객체와 배경 간의 대비를 강조함으로써 인간 시각 시스템의 행동을 모방한다.
- CDC는 가중치 매개변수 θ를 사용해 중심 픽셀 값과 그 주변 이웃 픽셀 값 간의 차이를 계산하여, 어두운 소형 객체를 탐지하는 데 핵심적인 국소 대비 특징을 강화한다.
- 빠른 푸리에 합성곱(FFC)은 주파수 도메인에서 합성곱을 수행함으로써 고해상도 특징 맵으로부터 전역 맥락을 추출한다. 이는 다운샘플링 없이 이미지 수준의 수신 영역을 가능하게 한다.
- FFC 블록은 잔차 단위에 쌓여 공간적 세부 정보를 유지하면서 장거리 의존성을 집계하여, 특징 추상화 과정에서 소형 객체가 손실되지 않도록 한다.
- 모델은 인코더 및 디코더 경로에 CDC와 FFC를 통합하여 국소 긍지와 전역 맥락 인식을 동시에 최적화한다.
- 제거 실험을 통해 설계 선택 사항이 검증되었으며, CDC의 최적 θ=0.7과 FFC의 최적 5개의 잔차 블록이 가장 뛰어난 성능을 내는 것으로 확인되었다.
실험 결과
연구 질문
- RQ1저 SNR(신호 대 잡음비)를 가진 적외선 영상에서 소형 객체 탐지 성능을 향상시키기 위해 국소 대비 정보를 어떻게 효과적으로 추출할 수 있는가?
- RQ2깊이 있는 다운샘플링 층에 의존하지 않고도 고해상도 특징 맵에서 전역 맥락을 포착할 수 있는가?
- RQ3CDC와 FFC는 다른 고급 합성곱 연산자(예: 변형 가능, 게이팅)와 비교해 ISOS 작업에서 어떻게 성능을 내는가?
- RQ4국소 대비와 전역 맥락 정보를 최적화하기 위해 CDC와 FFC 구성 요소의 최적 설정은 무엇인가?
- RQ5CDC와 FFC를 함께 사용할 경우, 각각을 별도로 사용할 때보다 상호 보완적인 성능 향상을 이룰 수 있는가?
주요 결과
- UCFNet에 CDC와 FFC를 모두 적용한 결과, SIRST 데이터셋에서 mIoU가 80.89%로 가장 높게 기록되었으며, 기존 UCF 기반 베이스라인(74.14%)을 크게 능가했다.
- CDC만 추가했을 경우 mIoU가 1.81%p 향상되어 75.95%로 상승했고, 거짓 경고(Fa)는 4.83×10⁻⁶에서 3.46×10⁻⁶로 감소했다.
- FFC만 적용했을 경우 mIoU가 79.55%로 가장 높았고, Pd는 100%를 기록했으며, Fa는 1.82×10⁻⁶로 감소해 전역 맥락 학습의 효과를 입증했다.
- CDC와 FFC를 병합한 경우 최고의 종합 성능을 기록했으며, Pd는 100%로 유지되고 Fa는 2.22×10⁻⁶로 낮아, 높은 탐지 재현율과 낮은 거짓 경고를 동시에 확보했다.
- 제거 실험 결과, CDC의 최적 θ=0.7 설정과 FFC의 5개 잔차 블록이 최고 성능을 내어 설계의 강건성을 확인했다.
- 기타 대안들과 비교해 CDC는 ISOS에서 게이팅 및 변형 가능 합성곱보다 뛰어난 성능을 보였고, FFC는 확장 합성곱 및 더블 어텐션 모듈보다 mIoU 및 Fa 지표에서 모두 슈퍼리어한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.