Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Modality Fusion Transformer for Multispectral Object Detection

Qingyun Fang, Han Da-peng|arXiv (Cornell University)|2021. 10. 30.
Remote-Sensing Image Classification인용 수 14
한 줄 요약

이 논문은 다중스펙트럼 물체 검출을 위한 새로운 이중스트림 백본인 크로스모달리티 퓌전 트랜스포머(CFT)를 제안한다. CFT는 트랜스포머의 자기주의 메커니즘을 활용하여 RGB 및 열화상 모달리티 간의 내부 및 상호 모달리티 특징 표현을 동시에 학습한다. 전역적 맥락 정보와 장거리 의존성을 통합함으로써, CFT는 FLIR, LLVIP, VEDAI 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 각각 mAP50 점수 78.5, 97.5, 85.3을 기록한다.

ABSTRACT

Multispectral image pairs can provide the combined information, making object detection applications more reliable and robust in the open world. To fully exploit the different modalities, we present a simple yet effective cross-modality feature fusion approach, named Cross-Modality Fusion Transformer (CFT) in this paper. Unlike prior CNNs-based works, guided by the transformer scheme, our network learns long-range dependencies and integrates global contextual information in the feature extraction stage. More importantly, by leveraging the self attention of the transformer, the network can naturally carry out simultaneous intra-modality and inter-modality fusion, and robustly capture the latent interactions between RGB and Thermal domains, thereby significantly improving the performance of multispectral object detection. Extensive experiments and ablation studies on multiple datasets demonstrate that our approach is effective and achieves state-of-the-art detection performance. Our code and models are available at https://github.com/DocF/multispectral-object-detection.

연구 동기 및 목표

  • 다중스펙트럼 물체 검출에서 RGB 및 열화상 모달리티 간의 보완적 특징을 효과적으로 융합하는 문제를 해결하기 위해.
  • 장거리 의존성과 전역 맥락을 포착하는 데 한계가 있는 컨volution 네트워크(CNN) 기반 융합 방법의 한계를 극복하기 위해.
  • 트랜스포머가 물체 검출을 위한 크로스모달리티 특징 융합 잠재력을 탐색하기 위해.
  • 동시로 내모달리티 및 상호모달리티 특징 통합을 수행하는 단순하면서도 효과적인 융합 모듈을 설계하기 위해.

제안 방법

  • CFT 모듈은 이중스트림 네트워크의 백본에 통합되어 RGB 및 열화상 브랜치 간의 공동 특징 학습을 가능하게 한다.
  • 트랜스포머 내 자기주의 메커니즘은 전역 수신장역할을 가능하게 하여 특징 맵 간의 장거리 의존성을 포착할 수 있다.
  • CFT 모듈은 양 모달리티에서의 쿼리, 키, 밸류 특징 간의 크로스어텐션을 계산하여 특징 융합을 수행한다.
  • 공유된 어텐션 메커니즘을 통해 내모달리티 및 상호모달리티 표현을 통합하여 특징 표현을 향상시킨다.
  • CFT는 백본 네트워크의 여러 스테이지에 걸쳐 조밀하게 적용되어 점진적으로 특징을 정밀화한다.
  • 이 방법은 YOLOv5와 같은 일단계(detector) 및 Faster R-CNN과 같은 이단계(detector) 모두와 호환되어 광범위한 적용 가능성을 보여준다.

실험 결과

연구 질문

  • RQ1트랜스포머의 자기주의 메커니즘이 다중스펙트럼 특징 맵에서 물체 검출을 위해 장거리 의존성을 효과적으로 포착할 수 있는가?
  • RQ2내모달리티 및 상호모달리티 특징 융합을 통합된 프레임워크에서 동시에 달성할 수 있는가?
  • RQ3트랜스포머를 통해 전역 맥락 정보를 통합하면 다중스펙트럼 환경에서 검출 정확도가 향상되는가?
  • RQ4트랜스포머 기반 융합 모듈이 기존의 CNN 기반 융합 방법보다 다중스펙트럼 물체 검출에서 뛰어난 성능을 낼 수 있는가?

주요 결과

  • CFT 모듈은 FLIR 데이터셋에서 최신 기술 수준의 mAP50 78.5점을 기록하며, 이전 최고 성능 방법보다 6.3점 높게 달성했다.
  • LLVIP 데이터셋에서는 CFT 모델이 mAP50 97.5점과 mAP 63.6점을 기록하여 기준 모델 대비 각각 9.3%, 10.0% 향상되었다.
  • VEDAI 항공 다중스펙트럼 데이터셋에서 CFT 모델은 mAP50 85.3점과 mAP 56.0점을 기록하며, 최고의 단일모달리티 네트워크보다 mAP50에서 9.3% 향상되었다.
  • 절단 분석 결과, CFT 모듈이 내모달리티 및 상호모달리티 특징을 동시에 모델링할 수 있는 능력이 성능 향상의 핵심 요소임을 확인했다.
  • 이 방법은 YOLOv5, YOLOv3, Faster R-CNN 등 다양한 검출기 아키텍처에서 효과적이며, 강력한 일반화 능력을 보여주었다.
  • 시각화 결과, CFT는 저조도 또는 가림 상태와 같은 도전적인 조건에서도 특징의 구분 능력과 공간 일관성을 향상시킴을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.