[논문 리뷰] SuperYOLO: Super Resolution Assisted Object Detection in Multimodal Remote Sensing Imagery
SuperYOLO는 초해상도(SR) 지도를 학습 중에 활용하여 소형 물체의 고해상도 특징 학습을 향상시키는 경량이며 실시간 동작 가능한 다중모달 원격 감지 영상용 객체 검출 프레임워크를 제안한다. 추론 시에는 SR 브랜치를 제거하여 계산 비용을 낮춘다. VEDAI에서 75.09%의 mAP50 성능을 기록하여 YOLOv5x와 같은 최신 기술 모델보다 10% 이상 높으며, 파rameter 수는 18배 적고 GFLOPs는 3.8배 적다.
Accurately and timely detecting multiscale small objects that contain tens of pixels from remote sensing images (RSI) remains challenging. Most of the existing solutions primarily design complex deep neural networks to learn strong feature representations for objects separated from the background, which often results in a heavy computation burden. In this article, we propose an accurate yet fast object detection method for RSI, named SuperYOLO, which fuses multimodal data and performs high-resolution (HR) object detection on multiscale objects by utilizing the assisted super resolution (SR) learning and considering both the detection accuracy and computation cost. First, we utilize a symmetric compact multimodal fusion (MF) to extract supplementary information from various data for improving small object detection in RSI. Furthermore, we design a simple and flexible SR branch to learn HR feature representations that can discriminate small objects from vast backgrounds with low-resolution (LR) input, thus further improving the detection accuracy. Moreover, to avoid introducing additional computation, the SR branch is discarded in the inference stage, and the computation of the network model is reduced due to the LR input. Experimental results show that, on the widely used VEDAI RS dataset, SuperYOLO achieves an accuracy of 75.09% (in terms of mAP50 ), which is more than 10% higher than the SOTA large models, such as YOLOv5l, YOLOv5x, and RS designed YOLOrs. Meanwhile, the parameter size and GFLOPs of SuperYOLO are about 18 times and 3.8 times less than YOLOv5x. Our proposed model shows a favorable accuracy and speed tradeoff compared to the state-of-the-art models. The code will be open-sourced at https://github.com/icey-zhang/SuperYOLO.
연구 동기 및 목표
- 다양한 크기의 소형 물체(종종 수 픽셀 수준)를 고해상도 원격 감지 영상(RSI)에서 높은 정확도와 낮은 계산 비용으로 검출하는 문제를 해결한다.
- 경량이며 대칭적인 복합 융합 기반의 다중모달 데이터(예: RGB 및 적외선) 융합 기법을 통해 소형 물체 검출 성능을 향상시킨다.
- 추론 시 복잡도를 증가시키지 않고도 소형 물체의 특징 표현을 향상시키기 위해 학습 전용으로 가속 가능한 초해상도(SR) 브랜치를 도입한다.
- 추론 시 SR 브랜치를 제거함으로써 정확도-속도의 균형을 확보하고 원래 모델의 효율성을 유지한다.
제안 방법
- RGB 및 적외선 모달리티에서 보다 효율적인 특징 추출을 위해 픽셀 수준에서 보완적인 특징을 추출하는 대칭적이고 경량적인 다중모달 융합(MF) 모듈을 설계한다.
- 작은 밀집 물체의 정확한 위치 추정을 위해 해상도 저하를 방지하기 위해 핵심 네트워크에서 Focus 모듈을 제거한다.
- 학습 중에 단순하고 유연한 초해상도(SR) 브랜치를 도입하여 네트워크가 소형 물체를 복잡한 배경과 구분할 수 있는 고해상도 특징을 학습하도록 유도한다.
- 추론 시에는 SR 브랜치를 제거함으로써 추가적인 계산 부담 없이 원래 모델의 추론 속도와 파라미터 수를 유지한다.
- 객체 검출과 SR 지도를 동시에 고려한 병합 손실 함수를 사용하여 특징 추출기의 소형 물체에 대한 구분 능력을 향상시킨다.
- 최종 모델은 VEDAI, DOTA, NWPU, DIOR 데이터셋에서 mAP50를 주요 평가 지표로 사용하여 평가되며, 아블레이션 스터디를 통해 각 구성 요소의 기여도를 검증한다.
실험 결과
연구 질문
- RQ1추론 비용을 증가시키지 않고도 학습 중 초해상도 지도를 활용하면 소형 물체 검출 성능이 향상되는가?
- RQ2RGB 및 적외선 데이터의 다중모달 융합은 복잡한 배경에서 소형 물체 검출 정확도를 어떻게 향상시키는가?
- RQ3경량 초해상도(SR) 브랜치는 추론 시 제거되더라도 소형 물체의 특징 표현을 얼마나 향상시킬 수 있는가?
- RQ4YOLO 기반 검출기에서 SR과 다중모달 융합을 통합할 경우 정확도, 모델 크기, 계산 비용 간의 상호 교환 관계는 어떠한가?
- RQ5다양한 원격 감지 벤치마크에서 SuperYOLO는 mAP50, 파라미터 수, GFLOPs 측면에서 최신 기술 모델과 비교해 어떤 성능을 보이는가?
주요 결과
- VEDAI 데이터셋에서 SuperYOLO는 75.09%의 mAP50 성능을 기록하여 YOLOv5s보다 18.30% 높고, YOLOv5x보다 12.44% 이상 높다.
- DOTA, NWPU, DIOR 데이터셋에서 SuperYOLO는 각각 69.99%, 93.30%, 71.82%의 mAP50 성능을 기록하여 최신 기술 수준을 확보했다.
- DOTA에서 모델은 단지 7.70M 파라미터와 20.89 GFLOPs를 차지하여 YOLOv5x 대비 파라미터 수는 18배 작고, 계산 비용은 3.8배 더 효율적이다.
- 아블레이션 스터디 결과, Focus 모듈 제거가 소형 물체 검출 성능을 향상시키며, SR 브랜치 도입이 성능 향상에 기여하지만 추론 속도에 영향을 주지 않는다.
- 대칭적이고 경량적인 다중모달 융합 모듈은 특징 표현을 효과적으로 향상시켜 모든 데이터셋에서 검출 정확도 향상에 기여한다.
- SR 브랜치는 소형 물체의 고해상도 특징 학습에 효과적이며, 추론 시 제거되어 성능 저하나 추가 지연 없이도 안정적인 성능 유지를 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.