[논문 리뷰] On the Robustness of Object Detection Models on Aerial Images
이 논문은 항공 영상에서 객체 검출 모델의 내성에 대한 평가를 위한 두 가지 새로운 벤치마크를 소개한다: 19종의 일반적인 손상과 항공 영상에서 흔한데 자연 영상에서는 드문 구름 손상에 특화된 벤치마크이다. 연구 결과, 더 큰 모델, 향상된 백본 아키텍처(예: ConvNeXt-T, Swin-L), 회전 불변 모듈(RiRoI Align), 전략적 데이터 증강 기법이 특히 구름에 의한 손상과 분포 이탈 조건에서 내성 향상에 기여한다.
The robustness of object detection models is a major concern when applied to real-world scenarios. The performance of most models tends to degrade when confronted with images affected by corruptions, since they are usually trained and evaluated on clean datasets. While numerous studies have explored the robustness of object detection models on natural images, there is a paucity of research focused on models applied to aerial images, which feature complex backgrounds, substantial variations in scales, and orientations of objects. This paper addresses the challenge of assessing the robustness of object detection models on aerial images, with a specific emphasis on scenarios where images are affected by clouds. In this study, we introduce two novel benchmarks based on DOTA-v1.0. The first benchmark encompasses 19 prevalent corruptions, while the second focuses on the cloud-corrupted condition-a phenomenon uncommon in natural images yet frequent in aerial photography. We systematically evaluate the robustness of mainstream object detection models and perform necessary ablation experiments. Through our investigations, we find that rotation-invariant modeling and enhanced backbone architectures can improve the robustness of models. Furthermore, increasing the capacity of Transformer-based backbones can strengthen their robustness. The benchmarks we propose and our comprehensive experimental analyses can facilitate research on robust object detection on aerial images. The codes and datasets are available at: https://github.com/hehaodong530/DOTA-C.
연구 동기 및 목표
- 항공 영상에서 객체 검출 모델의 내성 평가를 위한 표준화된 벤치마크 부족 문제를 해결하기 위해.
- 일반적인 영상 손상과 항공 영상에서 흔한 구름 전용 왜곡이 최신 객체 검출 모델의 성능에 미치는 영향을 조사하기 위해.
- 분포 이탈 상황에서 항공 영상 객체 검출의 내성을 향상시키는 아키텍처적 요소와 학습 전략을 규명하기 위해.
- 새로운 손상 유형을 포함한 분포 이탈 데이터에 대해 주류 모델의 종합적인 평가를 수행하기 위해.
- 백본 선택, 모델 용량, 데이터 증강 전략에 대한 분석을 통해 더 내성적인 항공 영상 객체 검출기 설계에 실질적인 통찰을 제공하기 위해.
제안 방법
- ImageNet-C에서 유래한 19종의 표준 손상과 5단계의 심각도 수준을 적용하여 DOTA-v1.0 기반의 손상 벤치마크를 구축하였다.
- 실제 위성 영상에서 촬영한 대기적 구름을 청소된 항공 영상에 적용하여 현실적인 시뮬레이션을 구현함으로써, 새로운 구름 손상 벤치마크를 개발하였다.
- 학습 중 손상에 노출되지 않은 채로, 청소된 테스트 세트와 손상된 테스트 세트에서 여러 최신 객체 검출 모델(RoI Transformer, ReDet 등)을 훈련 및 평가하였다.
- 백본 아키텍처(ResNet, ConvNeXt, Swin), 모델 용량(파라미터 수), 모듈(RiRoI Align) 및 데이터 증강 전략(RandomRotate, Mosaic)에 대한 분석을 수행하였다.
- mAP@50, rPC(상대적 성능 저하), $ PC_{\text{clouds}}$를 사용하여 다양한 손상 유형과 심각도 수준에서 내성을 정량화하였다.
- 노이즈, 블러, 날씨, 디지털 등 손상 유형 간 비교 분석을 수행하여 다양한 왜곡 유형에서의 모델 내성 수준을 평가하였다.
실험 결과
연구 질문
- RQ1RoI Transformer나 ReDet와 같은 주류 객체 검출 모델은 밝기, 눈, 블러와 같은 일반적인 영상 왜곡이 가해진 항공 영상에서 어떻게 성능을 발휘하는가?
- RQ2항공 영상에서 흔한데 자연 영상에서는 드문 구름 손상이 최신 모델의 검출 성능에 얼마나 큰 영향을 미치는가?
- RQ3백본, 주의 모듈 등 아키텍처 구성 요소와 데이터 증강 전략 등 학습 전략 중에서 분포 이탈 상황에서 내성을 향상시키는 데 가장 효과적인 것은 무엇인가?
- RQ4모델 용량을 증가시켜(Swin-T에서 Swin-L로) 내성은 다양한 손상 유형에서 어떻게 변화하는가?
- RQ5RandomRotate 및 Mosaic와 같은 데이터 증강 기법은 내성 향상에 항상 유익한가, 아니면 손상 유형에 따라 효과가 다를까?
주요 결과
- RoI Transformer나 ReDet와 같은 모든 평가된 모델이 손상된 항공 영상에서 성능 저하를 보였으며, 심각한 손상 조건에서 mAP@50가 평균 40% 감소하였다.
- 백본을 ConvNeXt-T나 Swin-L로 교체함으로써 내성 향상이 가장 두드러졌으며, 다양한 손상 유형에서 rPC 값이 평균 15% 이상 향상되었다.
- RiRoI Align 모듈은 블러 손상에 대해 내성을 크게 향상시켰으며, 표준 RoI Align 대비 rPC가 6% 이상 향상되었다.
- 더 큰 모델(Swin-L)은 모든 손상 유형에서 더 작은 버전(Swin-T)보다 뛰어난 성능을 보였으며, 날씨 손상에서 rPC가 최대 17% 향상되었다.
- RandomRotate 및 Mosaic와 같은 데이터 증강 기법은 일관된 이점을 보이지 않았다. 특히 디지털 손상에서는 성능 저하가 발생하여 내성 향상에 대한 일반화 능력이 제한됨을 시사하였다.
- ConvNeXt-T 백본을 사용한 모델은 노이즈 손상(47.17%)과 날씨 손상(74.82%)에서 가장 높은 rPC를 기록했고, ReDet는 블러 손상에서 최고의 rPC(56.77%)를 기록하여 아키텍처 특화 설계의 중요성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.