[논문 리뷰] HIC-YOLOv5: Improved YOLOv5 For Small Object Detection
HIC-YOLOv5는 고해상도 특징 맵을 위한 전용 소형 객체 탐지 헤드(SODH), 백본과 넹 사이에 통합된 인벌루션 블록, 그리고 백본 끝단에 통합된 경량 CBAM 주의 모듈을 도입하여 소형 객체 탐지에 최적화된 개선된 YOLOv5 모델을 제안한다. 이는 기존 주의 기반 접근 방식에 비해 계산 비용을 감소시키면서도 VisDrone-2019-DET 데이터셋에서 mAP@[.5:.95] 기준 6.42%의 절대적 향상과 mAP@0.5 기준 9.38%의 향상을 달성한다.
Small object detection has been a challenging problem in the field of object detection. There has been some works that proposes improvements for this task, such as adding several attention blocks or changing the whole structure of feature fusion networks. However, the computation cost of these models is large, which makes deploying a real-time object detection system unfeasible, while leaving room for improvement. To this end, an improved YOLOv5 model: HIC-YOLOv5 is proposed to address the aforementioned problems. Firstly, an additional prediction head specific to small objects is added to provide a higher-resolution feature map for better prediction. Secondly, an involution block is adopted between the backbone and neck to increase channel information of the feature map. Moreover, an attention mechanism named CBAM is applied at the end of the backbone, thus not only decreasing the computation cost compared with previous works but also emphasizing the important information in both channel and spatial domain. Our result shows that HIC-YOLOv5 has improved mAP@[.5:.95] by 6.42% and mAP@0.5 by 9.38% on VisDrone-2019-DET dataset.
연구 동기 및 목표
- 고고도에서 촬영된 UAV 기반 영상에서 객체가 매우 작게 나타나는 상황에서 소형 객체 탐지의 과제를 해결하기 위해.
- 저해상도 특징 맵과 부족한 채널 표현으로 인해 YOLOv5가 소형 및 극소형 객체를 탐지하는 데 한계를 보이는 문제를 해결하기 위해.
- 기존 주의 기반 또는 구조적 수정 방식에 비해 정확도 향상과 함께 계산 비용을 감소시키기 위해.
- 구조적 복잡성과 파라미터 증가를 최소화하여 실시간 추론 능력을 유지하기 위해.
제안 방법
- 고해상도 특징 맵을 처리할 수 있는 전용 소형 객체 탐지 헤드(SODH)를 도입하여 극소형 및 소형 객체의 정밀한 위치 추정과 분류 성능을 향상시킨다.
- 백본과 넹 사이에 인벌루션 블록을 삽입하여 채널 간 상호작용을 강화하고, 파라미터 증가를 최소화하면서도 채널 기반 표현을 풍부하게 한다.
- 백본 끝단에 경량 CBAM 주의 모듈을 적용하여 중요한 공간적 및 채널적 특징을 선택적으로 강조함으로써 불필요한 계산을 줄인다.
- 중심 자르기(center crop)와 같은 데이터 증강 기법을 활용하여 소형 객체 탐지에 대한 견고성과 일반화 능력을 향상시킨다.
- SODH, 인벌루션, CBAM의 세 구성 요소를 YOLOv5-6.0 아키텍처에 통합하여 HIC-YOLOv5를 구성함으로써 실시간 추론 능력을 유지한다.

실험 결과
연구 질문
- RQ1전용 고해상도 예측 헤드가 YOLOv5에서 소형 객체 탐지 성능을 향상시킬 수 있는가?
- RQ2백본과 넹 사이에 인벌루션 블록을 도입함으로써 계산 비용을 증가시키지 않으면서도 소형 객체 탐지에 적합한 특징 표현을 향상시킬 수 있는가?
- RQ3경량 CBAM 주의 모듈이 트랜스포머와 같은 무거운 주의 메커니즘보다 소형 객체 탐지에서 성능을 뛰어나게 하면서도 추론 오버헤드를 줄일 수 있는가?
- RQ4SODH, 인벌루션, CBAM와 같은 개별 구성 요소가 VisDrone-2019-DET 데이터셋에서 전체 mAP 향상에 기여하는 정도는 어느 정도인가?
주요 결과
- HIC-YOLOv5는 YOLOv5s에 비해 VisDrone-2019-DET 테스트 세트에서 mAP@[.5:.95] 기준 6.42%의 절대적 향상과 mAP@0.5 기준 9.38%의 향상을 달성한다.
- SODH 도입만으로도 mAP@.5는 8.31% 향상되고, mAP@[.5:.95]는 5.51% 향상되어 주도적인 기여를 확인할 수 있다.
- SODH와 함께 인벌루션 블록을 적용할 경우 mAP@.5는 추가로 0.66% 향상되고, mAP@[.5:.95]는 0.57% 향상된다.
- CBAM는 mAP@.5에서 0.41%, mAP@[.5:.95]에서 0.34% 향상시키며, 낮은 오버헤드로도 특징 정제에 효과적임을 입증한다.
- 제거 실험 결과, SODH 없이 CBAM나 인벌루션 블록만으로는 충분한 성능 향상이 이뤄지지 않음을 확인하여 다중 해상도 특징 활용의 필수성을 강조한다.
- 기존 주의 기반 모델(예: Wang et al. [11])에 비해 HIC-YOLOv5는 모델 파라미터와 기울기 수치를 감소시켜 8.39M 파라미터 대비 14.58M로 계산 비용이 낮음을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.