[논문 리뷰] HRDNet: High-resolution Detection Network for Small Objects
HRDNet은 다중 해상도, 다중 깊이 특징을 통합하는 다중 깊이 이미지 피라미드 네트워크(MD-IPN)와 다중 해상도 특징 피라미드 네트워크(MS-FPN)를 통해 고해상도 검출 네트워크로, MS COCO, Pascal VOC 및 VisDrone2019에서 최신 기술 수준의 성능을 달성한다. 기존 방법 대비 소형 객체에 대해 4.9% 이상의 AP 향상을 기록한다.
Small object detection is challenging because small objects do not contain detailed information and may even disappear in the deep network. Usually, feeding high-resolution images into a network can alleviate this issue. However, simply enlarging the resolution will cause more problems, such as that, it aggravates the large variant of object scale and introduces unbearable computation cost. To keep the benefits of high-resolution images without bringing up new problems, we proposed the High-Resolution Detection Network (HRDNet). HRDNet takes multiple resolution inputs using multi-depth backbones. To fully take advantage of multiple features, we proposed Multi-Depth Image Pyramid Network (MD-IPN) and Multi-Scale Feature Pyramid Network (MS-FPN) in HRDNet. MD-IPN maintains multiple position information using multiple depth backbones. Specifically, high-resolution input will be fed into a shallow network to reserve more positional information and reducing the computational cost while low-resolution input will be fed into a deep network to extract more semantics. By extracting various features from high to low resolutions, the MD-IPN is able to improve the performance of small object detection as well as maintaining the performance of middle and large objects. MS-FPN is proposed to align and fuse multi-scale feature groups generated by MD-IPN to reduce the information imbalance between these multi-scale multi-level features. Extensive experiments and ablation studies are conducted on the standard benchmark dataset MS COCO2017, Pascal VOC2007/2012 and a typical small object dataset, VisDrone 2019. Notably, our proposed HRDNet achieves the state-of-the-art on these datasets and it performs better on small objects.
연구 동기 및 목표
- 딥 네트워크에서의 다운샘플링으로 인해 소형 객체의 구분 능력 있는 특징이 손실되는 문제를 해결하기 위해.
- 고해상도 입력의 이점(공간적 세부 정보 유지)과 단점(계산 비용 증가 및 스케일 변동성) 사이의 상충 관계를 해결하기 위해.
- 소형 및 대형 객체 모두에 대해 높은 검출 정확도를 유지하면서 계산 오버헤드를 최소화하기 위해.
- 다양한 해상도와 깊이에서 특징을 효과적으로 융합할 수 있는 다중 스트림, 다중 깊이 아키텍처를 설계하기 위해.
제안 방법
- HRDNet은 고정된 감소 비율 α를 갖는 여러 입력 해상도를 사용하며, 고해상도 이미지는 얕은 백본에, 저해상도 이미지는 깊은 백본에 입력된다.
- 다중 깊이 이미지 피라미드 네트워크(MD-IPN)는 다양한 해상도 스트림에서 다중 스케일 특징을 추출하여 공간적 및 의미적 정보를 유지한다.
- MD-IPN은 고해상도 입력에 대해 얕은 백본을, 저해상도 입력에 대해 깊은 백본을 사용하여 위치 및 세부 정보를 유지한다.
- 다중 해상도 특징 피라미드 네트워크(MS-FPN)는 여러 해상도 스트림과 수준 간의 특징을 융합하여 다중 스케일, 다중 수준 특징 간의 정보 불균형을 감소시킨다.
- MS-FPN은 스트림 간 및 스트림 내 특징 전파를 가능하게 하여 다양한 스케일 간의 특징 표현을 향상시킨다.
- 모델은 엔드 투 엔드로 훈련되며, 바운딩 박스 및 분류 예측을 위한 표준 검출 헤드를 사용한다.
실험 결과
연구 질문
- RQ1계산 비용 증가 없이 다중 해상도, 다중 깊이 특징 추출 전략이 소형 객체 검출을 향상시킬 수 있는가?
- RQ2다른 입력 해상도에서 얕은 백본과 깊은 백본의 특징을 융합하는 것이 소형 객체 검출 성능에 어떤 영향을 미치는가?
- RQ3제안된 MS-FPN 아키텍처가 다중 스케일 및 다중 수준 특징 간의 정보 불균형을 효과적으로 줄이는가?
- RQ4HRDNet이 정확도와 추론 속도 측면에서 단일 백본 모델 및 앙상블 모델을 초월할 수 있는가?
- RQ5HRDNet의 성능 향상이 모델 용량 증가가 아닌 아키텍처 혁신에서 기인하는가?
주요 결과
- HRDNet은 VisDrone2019 DET 검증 세트에서 mAP 40.45를 달성하여 ResNet152를 사용한 HFEA 대비 3.0%의 AP 향상을 기록했다.
- MS COCO2017에서 HRDNet은 최근 모델 대비 소형 객체에 대해 4.9%의 AP 향상을 기록하여 강력한 일반화 능력을 입증했다.
- ResNeXt50+101 백본을 사용한 HRDNet은 Pascal VOC 2007 테스트에서 83.4% mAP를 기록하여 이전 최신 기술 수준 모델을 초월했다.
- HRDNet은 유사한 파라미터 수를 가진 단일 백본 앙상블보다 높은 성능을 유지하면서도 더 빠른 추론 속도를 기록하여 높은 효율성을 확보했다.
- 제거 실험 결과 MS-FPN이 성능 향상에 필수적임을 확인했으며, HRDNet은 앙상블 모델 및 단일 해상도 기반 베이스라인보다 뛰어난 성능을 보였다.
- HRDNet은 대형 객체의 성능를 유지하면서 소형 객체 검출 성능을 크게 향상시켜 해상도-스케일 상충 관계를 해결했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.