[논문 리뷰] Parallel Residual Bi-Fusion Feature Pyramid Network for Accurate Single-Shot Object Detection
이 논문은 새로운 일단계 객체 검출 프레임워크인 병렬 잔차 이중 융합 특징 피라미드 네트워크(Parallel Residual Bi-Fusion Feature Pyramid Network, PRB-FPN)를 제안한다. 이는 새로운 연결 및 재구성(CORE) 모듈과 잔차 설계를 사용하여 병렬로 양방향(상향식 및 하향식) 경로를 통해 특징 융합을 향상시킨다. PRB-FPN은 MS COCO 및 UAVDT17에서 최신 기술 수준의 정확도를 달성하며, CSPDarknet-53를 사용할 경우 COCO에서 48.9% AP를 기록하고 800×800 입력에서 59.4% AP를 달성하여 YOLOv7 및 기타 최신 기술 모델을 능가한다. 또한 실시간 추론 성능도 유지한다.
This paper proposes the Parallel Residual Bi-Fusion Feature Pyramid Network (PRB-FPN) for fast and accurate single-shot object detection. Feature Pyramid (FP) is widely used in recent visual detection, however the top-down pathway of FP cannot preserve accurate localization due to pooling shifting. The advantage of FP is weakened as deeper backbones with more layers are used. In addition, it cannot keep up accurate detection of both small and large objects at the same time. To address these issues, we propose a new parallel FP structure with bi-directional (top-down and bottom-up) fusion and associated improvements to retain high-quality features for accurate localization. We provide the following design improvements: (1) A parallel bifusion FP structure with a bottom-up fusion module (BFM) to detect both small and large objects at once with high accuracy. (2) A concatenation and re-organization (CORE) module provides a bottom-up pathway for feature fusion, which leads to the bi-directional fusion FP that can recover lost information from lower-layer feature maps. (3) The CORE feature is further purified to retain richer contextual information. Such CORE purification in both top-down and bottom-up pathways can be finished in only a few iterations. (4) The adding of a residual design to CORE leads to a new Re-CORE module that enables easy training and integration with a wide range of deeper or lighter backbones. The proposed network achieves state-of-the-art performance on the UAVDT17 and MS COCO datasets. Code is available at https://github.com/pingyang1117/PRBNet_PyTorch.
연구 동기 및 목표
- 풀링으로 인한 해상도 손실로 인해 표준 특징 피라미드 네트워크(FPN)가 작은 객체와 큰 객체를 정확히 검출하는 데에 한계를 가짐을 해결하기 위해.
- 고수준의 의미적 정보와 저수준의 공간적 세부 정보를 모두 유지하는 이중 방향 융합 메커니즘을 도입하여 특징 표현을 향상시키기 위해.
- 융합 경로에 잔차 설계를 통합하여 학습 안정성과 모델 통합 성능을 향상시키기 위해.
- 실시간 추론 속도를 유지하면서도 높은 검출 정확도를 달성하여 엣지 장치에의 구현에 적합한 성능을 확보하기 위해.
제안 방법
- 세 가지 특징 피라미드 수준(P3, P4, P5)을 동시에 융합하는 병렬 이중 융합 구조를 제안하며, 작은 객체와 큰 객체의 검출을 향상시키기 위해 하향식 융합 모듈(Bottom-Up Fusion Module, BFM)을 사용한다.
- 이웃 레이어의 특징을 재귀적으로 융합할 수 있도록 허용하고, 효율적인 하향식 정보 흐름과 맥락적 특징 복구를 가능하게 하는 연결 및 재구성(CORE) 모듈을 도입한다.
- CORE 모듈에 잔차 설계(Re-CORE)를 적용하여 학습 안정성을 향상시키고, 더 깊거나 가벼운 아키텍처를 포함한 다양한 백본과의 원활한 통합을 가능하게 한다.
- 기존의 연결 기반 융합 방식이 메모리 폭발을 일으킬 수 있는 것을 방지하기 위해 병렬 아키텍처를 사용하여 효율성을 유지하면서도 특징 품질을 향상시킨다.
- 특징 정제를 반복적으로 수행할 수 있도록 상향식 및 하향식 경로 모두에 CORE 모듈을 적용하여 풍부한 맥락적 정보와 정밀한 국소화 정보를 유지한다.
- 다중 경로 융합 전략을 적용하여 네트워크가 동시에 세 개의 예측 맵을 생성할 수 있도록 하여 속도를 희생시키지 않고도 검출 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1병렬로 양방향 특징 융합 메커니즘이 단일 단계 검출기에서 작은 객체와 큰 객체의 검출 정확도를 향상시킬 수 있는가?
- RQ2CORE 모듈은 재귀적 하향식 융합과 맥락 정보 복구를 통해 특징 표현을 어떻게 향상시키는가?
- RQ3CORE 모듈 내 잔차 설계가 학습 안정성과 백본 호환성에 얼마나 기여하는가?
- RQ4제안된 PRB-FPN은 MS COCO 및 UAVDT17와 같은 표준 벤치마크에서 최신 기술 수준의 성능을 달성하면서도 실시간 추론 속도를 유지하는가?
- RQ5BiFPN 및 PANet와 같은 기존의 이중 방향 FPN과 비교해 PRB-FPN의 정확도와 효율성은 어떠한가?
주요 결과
- CSPDarknet-53를 사용하고 800×800 입력을 사용할 경우, MS COCO 테스트-디브에서 PRB-FPN은 48.9% AP를 기록하여 YOLOv7-E6E 및 기타 최신 기술 수준의 단일 단계 검출기들을 능가한다.
- 동일한 벤치마크에서 PRB-FPN은 ResNet-50와 800×800 입력을 사용할 경우 46.1% AP를 기록하며, 이는 이전 최신 기술 수준의 모델인 AB+FSAF 및 Cascade R-CNN를 초월한다.
- PRB-FPN6 버전은 대규모 객체(APL)에 대해 COCO에서 55.9% AP를 기록하여 도전적인 대규모 객체에 대한 뛰어난 성능을 보여준다.
- 모델은 실시간 추론 속도를 유지하며, ResNet-50 기반으로 800×800 입력에서 15.9 FPS, CSPDarknet-53 기반으로 11.6 FPS를 기록하여 엣지 장치에의 구현에 적합한 효율성을 입증한다.
- 시각적 비교 결과, PRB-FPN6는 안개 끼운 환경과 가림을 입은 장면에서 YOLOv7-E6E보다 우수한 성능을 보이며, 작은 객체와 심하게 가려진 객체도 성공적으로 검출한다.
- 광범위한 추상화 연구를 통해 CORE 모듈과 잔차 설계가 특징 품질 향상과 학습 수렴 안정성 향상에 뚜렷한 기여를 한다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.