[논문 리뷰] CBNet: A Novel Composite Backbone Network Architecture for Object Detection
이 논문은 복합 연결을 통해 한 백본에서의 고수준 특징을 다음 백본에 피드포워드하는 방식으로 동일한 백본들을 스택하여 객체 검출 성능을 향상시키는 새로운 아키텍처인 복합 백본 네트워크(CBNet)를 제안한다. ResNeXt와 같은 동일한 백본들을 사용하여 스택하고, Cascade Mask R-CNN와 같은 최신 검출기와 통합함으로써 단일 모델로 COCO에서 53.3의 SOTA mAP를 달성하며, 여러 검출기에서 mAP를 1.5–3.0%p 향상시킨다.
In existing CNN based detectors, the backbone network is a very important component for basic feature extraction, and the performance of the detectors highly depends on it. In this paper, we aim to achieve better detection performance by building a more powerful backbone from existing backbones like ResNet and ResNeXt. Specifically, we propose a novel strategy for assembling multiple identical backbones by composite connections between the adjacent backbones, to form a more powerful backbone named Composite Backbone Network (CBNet). In this way, CBNet iteratively feeds the output features of the previous backbone, namely high-level features, as part of input features to the succeeding backbone, in a stage-by-stage fashion, and finally the feature maps of the last backbone (named Lead Backbone) are used for object detection. We show that CBNet can be very easily integrated into most state-of-the-art detectors and significantly improve their performances. For example, it boosts the mAP of FPN, Mask R-CNN and Cascade R-CNN on the COCO dataset by about 1.5 to 3.0 percent. Meanwhile, experimental results show that the instance segmentation results can also be improved. Specially, by simply integrating the proposed CBNet into the baseline detector Cascade Mask R-CNN, we achieve a new state-of-the-art result on COCO dataset (mAP of 53.3) with single model, which demonstrates great effectiveness of the proposed CBNet architecture. Code will be made available on https://github.com/PKUbahuangliuhe/CBNet.
연구 동기 및 목표
- 기존 백본 네트워크의 표현 능력을 향상시켜 객체 검출 성능을 향상시키는 것.
- 원래 이미지 분류를 위해 설계된 단일 백본의 한계를 해결하여 객체 검출에 최적화된 특징을 추출하는 것.
- 새로운 깊은 백본을 처음부터 훈련시키는 데 비해 비용 효율적이고 즉시 사용 가능한 대안을 개발하는 것.
- 전체 검출기의 재훈련이나 ImageNet에서의 새로운 사전훈련 없이도 성능 향상을 이끌어내는 것.
제안 방법
- CBNet는 보조 백본과 리드 백본을 포함한 동일한 백본들을 스택하여 복합 백본을 구성한다.
- 연속된 백본의 병렬 스테이지 간에 복합 연결을 도입하여, 한 백본의 고수준 특징을 다음 백본의 입력으로 전달한다.
- 최종 백본(리드 백본)의 특징 맵을 FPN과 RPN, 검출 헤드의 주요 입력으로 사용한다.
- 추가 사전훈련이 필요 없으며, 각 백본은 공개된 ImageNet 사전훈련 모델로 초기화된다.
- 보조 백본의 초기 스테이지를 제거하여 계산 비용을 줄이면서도 정확도를 유지하는 방식으로 가속 버전의 CBNet를 제안한다.
- FPN, Mask R-CNN, Cascade R-CNN와 같은 기존 검출기와 호환되어 즉시 통합이 가능하다.
실험 결과
연구 질문
- RQ1스테이지 간 특징 흐름이 있는 동일한 백본들을 스택함으로써 단일 백본이 달성할 수 있는 성능 이외의 성능 향상을 이룰 수 있는가?
- RQ2표준 분류 중심의 백본과 비교해 복합 연결 메커니즘이 검출 작업을 위한 특징 표현을 효과적으로 향상시키는가?
- RQ3CBNet가 COCO 벤치마크에서 다양한 최신 검출기에서 mAP를 얼마나 향상시키는가?
- RQ4새로운 사전훈련이나 아키텍처 재설계 없이도 CBNet이 SOTA 성능을 달성할 수 있는가?
- RQ5CBNet 내 백본 수가 검출 정확도와 추론 속도에 어떤 영향을 미치는가?
주요 결과
- CBNet는 COCO에서 FPN, Mask R-CNN, Cascade R-CNN의 mAP를 각각 1.5~3.0%p 향상시켰다.
- Cascade Mask R-CNN에 통합된 CBNet는 단일 모델로 COCO에서 새로운 SOTA mAP 53.3을 달성했다.
- 백본 수가 증가할수록 mAP가 점진적으로 증가하며, 세 개의 백본에서 수렴함을 보여, 트리플 백본 아키텍처에서 최적의 성능을 낸다.
- 가속 버전의 CBNet(K=2)는 추론 속도를 5.5 fps에서 6.9 fps로 향상시키며, 원본 모델과 mAP 차이가 0.2p 이내로 유지된다.
- 시각화 결과는 CBNet가 더 잘 표현된 특징을 추출하며, 전경 객체에서는 강한 활성화, 배경에서는 약한 활성화를 보임을 확인했다.
- 복합 연결 메커니즘은 다수의 백본 간 고수준 및 저수준 특징의 효과적인 융합을 가능하게 하여 특징의 구분 능력을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.