Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting the Sibling Head in Object Detector

Guanglu Song, Yu Liu|arXiv (Cornell University)|2020. 03. 17.
Advanced Neural Network Applications참고 문헌 45인용 수 9
한 줄 요약

이 논문은 객체 검출기의 공통 분류 및 회귀 헤드 간의 공간적 불일치를 크게 줄이는 간단하면서도 효과적인 연산자인 작업 인식 공간 분리(TSD)를 제안한다. TSD는 공유 영역 제안을 기반으로 작업별로 특화된 제안을 생성함으로써 분류 및 회귀 헤드를 분리한다. COCO 및 OpenImages에서 모든 백본에서 mAP가 약 3% 향상되며, 점진적 제약 조건을 사용할 경우 추가로 약 1% 향상되어 단일 모델 성능으로서 최고 수준을 달성한다(ResNet-101 기반 mAP 49.4, SENet154 기반 mAP 51.2).

ABSTRACT

The ``shared head for classification and localization'' (sibling head), firstly denominated in Fast RCNN~\cite{girshick2015fast}, has been leading the fashion of the object detection community in the past five years. This paper provides the observation that the spatial misalignment between the two object functions in the sibling head can considerably hurt the training process, but this misalignment can be resolved by a very simple operator called task-aware spatial disentanglement (TSD). Considering the classification and regression, TSD decouples them from the spatial dimension by generating two disentangled proposals for them, which are estimated by the shared proposal. This is inspired by the natural insight that for one instance, the features in some salient area may have rich information for classification while these around the boundary may be good at bounding box regression. Surprisingly, this simple design can boost all backbones and models on both MS COCO and Google OpenImage consistently by ~3% mAP. Further, we propose a progressive constraint to enlarge the performance margin between the disentangled and the shared proposals, and gain ~1% more mAP. We show the \algname{} breaks through the upper bound of nowadays single-model detector by a large margin (mAP 49.4 with ResNet-101, 51.2 with SENet154), and is the core model of our 1st place solution on the Google OpenImage Challenge 2019.

연구 동기 및 목표

  • 객체 검출기의 형제 헤드에서 분류 및 회귀 작업 간의 본질적인 공간적 불일치를 규명하고 이를 해결하는 것.
  • 공간 차원에서 분류 및 정렬을 위한 특징 학습을 분리하여 검출 성능을 향상시키는 것.
  • 기존 아키텍처를 대대적으로 변경하지 않고도 두 단계 및 단일 단계 검출기 모두에 쉽게 통합 가능한 경량이며 플러그 앤 플레이 모듈을 개발하는 것.
  • COCO 및 Google OpenImages를 포함한 다양한 백본과 데이터셋에서 일관된 성능 향상을 달성하는 것.
  • 작업별 공간 표현을 효과적으로 분리하여 단일 모델 검출기의 성능 상한선을 초월하는 것.

제안 방법

  • TSD는 공유 영역 제안 $P$를 기반으로 분류용 $π_c$와 회귀용 $π_r$로 분리된 두 개의 제안을 생성하여 각 작업이 최적의 공간 영역에 집중할 수 있도록 한다.
  • 작업 인식 제안 추정을 통해 자동으로 공간 위치를 선택한다: 분류에는 눈에 띄는 중심부, 회귀에는 경계 영역을 선택한다.
  • 백본에서 생성된 공유 특징 맵을 사용하여 두 제안을 생성함으로써 특징 일관성을 유지하면서도 공간적 분리를 실현한다.
  • 분류 및 회귀 헤드는 각각 분리된 제안에 대해 독립적으로 학습되어 기울기 전파 간의 갈등을 줄인다.
  • 점진적 제약 조건(Progressive Constraint, PC)을 도입하여 분리된 제안과 공유된 제안 간의 성능 격차를 넓히며, 분류의 신뢰도를 높이고 회귀의 정밀도를 향상시킨다.
  • 모듈 전반은 미분 가능하며, Faster R-CNN 및 RetinaNet과 같은 기존 검출기에 최소한의 추론 오버헤드로 원활하게 통합할 수 있다.

실험 결과

연구 질문

  • RQ1형제 헤드에서 분류 및 회귀 간의 공간적 불일치가 검출 성능 저하의 주요 원인이 되는 이유는 무엇인가?
  • RQ2특징 학습의 공간적 분리가 모델 복잡도 증가 없이 검출 정확도 향상에 기여할 수 있는가?
  • RQ3작업 인식 제안 추정은 다양한 IoU 임계값에서 정렬 정밀도와 분류 신뢰도에 어떤 영향을 미치는가?
  • RQ4TSD는 COCO 및 OpenImages와 같은 대규모 데이터셋에서 다양한 백본에 걸쳐 얼마나 높은 성능 향상을 이룰 수 있는가?
  • RQ5점진적 제약 조건은 공간 분리의 효과를 효과적으로 증폭시키며, 단일 모델 검출기의 성능 한계를 초월하는 데 기여하는가?

주요 결과

  • TSD는 MS COCO 및 Google OpenImages에서 모든 백본과 모델에서 mAP를 약 3% 향상시키며, 다양한 아키텍처 간 일관된 성능 향상을 보였다.
  • ResNet-101 기반 COCO test-dev에서 TSD는 mAP 49.4를 기록하여 동일한 백본을 사용한 모든 다른 단일 모델 검출기보다 뛰어난 성능을 달성했다.
  • 더 무거운 SENet154 백본을 사용할 경우, TSD는 COCO test-dev에서 mAP 51.2를 기록하여 새로운 단일 모델 SOTA를 수립했다.
  • 성능 향상은 IoU 임계값이 높을수록 더 두드러지며, 특히 AP.75 이상에서 뛰어난 정렬 정밀도를 보였다.
  • TSD는 다양한 객체 크기에 걸쳐 뛰어난 일반화 성능를 보이며, 중간 및 대형 객체에서 가장 큰 성능 향상을 보였다.
  • 점진적 제약 조건은 TSD의 성능 향상에 추가로 약 1%의 mAP 향상을 제공하여, 분리 효과를 효과적으로 증폭시킨다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.