Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Object Detection from Scratch via Gated Feature Reuse

Zhiqiang Shen, Humphrey Shi|arXiv (Cornell University)|2017. 12. 04.
Advanced Neural Network Applications참고 문헌 35인용 수 16
한 줄 요약

이 논문은 SSD 및 DSOD와 같은 단단계 객체 검출기에서 사전 훈련된 모델 없이 학습을 시작할 수 있도록 하는 파rameter 효율적이고 즉시 적용 가능한 모듈인 게이팅된 기능 재사용(GFR)을 제안한다. GFR는 객체 크기에 따라 다중 척도에서 감독을 적응적으로 재조정하기 위해 스queeze-and-excitation 기반 게이트를 사용하며, 기능 피라미드를 통해 고수준의 의미적 특징과 저수준의 공간적 특징을 융합함으로써 검출 정확도를 향상시키고, 파라미터를 줄이며 수렴 속도를 높인다. 이는 PASCAL VOC 및 COCO에서 더 적은 파라미터와 더 빠른 훈련으로 최신 기술 성능을 달성한다.

ABSTRACT

In this paper, we present a simple and parameter-efficient drop-in module for one-stage object detectors like SSD when learning from scratch (i.e., without pre-trained models). We call our module GFR (Gated Feature Reuse), which exhibits two main advantages. First, we introduce a novel gate-controlled prediction strategy enabled by Squeeze-and-Excitation to adaptively enhance or attenuate supervision at different scales based on the input object size. As a result, our model is more effective in detecting diverse sizes of objects. Second, we propose a feature-pyramids structure to squeeze rich spatial and semantic features into a single prediction layer, which strengthens feature representation and reduces the number of parameters to learn. We apply the proposed structure on DSOD and SSD detection frameworks, and evaluate the performance on PASCAL VOC 2007, 2012 and COCO datasets. With fewer model parameters, GFR-DSOD outperforms the baseline DSOD by 1.4%, 1.1%, 1.7% and 0.6%, respectively. GFR-SSD also outperforms the original SSD and SSD with dense prediction by 3.6% and 2.8% on VOC 2007 dataset. Code is available at: https://github.com/szq0214/GFR-DSOD .

연구 동기 및 목표

  • 사전 훈련된 ImageNet 가중치 없이 학습을 시작하는 단단계 객체 검출기의 성능 향상.
  • 다중 척도 기능 피라미드에서 고정된 비적응 감독의 한계 해결.
  • 다양한 척도에서 공간적 및 의미적 특징을 융합하여 특징 표현 향상.
  • 모델 파라미터를 줄이고 훈련 수렴 속도를 가속화.
  • 다양한 백본 네트워크와 호환되는 플러그 앤 플레이 모듈 개발.

제안 방법

  • 입력 객체 크기에 따라 다양한 기능 피라미드 수준에서 감독 강도를 동적으로 조정하기 위해 Squeeze-and-Excitation(SE) 블록을 적용하는 게이팅된 기능 재사용(GFR) 모듈을 도입한다.
  • 단일 예측 레이어에서 고수준 의미적 특징과 저수준 공간적 특징을 연결하여 특징 표현을 향상시키는 기능 피라미드 구조를 설계한다.
  • 다양한 척도에서 특징 활성화를 적응적으로 강화하거나 억제하기 위해 학습 가능한 게이트 메커니즘을 사용하여 소형 또는 대형 객체에 적합한 특징을 우선시한다.
  • GFR 모듈을 SSD 및 DSOD 프레임워크에 적용하여 기존의 표준 검출 헤드를 새로운 GFR 기반 헤드로 대체한다.
  • 저수준에서 고수준 레이어로의 스킵 연결을 통해 기울기 흐름을 향상시키고 특징 재사용을 개선하는 단순하고 경량의 아키텍처를 사용한다.
  • 사전 훈련 없이 표준 최적화를 사용해 엔드 투 엔드로 모델을 훈련시켜 수렴 속도를 높이고 파라미터 수를 감소시킨다.

실험 결과

연구 질문

  • RQ1사전 훈련 없이 사전 훈련된 ImageNet 가중치 없이도 파라미터 효율적이고 엔드 투 엔드로 훈련 가능한 객체 검출기가 최신 기술 성능을 달성할 수 있는가?
  • RQ2기능 피라미드를 어떻게 객체 크기에 적응적으로 만들 수 있는가? 이를 통해 다중 척도 검출 성능을 향상시킬 수 있는가?
  • RQ3저수준 공간적 특징과 고수준 의미적 특징 간의 기능 융합이 단단계 검출기에서 검출 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4간단하고 모듈화된 모듈인 GFR이 복잡한 사전 훈련된 모델보다 정확도와 훈련 효율성 측면에서 학습을 시작할 때 더 우수한 성능을 낼 수 있는가?
  • RQ5GFR는 기준 검출기와 비교해 수렴 속도와 모델 크기에 어떤 영향을 미치는가?

주요 결과

  • GFR-DSOD는 PASCAL VOC 2007, 2012, 2012 Comp3 및 COCO 데이터셋에서 각각 1.4%, 1.1%, 1.7%, 0.6% 향상된 성능을 보이며 파라미터 수가 적다.
  • GFR-SSD는 VOC 2007에서 79.2% mAP를 달성하여 원본 SSD 및 밀도 높은 예측을 사용한 SSD보다 각각 3.6%와 2.8% 높은 성능을 보였다.
  • GFR-DSOD는 기준 DSOD 대비 38% 더 빠르게 수렴하여 100k 반복에서 최적 정확도에 도달하는 데 62k 반복만 소요되었다.
  • 2540만 개의 파라미터로 GFR-DSOD는 VOC 2007에서 75.8% mAP를 달성하여 기준 모델 대비 6.2% 향상되었으며, 사전 훈련 없이도 강력한 성능을 보였다.
  • COCO에서 GFR-DSOD는 2120만 개의 파라미터로 30.0% mAP를 달성하여 기준 DSOD(29.4%)를 능가했고, FPN 대비 1/6의 파라미터로 동등한 성능을 달성했다.
  • 300×300 입력에서 GFR-DSOD는 단일 Titan X GPU에서 추론 속도가 17.5 fps로, SSD321(11.2 fps)과 DSSD321(9.5 fps)를 모두 뛰어넘었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.