Skip to main content
QUICK REVIEW

[논문 리뷰] SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization

Xianzhi Du, Tsung-Yi Lin|arXiv (Cornell University)|2019. 12. 10.
Advanced Neural Network Applications참고 문헌 48인용 수 21
한 줄 요약

SpineNet는 객체 검출 및 인식을 위한 신경망 아키텍처 탐색을 통해 발견된 가중치 조정 가능한 다중 척도 연결을 갖춘 척도 순열화된 백본 아키텍처를 제안한다. 테스트 시 증강 없이 COCO에서 52.1% AP를 달성하며, FLOPs가 10–20% 적은 수준에서 ResNet-FPN보다 약 3% 높은 AP를 기록한다. 또한 도전적인 iNaturalist 미세 분류 데이터셋에서 상위 1 정확도를 5% 향상시킨다.

ABSTRACT

Convolutional neural networks typically encode an input image into a series of intermediate features with decreasing resolutions. While this structure is suited to classification tasks, it does not perform well for tasks requiring simultaneous recognition and localization (e.g., object detection). The encoder-decoder architectures are proposed to resolve this by applying a decoder network onto a backbone model designed for classification tasks. In this paper, we argue encoder-decoder architecture is ineffective in generating strong multi-scale features because of the scale-decreased backbone. We propose SpineNet, a backbone with scale-permuted intermediate features and cross-scale connections that is learned on an object detection task by Neural Architecture Search. Using similar building blocks, SpineNet models outperform ResNet-FPN models by ~3% AP at various scales while using 10-20% fewer FLOPs. In particular, SpineNet-190 achieves 52.5% AP with a MaskR-CNN detector and achieves 52.1% AP with a RetinaNet detector on COCO for a single model without test-time augmentation, significantly outperforms prior art of detectors. SpineNet can transfer to classification tasks, achieving 5% top-1 accuracy improvement on a challenging iNaturalist fine-grained dataset. Code is at: https://github.com/tensorflow/tpu/tree/master/models/official/detection.

연구 동기 및 목표

  • 객체 검출과 같은 다중 척도 인식 및 국소화 작업에서 척도 감소 백본의 한계를 해결하기 위해.
  • 소형 객체 및 미세 분류를 위한 특징 표현을 향상시키기 위해 다양한 척도 간 공간 정보를 유지하기 위해.
  • 학습된 연결을 통한 척도 간 효과적인 다중 척도 특징 융합을 가능하게 하는 백본 아키텍처를 설계하기 위해.
  • 단일 아키텍처가 검출 및 분류 작업 모두에서 기존 백본을 초월할 수 있음을 입증하기 위해.
  • 신경망 아키텍처 탐색이 다중 척도 시각 작업을 위한 효율적이고 고성능의 백본을 발견하는 데 잠재력을 지닌다는 것을 탐색하기 위해.

제안 방법

  • 중간 특징 맵 해상도가 단조롭게 감소하지 않는 척도 순열화 메타아키텍처를 제안하여 네트워크 깊이에서 다이나믹한 척도 변화를 허용한다.
  • 다른 해상도 수준 간의 특징 융합을 가능하게 하는 척도 간 연결을 도입하여 다중 척도 표현을 향상시킨다.
  • 신경망 아키텍처 탐색(NAS)을 사용하여 각 블록의 블록 순서와 입력 연결을 동시에 최적화하며, 검색 공간은 ResNet 블록 버전 블록으로 정의된다.
  • 추가 디코더 네트워크가 필요 없도록 RetinaNet를 사용하여 COCO 객체 검출 작업에서 백본을 직접 훈련시킨다.
  • 블록 유형과 척도를 조정하기 위한 검색 공간 수정을 적용하여 성능을 유지하면서도 효율성을 향상시킨다.
  • Swish 활성화 함수, 확률적 깊이, 레이블 스무딩을 포함한 향상된 훈련 프로토콜을 사용하여 학습된 SpineNet 아키텍처를 이미지 분류 작업으로 이식한다.

실험 결과

연구 질문

  • RQ1척도 순열화된 백본 아키텍처가 기존의 척도 감소 백본보다 객체 검출에서 슈퍼리어한 성능을 낼 수 있는가?
  • RQ2NAS를 통해 학습된 척도 간 연결이 인식 및 국소화를 위한 다중 척도 특징 표현을 향상시키는가?
  • RQ3단일 SpineNet 아키텍처가 객체 검출 및 이미지 분류 양쪽 작업에서 최신 기준 성능을 달성할 수 있는가?
  • RQ4iNaturalist-2017과 같은 미세 분류 벤치마크에서 SpineNet은 ResNet보다 어떻게 성능을 내는가?
  • RQ5검출 및 분류 성능 향상의 정도가 더 나은 특징 표현 때문인지, 아키텍처 효율성 때문인지 어느 정도인가?

주요 결과

  • SpineNet-190은 Mask R-CNN를 사용해 COCO에서 52.5% AP를 기록하고, RetinaNet를 사용해 52.1% AP를 달성하며, 테스트 시 증강 없이도 이전 기록을 크게 뛰어넘는다.
  • SpineNet-49S는 33.8B FLOPs로 39.5% AP를 기록하며, R50-FPN(96.8B FLOPs에서 40.4% AP)을 능가한다.
  • SpineNet-49XS는 단지 0.17B FLOPs로 17.5% AP를 기록하며, 모바일 검출에서 MobileNetV2와 MobileNetV3를 능가한다.
  • iNaturalist-2017에서 SpineNet-49는 iNaturalist-bbox에서 63.9% Top-1 정확도를 기록하며, ResNet-50보다 4.3% 향상된 성능을 보였다.
  • SpineNet-49는 iNaturalist-2017에서 ResNet-50 대비 상위 1 정확도를 5% 향상시켰으며, 이는 더 나은 국소적 특징 캡처와 밀도 높은 표현 덕분으로 기인한다.
  • 향상된 훈련 프로토콜을 적용한 결과, SpineNet은 ImageNet에서 1% 상위 1 정확도 향상과 iNaturalist-2017에서 3–4% 향상된 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.