Skip to main content
QUICK REVIEW

[논문 리뷰] An Energy and GPU-Computation Efficient Backbone Network for Real-Time Object Detection

Youngwan Lee, Joong‐won Hwang|arXiv (Cornell University)|2019. 04. 22.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 VoVNet을 제안하며, 이는 밀도 있는 연결을 한 번의 집합(One-Shot Aggregation, OSA)으로 대체하여 다중 수용장치 특징 표현을 유지하면서도 메모리 액세스 비용과 GPU 계산 오버헤드를 크게 줄이는 새로운 백본 네트워크이다. VoVNet은 추론 속도가 2배 빠르고 에너지 소비가 1.6배에서 4.1배 적으며, 속도, 에너지 효율성, 소형 객체 검출 정확도에서 DenseNet과 ResNet을 모두 능가한다.

ABSTRACT

As DenseNet conserves intermediate features with diverse receptive fields by aggregating them with dense connection, it shows good performance on the object detection task. Although feature reuse enables DenseNet to produce strong features with a small number of model parameters and FLOPs, the detector with DenseNet backbone shows rather slow speed and low energy efficiency. We find the linearly increasing input channel by dense connection leads to heavy memory access cost, which causes computation overhead and more energy consumption. To solve the inefficiency of DenseNet, we propose an energy and computation efficient architecture called VoVNet comprised of One-Shot Aggregation (OSA). The OSA not only adopts the strength of DenseNet that represents diversified features with multi receptive fields but also overcomes the inefficiency of dense connection by aggregating all features only once in the last feature maps. To validate the effectiveness of VoVNet as a backbone network, we design both lightweight and large-scale VoVNet and apply them to one-stage and two-stage object detectors. Our VoVNet based detectors outperform DenseNet based ones with 2x faster speed and the energy consumptions are reduced by 1.6x - 4.1x. In addition to DenseNet, VoVNet also outperforms widely used ResNet backbone with faster speed and better energy efficiency. In particular, the small object detection performance has been significantly improved over DenseNet and ResNet.

연구 동기 및 목표

  • 실시간 객체 검출에서 강력한 특징 표현에도 불구하고 높은 메모리 액세스 비용과 낮은 GPU 계산 효율성을 보이는 DenseNet의 문제를 해결하기 위해.
  • 밀도 있는 연결으로 인해 입력 채널 수가 제곱적으로 증가하는 문제를 해결하여 계산 및 에너지 오버헤드를 줄이기 위해.
  • DenseNet이 제공하는 다중 수용장치 특징 집합의 이점을 유지하면서도 불필요한 중간 연결을 제거하기 위해.
  • ResNet과 DenseNet보다 뛰어난 속도, 에너지 효율성, 그리고 특히 소형 객체에 대한 검출 정확도를 달성하는 백본 네트워크를 설계하기 위해.
  • DSOD, RefineDet, Mask R-CNN 등 다양한 검출기에서 VoVNet이 일체형 및 이단계 검출기 모두에 효과적인 효율적인 백본으로서의 가능성을 검증하고, ImageNet 사전학습 없이도 훈련을 시작하는 것을 목적으로 한다.

제안 방법

  • 모든 중간 특징을 최종 특징 맵에서 한 번만 연결하는 새로운 모듈인 One-Shot Aggregation(оса)를 제안하여 선형적 채널 증가를 방지한다.
  • OSA 모듈을 반복적으로 스택하여 VoVNet을 설계함으로써, 레이어 간에 입력 텐서 크기를 일정하게 유지하여 메모리 액세스 비용을 감소시키고 GPU 병렬 처리를 향상시킨다.
  • 다양한 레이어에서 유도된 다양한 수용장치 표현을 반복적인 특징 재사용 없이 유지하는 다중 척도 특징 집합 메커니즘을 도입한다.
  • 깊이 분리형 컨볼루션을 활용한 뱃지 스타일 아키텍처를 적용하여, 낮은 FLOPs를 유지하면서도 최종 OSA 블록에서 높은 출력 채널 확장을 가능하게 한다.
  • DSOD, RefineDet, Mask R-CNN 등 다양한 검출기에서 경량 및 대규모 VoVNet 버전을 사용하여 아키텍처의 유효성을 검증한다.
  • ImageNet 사전학습 없이 COCO 데이터셋에서 훈련을 시작하여 일반화 능력과 효율성을 평가한다.

실험 결과

연구 질문

  • RQ1DenseNet이 제공하는 다중 수용장치 특징 표현을 유지하면서도 그 계산 및 에너지 비효율성을 제거할 수 있는 백본 네트워크가 가능한가?
  • RQ2밀도 있는 연결을 한 번의 집합 단계로 대체함으로써 메모리 액세스 비용을 크게 줄이고 GPU 계산 효율성을 향상시킬 수 있는가?
  • RQ3더 효율적인 백본 아키텍처가 DenseNet과 ResNet을 모두 능가하는 검출 정확도—특히 소형 객체에 대해—를 달성할 수 있는가?
  • RQ4제안된 아키텍처는 실시간 검출에서 추론 시간과 에너지 소비를 줄이면서 정확도를 유지하거나 향상시키는 데 어느 정도 기여하는가?
  • RQ5VoVNet은 ImageNet 사전학습 없이도 Mask R-CNN과 같은 이단계 검출기에서 효과적인 백본으로 기능할 수 있는가?

주요 결과

  • VoVNet 기반 검출기는 FLOPs와 파라미터 수가 적은데도 불구하고, DenseNet 기반 검출기보다 추론 속도가 2배 빠르고 에너지 소비가 1.6배에서 4.1배 적다.
  • VoVNet-39는 이미지당 에너지 소비가 단지 4.8J이며, 이는 DenseNet-161(9.6J)의 절반에 불과하지만 정확도는 유사하게 유지한다.
  • VoVNet-39는 소형 객체 AP에서 각각 DenseNet-121과 DenseNet-161보다 1.9%와 1.2% 높게 나타나 미세한 감지에 대해 뛰어난 특징 표현 능력을 보여준다.
  • Mask R-CNN 실험에서 VoVNet-39는 COCO 검증 세트에서 41.7 AP를 기록했고 추론 시간은 152ms로, ResNet-50-GN(39.5 AP, 157ms)보다 정확도와 속도 양면에서 뛰어나다.
  • VoVNet-57는 ResNet-101 기반 모델 중에서 최고 성능을 기록하며, 41.9 AP와 159ms의 추론 시간을 기록하여 확장성과 효율성을 입증한다.
  • VoVNet은 32GB V100 GPU에서 Mask R-CNN를 성공적으로 사전학습 없이 훈련시켰으며, DenseNet 기반 모델은 극도로 큰 메모리 프로파일로 실패했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.