Skip to main content
QUICK REVIEW

[논문 리뷰] Compression of Deep Neural Networks for Image Instance Retrieval

Vijay Chandrasekhar, Jie Lin|arXiv (Cornell University)|2017. 01. 18.
Advanced Image and Video Retrieval Techniques참고 문헌 20인용 수 4
한 줄 요약

이 논문은 이미지 인스턴스 검색을 위한 깊이 신경망에 특화된 종합적인 압축 프레임워크를 제안하며, 양자화, 자르기, 코딩, 가중치 공유를 조합한다. 특히 잔차 네트워크에 초점을 맞추어, 전체 정밀도 네트워크와 비교해 성능 손실가능성이 거의 없는 5–10MB 이하의 모델을 달성한다.

ABSTRACT

Image instance retrieval is the problem of retrieving images from a database which contain the same object. Convolutional Neural Network (CNN) based descriptors are becoming the dominant approach for generating {\it global image descriptors} for the instance retrieval problem. One major drawback of CNN-based {\it global descriptors} is that uncompressed deep neural network models require hundreds of megabytes of storage making them inconvenient to deploy in mobile applications or in custom hardware. In this work, we study the problem of neural network model compression focusing on the image instance retrieval task. We study quantization, coding, pruning and weight sharing techniques for reducing model size for the instance retrieval problem. We provide extensive experimental results on the trade-off between retrieval performance and model size for different types of networks on several data sets providing the most comprehensive study on this topic. We compress models to the order of a few MBs: two orders of magnitude smaller than the uncompressed models while achieving negligible loss in retrieval performance.

연구 동기 및 목표

  • 높은 스토리지 및 메모리 요구량으로 인해 모바일 및 임베디드 시스템에 큰 압축되지 않은 깊이 신경망을 구현하는 데 도전하는 문제를 해결한다.
  • 이미지 분류와 다른 요구사항을 가진 이미지 인스턴스 검색을 위해 특화된 모델 압축 기법—양자화, 자르기, 코딩, 가중치 공유—를 연구한다.
  • 다양한 아키텍처와 데이터셋을 대상으로 모델 크기와 검색 성능 간의 상호 관계를 종합적으로 실험적으로 분석한다.
  • 1MB 이하의 특징 추출기를 요구하는 MPEG의 압축된 시각 검색 기술 기준(CDVS)과 같은 신규 표준에 깊이 학습 기반 기술을 구현할 수 있도록 한다.

제안 방법

  • 네트워크 가중치에 4–5비트 스칼라 양자화를 적용하여 정밀도를 낮추면서도 검색 성능 유지를 달성한다.
  • 완전 연결 층을 압축하기 위해 벡터 양자화(VQ)와 스칼라 양자화(SQ)를 사용하고, 추가적인 크기 감소를 위해 히프만 코딩을 적용한다.
  • 구조적 자르기를 통해 합성곱 층의 전체 필터나 채널을 제거하여 모델 크기를 줄이고 특징 표현을 유지한다.
  • 깊이 신경망인 잔차 네트워크(ResNets)에서 잔차 블록 간 가중치 공유를 도입하여 파rameter 수를 크게 감소시킨다.
  • 공유된 가중치를 사용해 공유된 ResNet 모델을 처음부터 훈련하고, 추가로 양자화와 코딩을 통해 압축한다.
  • mAP를 측정하여 여러 네트워크(AlexNet, VGG, ResNet, SqueezeNet)와 데이터셋(Oxford-5K, Paris-6K, Holidays, UKB)에서 압축 기법의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1이미지 인스턴스 검색을 위한 깊이 신경망에 대해 양자화, 자르기, 코딩를 적용할 때 모델 크기와 검색 성능 간의 상호 관계는 어떠한가?
  • RQ2잔차 블록 간 가중치 공유가 깊이 신경망의 모델 크기와 검색 정확도에 어떤 영향을 미치는가?
  • RQ3압축된 모델을 몇 메가바이트(예: 5–10MB)로 줄일 수 있으며, 전체 정밀도 모델과 비교해 성능이 유사하게 유지되는가?
  • RQ4다양한 아키텍처와 데이터셋에서 다양한 압축 기법의 성능 및 효율성은 어떻게 비교되는가?
  • RQ5극도로 강한 아키텍처 최적화(예: SqueezeNet)는 모델 크기를 줄이지만 검색 성능에 어떤 정도 영향을 미치는가?

주요 결과

  • 4비트 양자화는 AlexNet과 VGG에 대해 성능 손실가능성이 거의 없으며, ResNet의 경우 높은 검색 정확도를 유지하기 위해 5비트 양자화가 필요하다.
  • 5–10MB 크기의 압축 모델이 모든 데이터셋에서 압축되지 않은 모델과 거의 동일한 검색 성능을 달성하며, 이는 크기 감소 100배에 해당한다.
  • 자르기와 더粗모양의 양자화는 모델 크기와 성능 간의 유사한 상호 관계를 보이며, 둘 다 효과적인 압축 전략임을 시사한다.
  • 압축된 VGG는 Oxford-5K에서 가장 높은 성능을 기록했고, 압축된 ResNet은 Paris-6K, Holidays, UKB에서 다른 모델을 앞선다.
  • 가중치 공유를 적용한 공유 ResNet은 비공유 버전 대비 모델 크기를 3–4배 감소시키며, 추가로 양자화를 통해 더 작은 모델을 만들 수 있다.
  • SqueezeNet 기반 모델(C-SqueezeN)은 크기가 0.5MB에 불과하지만 최상의 성능을 내는 방법에 비해 성능이 현저히 열 劣하다. 이는 극단적인 아키텍처 압축이 검색 성능에 악영향을 미친다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.