Skip to main content
QUICK REVIEW

[논문 리뷰] ADaPTION: Toolbox and Benchmark for Training Convolutional Neural Networks with Reduced Numerical Precision Weights and Activation

Moritz B. Milde, Daniel Neil|arXiv (Cornell University)|2017. 11. 13.
Model Reduction and Neural Networks인용 수 8
한 줄 요약

ADaPTION은 고정소수점 산술을 사용하여 가중치와 활성화 모두의 정밀도를 낮춘 콘볼루션 신경망의 훈련과 양자화를 가능하게 하는 Caffe 기반 도구상자이다. VGG16을 16비트 고정소수점으로 양자화할 때 상태의 기준(SOTA) 이미지넷 Top-1 정확도(0.8% 이내의 하락)를 달성하면서 동시에 스파arsity를 최대 50%까지 증가시켜 NullHop와 같은 고정소수점 하드웨어 가속기에서 효율적인 추론을 가능하게 한다.

ABSTRACT

Deep Neural Networks (DNNs) and Convolutional Neural Networks (CNNs) are useful for many practical tasks in machine learning. Synaptic weights, as well as neuron activation functions within the deep network are typically stored with high-precision formats, e.g. 32 bit floating point. However, since storage capacity is limited and each memory access consumes power, both storage capacity and memory access are two crucial factors in these networks. Here we present a method and present the ADaPTION toolbox to extend the popular deep learning library Caffe to support training of deep CNNs with reduced numerical precision of weights and activations using fixed point notation. ADaPTION includes tools to measure the dynamic range of weights and activations. Using the ADaPTION tools, we quantized several CNNs including VGG16 down to 16-bit weights and activations with only 0.8% drop in Top-1 accuracy. The quantization, especially of the activations, leads to increase of up to 50% of sparsity especially in early and intermediate layers, which we exploit to skip multiplications with zero, thus performing faster and computationally cheaper inference.

연구 동기 및 목표

  • 모바일 및 임베디드 장치에서 에너지 효율적이고 메모리 소비가 적은 추론을 위한 증가하는 수요를 해결하기 위해 CNN의 저정밀도 훈련을 가능하게 하기 위해.
  • 기존 도구상자들이 고정소수점 활성화 양자화를 지원하지 않아, 스파arsity 계산과 하드웨어 효율성의 핵심 요소인 이 기능의 한계를 극복하기 위해.
  • 다양하고 사용자 정의 가능한 네트워크 아키텍처를 사용하여 CNN 가속기 평가를 위한 표준화된 벤치마킹 프레임워크를 제공하기 위해.
  • 정밀한 비트 폭 제어와 다이내믹 레인지 인식 양자화를 통해 고정소수점 하드웨어 가속기(예: NullHop)에서 양자화된 모델의 엔드 투 엔드 배포를 지원하기 위해.
  • 특히 초기 및 중간 계층에서 활성화와 가중치의 스파arsity를 증가시켜 더 빠르고 저전력의 추론을 가능하게 하여 하드웨어 효율성을 향상시키기 위해.

제안 방법

  • Caffe 딥러닝 프레임워크에 세 가지 새로운 저정밀도 레이어 유형(LPInnerProduct, LPConvolution, LPAct)을 확장하여, 순방향 및 역방향 전파 중에 고정소수점 양자화를 적용하였다.
  • 세 가지 설정 가능한 파rameter(BD(소수점 이전), AD(소수점 이후), rounding_scheme)를 도입하여 고정소수점 형식(예: Q1.15)과 반올림 전략을 정의하였다.
  • 관측된 가중치와 활성화의 다이내믹 레인지에 기반하여 가용 비트를 정수부와 소수부 간에 분배하는 동적이고 레이어별 비트 할당 전략을 구현하였다.
  • 사용자 정의 정밀도와 반올림 전략을 사용하여 사전 학습된 고정밀도 모델의 미세조정과 함께 새로운 모델의 훈련을 모두 가능하게 하였다.
  • 고정소수점 하드웨어 가속기에서의 배포를 위해 양자화된 모델을 NullHop 호환 파일 형식으로 내보내는 파이프라인을 제공하였다.
  • 고정소수점 하드웨어 가속기 평가를 지원하기 위해, 1 GOp/frame과 36시간의 훈련 후 ImageNet Top-1 정확도 38%를 달성한 새로운 벤치마크 네트워크인 Giga1Net을 개발하였다.

실험 결과

연구 질문

  • RQ1가중치와 활성화의 고정소수점 양자화가 깊이 있는 CNN에서 높은 분류 정확도를 유지하면서도 효율적인 하드웨어 배포를 가능하게 할 수 있는가?
  • RQ2정수부와 소수부 간의 레이어별 동적 비트 할당 전략이 저정밀도 네트워크의 정확도와 스파arsity에 어떤 영향을 미치는가?
  • RQ3활성화의 양자화가 스파arsity를 얼마나 증가시키며, 이를 고정소수점 가속기에서 더 빠르고 저전력의 추론에 활용할 수 있는가?
  • RQ4ADaPTION은 Ristretto와 같은 기존 도구상자와 비교해 고정소수점 활성화 양자화 및 하드웨어 호환 모델 배포를 얼마나 잘 지원하는가?
  • RQ5Giga1Net과 같이 사용자 정의 가능한 새로운 벤치마크 네트워크가 새로운 CNN 가속기 하드웨어 설계 평가를 위한 현실적이고 다양한 테스트베드로 기능할 수 있는가?

주요 결과

  • ADaPTION은 VGG16에 적용했을 때 가중치와 활성화를 모두 16비트 고정소수점 정밀도로 양자화하여 이미지넷 Top-1 정확도가 0.8% 이내로 하락하는 것을 달성하였다.
  • 활성화의 양자화는 스파arsity를 최대 50%까지 증가시키며, 특히 초기 및 중간 계층에서 두드러진다. 이는 추론 중에 0값 곱셈을 건너뛸 수 있게 해 추론의 효율성을 높인다.
  • ADaPTION의 동적 비트 할당 전략은 정밀도와 동적 범위 사이의 균형을 효과적으로 유지하여, 가중치와 활성화의 다이내믹 레인지가 매우 다를 경우에도 정확한 양자화를 가능하게 한다.
  • ADaPTION은 Ristretto보다 고정소수점 활성화 양자화를 더 잘 지원하여, NullHop와 같은 플랫폼에서 스파arsity와 하드웨어 가속을 가능하게 하는 데 핵심적인 역할을 한다.
  • ADaPTION를 사용해 훈련한 Giga1Net 벤치마크 네트워크는 GTX980 Ti에서 36시간 동안 훈련한 후 ImageNet에서 Top-1 정확도 38%를 달성하였으며, 계산 비용은 1 GOp/frame이었다.
  • 이 도구상자는 Caffe와 완전히 호환되며, 사전 학습된 모델의 미세조정과 함께 새로운 모델의 훈련을 모두 지원하여 고정소수점 하드웨어 가속기에서의 탄력적인 배포를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.