Skip to main content
QUICK REVIEW

[논문 리뷰] Precision Gating: Improving Neural Network Efficiency with Dynamic Dual-Precision Activations

Yichi Zhang, Ritchie Zhao|arXiv (Cornell University)|2020. 02. 17.
Advanced Neural Network Applications참고 문헌 30인용 수 16
한 줄 요약

이 논문은 주어진 입력에 따라 중요도가 달라지는 특징을 고려해 대부분의 특징을 저밀도로 계산하면서도 핵심 특징만 유연하게 고밀도로 승격하는, 미분 가능한 게이팅 메커니즘을 사용하는 엔드 투 엔드 훈련 가능한 동적 双밀도 정밀도 양자화 방법인 정밀도 게이팅(Precision Gating, PG)을 제안한다. PG는 정확도 손실를 최소화하면서도 계산 비용을 최대 4.5배까지 줄이며, LSTMs에서는 1.2% 낮은 퍼플렉서티와 2.7배 적은 계산량을 달성하고, ImageNet에서는 기존 최고 수준의 방법보다 3.5% 높은 정확도와 2.4배 적은 계산량을 확보한다.

ABSTRACT

We propose precision gating (PG), an end-to-end trainable dynamic dual-precision quantization technique for deep neural networks. PG computes most features in a low precision and only a small proportion of important features in a higher precision to preserve accuracy. The proposed approach is applicable to a variety of DNN architectures and significantly reduces the computational cost of DNN execution with almost no accuracy loss. Our experiments indicate that PG achieves excellent results on CNNs, including statically compressed mobile-friendly networks such as ShuffleNet. Compared to the state-of-the-art prediction-based quantization schemes, PG achieves the same or higher accuracy with 2.4$ imes$ less compute on ImageNet. PG furthermore applies to RNNs. Compared to 8-bit uniform quantization, PG obtains a 1.2% improvement in perplexity per word with 2.7$ imes$ computational cost reduction on LSTM on the Penn Tree Bank dataset. Code is available at: https://github.com/cornell-zhang/dnn-gating

연구 동기 및 목표

  • 딥 네트워크(DNN)에서 정적 양자화의 비효율성, 즉 입력에 따라 특징 중요도가 달라짐에도 불구하고 고정된 정밀도를 할당하는 문제를 해결하기 위해.
  • 특히 자원이 제한된 엣지 디바이스에 배포할 경우 정확도를 훼손하지 않으면서 DNN 추론의 계산 비용을 줄이기 위해.
  • 개별 특징 수준에서 입력에 적응하는 정밀도 할당을 엔드 투 엔드 훈련 가능한 방식으로 가능하게 하여 효율성과 정확도를 향상시키기 위해.
  • 백프로파게이션을 통해 어떤 특징이 더 높은 정밀도가 필요한지 학습할 수 있도록 가능한 미분 가능한 게이팅 메커니즘을 도입하기 위해.
  • CNN과 RNN을 포함한 다양한 아키텍처에서 ImageNet과 Penn Tree Bank 등의 표준 벤치마크에서 PG의 효과를 입증하기 위해.

제안 방법

  • PG는 주요 DNN 레이어를 저밀도(예: 3비트)로 계산하고, 학습된 게이팅 함수를 통해 고크기 출력 특징을 중요 특징으로 식별한다.
  • 선택된 중요한 특징들만 희박한 고밀도 업데이트를 적용함으로써 특징 수준에서 이중정밀도 계산을 실현한다.
  • 게이팅 함수는 미분 가능하므로, 어떤 특징이 승격되어야 할지 최적화하기 위해 백프로파게이션을 수행할 수 있으며, 엔드 투 엔드 훈련이 가능하다.
  • 저밀도 정밀도 환경에서의 양자화 오차를 줄이고 활성화 외곽치를 처리하기 위해 PACT(Parametric ReLU Activation Clipping)를 통합한다.
  • 업데이트 단계는 희박성을 효율적으로 활용하는 샘플드 밀도-밀도 행렬 곱셈(SDDMM) 커널을 사용해 구현되며, 이는 속도 향상에 기여한다.
  • 역전파 동안에도 희박성이 유지되어 전방 및 역방향 전파 모두에서 상당한 계산 절감이 가능하다.

실험 결과

연구 질문

  • RQ1동적이고 입력에 적응하는 정밀도 할당이 정확도 저하 없이 DNN 추론 효율성을 향상시킬 수 있는가?
  • RQ2미분 가능한 게이팅 메커니즘이 이중정밀도 DNN의 엔드 투 엔드 훈련을 최소한의 오버헤드로 가능하게 할 수 있는가?
  • RQ3CNN과 RNN에서 정적 및 예측 기반 양자화 방법과 비교해 PG는 정확도와 계산 비용 측면에서 어떤가?
  • RQ4업데이트 단계의 희박성이 CPU 및 GPU 아키텍처에서 계산 속도 향상에 어느 정도 기여하는가?
  • RQ5PG는 컨볼루션 및 순환 네트워크, 특히 ShuffleNet과 LSTMs와 같은 모바일 우량 모델에 효과적으로 적용될 수 있는가?

주요 결과

  • ImageNet에서 PG는 기준 8비트 양자화보다 2.4배 적은 계산 비용으로 3.5% 높은 정확도를 달성한다.
  • CIFAR-10에서 PG는 정확도를 0.6% 향상시키며, 8비트 기준보다 계산 비용을 최대 4.5배까지 줄였다.
  • Penn Tree Bank 데이터셋에서 PG는 단어당 퍼플렉서티(PPW)를 1.2% 향상시키고, 8비트 균일 양자화 대비 계산 비용을 2.7배 줄였다.
  • SDDMM 커널 구현은 CPU에서 조밀한 GEMM 대비 최대 8.3배의 월클럭 속도 향상을 기록했으며, ResNet-20 레이어의 희박성은 76%에서 99%까지 다양했다.
  • 역전파 과정에서 전방 전파보다 6–21% 더 높은 희박성을 유도하여, 훈련 및 추론 모두에서 상당한 계산 절감이 가능했다.
  • 이 방법은 전용 가속기와 호환되며, 전용 하드웨어에서 최소 3배의 속도 향상과 5배의 에너지 효율성 향상을 기대할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.