Skip to main content
QUICK REVIEW

[논문 리뷰] On the quantization of recurrent neural networks

Jian Li, Raziel Álvarez|arXiv (Cornell University)|2021. 01. 14.
Advanced Neural Network Applications참고 문헌 18인용 수 7
한 줄 요약

이 논문은 Long Short-Term Memory (LSTM) 네트워크를 위한 정수만을 사용하는 양자화 전략을 제안하며, 8비트 정수 연산만을 사용하여 정확하고 효율적이며 하드웨어 이식성이 뛰어난 추론을 가능하게 한다. 사전에 계산된 제로 포인트와 대칭 양자화를 활용함으로써, 훈련 후 거의 손실이 없는 정확도를 달성하고, CPU에서 FP32 대비 최대 2배 빠른 추론 속도를 확보한다. 이는 메모리 사용량이 최소화되고 추론 중에 부동소수점 연산이 전혀 필요로 하지 않는다.

ABSTRACT

Integer quantization of neural networks can be defined as the approximation of the high precision computation of the canonical neural network formulation, using reduced integer precision. It plays a significant role in the efficient deployment and execution of machine learning (ML) systems, reducing memory consumption and leveraging typically faster computations. In this work, we present an integer-only quantization strategy for Long Short-Term Memory (LSTM) neural network topologies, which themselves are the foundation of many production ML systems. Our quantization strategy is accurate (e.g. works well with quantization post-training), efficient and fast to execute (utilizing 8 bit integer weights and mostly 8 bit activations), and is able to target a variety of hardware (by leveraging instructions sets available in common CPU architectures, as well as available neural accelerators).

연구 동기 및 목표

  • 다양한 하드웨어에서 효율적으로 구현 가능한 고정밀도 모델 정확도를 유지하면서 LSTM 네트워크에 대한 완전한 정수 양자화 전략을 개발하는 것.
  • 추론 중 부동소수점 연산에 의존하지 않도록 하여 에너지 효율성과 하드웨어 호환성을 향상시키는 것.
  • 최소한의 데이터와 최적화 없이 훈련 후 양자화를 가능하게 하여 실사용 환경에서의 구현 가능성을 확보하는 것.
  • 사전에 제로 포인트 보정을 계산하고 이를 편향 항목에 통합함으로써 정수 실행을 최적화하는 것.
  • 다른 RNN 변종, 특히 GRUs와 SRUs의 양자화를 위한 확장 가능한 기반을 제공하는 것.

제안 방법

  • 가중치와 활성화 모두에 대해 대칭 8비트 정수 양자화를 적용하며, 학습된 스케일 및 제로 포인트 파rameter를 사용한다.
  • 최적화 없이 소량의 데이터(100개의 발화)에서 수집된 통계를 기반으로 훈련 후 양자화를 적용한다.
  • 사전에 제로 포인트 항목을 오프라인으로 계산하고 편향에 통합함으로써 런타임 양자화 오버헤드를 제거한다.
  • 입력과 순환 가중치/활성화의 연결을 분리하기 위해 텐서플로 그래프를 재작성함으로써 정확한 텐서 단위 양자화를 가능하게 한다.
  • 양자화 파이프라인에 레이어 정규화와 피크홀 연결을 통합하여 수치적 안정성을 유지한다.
  • 표준 LSTM과 CIFG 변종 모두를 지원하며, 모델 압축을 위한 스파arsity 인식 양자화도 제공한다.

실험 결과

연구 질문

  • RQ1부동소수점 연산 없이도 고정밀도 추론 정확도를 유지할 수 있는 완전한 정수 전용 양자화 전략을 LSTM 네트워크에 설계할 수 있는가?
  • RQ2특히 장시간 시퀀스에서, 최소한의 데이터로 훈련 후 양자화가 얼마나 효과적인가?
  • RQ3CPU 아키텍처에서 정수 LSTM 추론을 최적화하기 위해 적용 가능한 최적화 전략은 무엇인가?
  • RQ4제안된 양자화 전략은 GRUs 및 SRUs와 같은 다른 RNN 변종으로 일반화될 수 있는가?
  • RQ5다양한 음성 인식 데이터셋과 다양한 시퀀스 길이에서 이 양자화 전략의 성능은 어떻게 되는가?

주요 결과

  • 단지 100개의 발화로만 훈련 후 양자화를 적용해도, 장시간 16.5분 분량의 유튜브 발화를 포함한 모든 데이터셋에서 정확도 손실가능성이 거의 없이 유지된다.
  • 완전한 정수 양자화 모델은 VoiceSearch에서 6.7% WER, YouTube에서 19.8% WER, Telephony에서 8.2% WER를 기록하며, 부동소수점 기준선과 동일한 성능을 달성한다.
  • 정수 양자화로 모델 크기를 FP32의 466MB에서 8비트 정수의 117MB로 줄여 75% 감소시켰다.
  • 최적화된 정수 LSTM은 하이브리드 양자화보다 5% 빠르며, FP32 대비 2배 빠른 속도를 기록했으며, 런타임 스케일 계산이 전혀 필요로 하지 않는다.
  • 50% 스파arsity를 지원하는 스파르스 LSTMs의 경우, 모델 크기를 정수 기반 71MB, 스파르스 정수 기반 57MB로 줄일 수 있었고, 정확도 저하가 최소한이었다.
  • 이 전략은 이중성 LSTM, GRUs 및 기타 RNN 변종에 직접 적용 가능하며, 일관된 성능과 정확도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.