[論文レビュー] Power-of-Two Quantization for Low Bitwidth and Hardware Compliant Neural Networks
本論文は、新しいQuantization Aware Training (QAT)アルゴリズムを用いて、ハードウェアに準拠した低ビット幅ニューラルネットワークのための2の累乗(PoT)量子化を提案する。重みを2の累乗として表現することで、計算コストの高い乗算を効率的なビットシフトに置き換え、全精度モデルと同等の最先端の精度を達成するとともに、ASIC設計において8ビット均一量子化と比較して最大6倍のエネルギー消費削減と1.7倍の面積削減を実現する。
Deploying Deep Neural Networks in low-power embedded devices for real time-constrained applications requires optimization of memory and computational complexity of the networks, usually by quantizing the weights. Most of the existing works employ linear quantization which causes considerable degradation in accuracy for weight bit widths lower than 8. Since the distribution of weights is usually non-uniform (with most weights concentrated around zero), other methods, such as logarithmic quantization, are more suitable as they are able to preserve the shape of the weight distribution more precise. Moreover, using base-2 logarithmic representation allows optimizing the multiplication by replacing it with bit shifting. In this paper, we explore non-linear quantization techniques for exploiting lower bit precision and identify favorable hardware implementation options. We developed the Quantization Aware Training (QAT) algorithm that allowed training of low bit width Power-of-Two (PoT) networks and achieved accuracies on par with state-of-the-art floating point models for different tasks. We explored PoT weight encoding techniques and investigated hardware designs of MAC units for three different quantization schemes - uniform, PoT and Additive-PoT (APoT) - to show the increased efficiency when using the proposed approach. Eventually, the experiments showed that for low bit width precision, non-uniform quantization performs better than uniform, and at the same time, PoT quantization vastly reduces the computational complexity of the neural network.
研究の動機と目的
- 8ビット未満の低ビット幅ニューラルネットワークにおける均一量子化による精度低下を是正すること。
- ネットワーク重みの非一様分布をよりよく保持する非均一量子化技術—特に2の累乗(PoT)および加法的PoT(APoT)—を検討すること。
- FPGAおよびASICプラットフォーム用に、PoT量子化を活用したハードウェア効率の高いMACユニットの設計と評価を行うこと。
- PoT量子化がモデル精度を損なわせることなく、メモリ、パワー、面積の使用量を顕著に削減できることを実証すること。
提案手法
- 2の累乗(PoT)重みを用いた深層ニューラルネットワークのトレーニングを可能にする、STEベースのQuantization Aware Training(QAT)アルゴリズムを提案する。
- 特にImageNetモデルにおいて精度を向上させるために、動的固定小数点スケーリング(FSR)を採用する。
- PoTおよびAPoT重み用に、乗算をビットシフト演算に置き換える乗算器不要のMACユニットを設計する。
- 5nmプロセスを用いて、FPGAおよびASICプラットフォーム上で、均一、PoT、APoTの3種類のMACユニット設計を合成し、比較する。
- 合成後の解析を用いて、さまざまな量子化方式における面積、パワー、エネルギー効率を評価する。
- 8x8均一、4x8均一、PoT、APoTのMACユニット間で、リソース使用量(LUT、FF、DSP)およびパワー消費を比較する。
実験結果
リサーチクエスチョン
- RQ12の累乗(PoT)量子化は、低ビット幅ニューラルネットワークにおいて最先端の精度を達成しつつ、ハードウェア効率の良い推論を可能にするか?
- RQ2FPGAおよびASICプラットフォームにおいて、PoT量子化は均一量子化およびAPoT量子化と比較して、リソース使用量とエネルギー効率に優れているか?
- RQ3提案されたQATアルゴリズムは、すべてのレイヤーを4ビット以下に量子化する場合でも、モデル精度をどの程度保持できるか?
- RQ4MACユニットにおける乗算をビットシフトに置き換えることで、DNNアクセラレータのパワーおよび面積消費を顕著に削減できるか?
- RQ5重みのビット幅を低くすることでDRAMトランザクションを減らし、メモリ帯域幅とリークパワーを低減できるか?
主な発見
- 5nm ASIC合成において、4ビットPoT量子化を用いた本手法のMACユニットは、8x8均一MACユニットと比較してエネルギー消費を6倍低減し、面積を1.7倍削減した。
- PoT MACユニットは4x8均一MACユニットと比較して2倍のパワー低減を達成し、乗算をビットシフトに置き換えることによる顕著なエネルギー節約を示した。
- FPGA上でのPoT設計は39 LUTおよび25 FFを必要とし、4x8均一MAC(46 LUT、27 FF)と比較して面積効率に優れた性能を示した。
- APoT MACユニットは55 LUTおよび49 FFを必要とし、PoTユニットの約2倍のリソースを要するが、より高い精度を達成した。
- 動的FSRを用いた本手法のQATアルゴリズムは、ImageNetにおいてDeepShiftを上回る高い精度を達成し、4ビットPoTネットワークにおいて既存の研究を凌駆した。
- 低いビット幅でのストレージにより、メモリ帯域幅とリークパワーが低減し、推論速度が向上し、エネルギー効率が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。