[論文レビュー] Term Revealing: Furthering Quantization at Run Time on Quantized DNNs
本稿では、グループ化された重みおよび活性化から最大の2の累乗項のみを動的に選択することにより、すでに量子化済みのDNNにおける計算量をさらに削減するランタイム量子化技術であるTerm Revealing (TR) を提案する。符号付き桁表現を用いたHESE符号化によるグループベースの選択により、TRは従来の量子化と比較して3–10倍の低い推論計算量を達成しつつモデルの精度を維持する。FPGA実装により、最大7.8倍の低遅延および4.3倍の高いエネルギー効率が実証された。
We present a novel technique, called Term Revealing (TR), for furthering quantization at run time for improved performance of Deep Neural Networks (DNNs) already quantized with conventional quantization methods. TR operates on power-of-two terms in binary expressions of values. In computing a dot-product computation, TR dynamically selects a fixed number of largest terms to use from the values of the two vectors in the dot product. By exploiting normal-like weight and data distributions typically present in DNNs, TR has a minimal impact on DNN model performance (i.e., accuracy or perplexity). We use TR to facilitate tightly synchronized processor arrays, such as systolic arrays, for efficient parallel processing. We show an FPGA implementation that can use a small number of control bits to switch between conventional quantization and TR-enabled quantization with a negligible delay. To enhance TR efficiency further, we use a signed digit representation (SDR), as opposed to classic binary encoding with only nonnegative power-of-two terms. To perform conversion from binary to SDR, we develop an efficient encoding method called HESE (Hybrid Encoding for Signed Expressions) that can be performed in one pass looking at only two bits at a time. We evaluate TR with HESE encoded values on an MLP for MNIST, multiple CNNs for ImageNet, and an LSTM for Wikitext-2, and show significant reductions in inference computations (between 3-10x) compared to conventional quantization for the same level of model performance.
研究の動機と目的
- 従来の手法で量子化済みのDNNにおいて、モデル精度を損なわずにさらなる計算量削減を実現すること。
- 従来の量子化には、再トレーニングなしではさらなる削減が不可能であり、顕著な精度損失を伴うという限界を克服すること。
- 制御オーバーヘッドを最小限に抑えた再構成可能ハードウェアシステムを設計し、従来の量子化とランタイムTR量子化の両方をサポートすること。
- 計算の節約を高めるために、値表現における項の数を最小限に抑える効率的な符号付き桁表現(SDR)符号化手法を開発すること。
提案手法
- TRは、量子化された重みおよび活性化の2の累乗項(2の累乗の項)を対象とし、値のグループ内から最大の項のみを選択する。
- TRはグループベースのアプローチを採用しており、各グループの$g$個の値から上位$k$個の項(グループ予算$k$)を固定して選択し、ドット積の計算における項ペア乗算の回数を削減する。
- HESE(符号付き表現のハイブリッド符号化)法は、標準的な2進表現を1パスで最小長の符号付き桁表現(SDR)に変換する。この際、2ビットずつしか調べない。
- tMAC(term MAC)ハードウェア設計を提案し、ビット逐次係数蓄積を用いたスティリックアレイアーキテクチャにより、面積を小さくかつ高い一貫性を実現する。
- FPGAシステムは、わずか数ビットの制御ビットで、従来の量子化とTR対応量子化の間でランタイム再構成を可能にし、遅延をほとんど発生させずに動的切り替えを実現する。
- 本手法は、DNNの重みおよび活性化が正規分布に類似した分布を示すことに着目し、項の剪定を積極的に行っても精度損失が最小限に抑えられることを保証する。
実験結果
リサーチクエスチョン
- RQ1すでに量子化済みのDNNに対して、モデル性能を劣化させることなく、ランタイムにさらなる量子化を実行可能か?
- RQ2グループベースの項選択は、精度を維持しつつ、DNN推論における計算効率をどのように向上させるか?
- RQ3最小限の項数を持つ符号付き桁表現(SDR)を用いることで、推論計算量およびハードウェア効率にどのような影響を与えるか?
- RQ4多様なDNNアーキテクチャにわたって、従来の量子化と比較してTRは計算コスト(例:項ペア乗算)をどの程度低減できるか?
- RQ51つのFPGAハードウェア設計が、制御オーバーヘッドを最小限に抑えつつ、従来の量子化とTR対応量子化の両方を効率的にサポートできるか?
主な発見
- TRは、MLP、CNN、LSTMの各モデルにおいて、同じモデル精度を維持したまま、従来の量子化と比較して推論計算量を3–10倍低減した。
- FPGA実装では、同じハードウェア上で従来の量子化(QT)と比較し、平均処理遅延が7.8倍低く、エネルギー効率が4.3倍高くなった。
- ImageNetにおけるResNet-18では、TRシステムはトップ1精度69.48%、25.22フレーム/Jのエネルギー効率、7.21msの遅延を達成し、精度および効率の面で他のFPGAベースのアクセラレータを上回った。
- グループサイズ$g=8$、各モデルに応じて最適化されたグループ予算$k$(例:LSTMでは$k=20$、VGG-16では$k=8$)を用いることで、TRはQT設定と比較して0.15%以内の精度損失に抑えた。
- HESE符号化により、1パス、2ビット先読みの変換が可能となり、値表現における項の数を削減し、結果として計算コストを低減した。
- 再構成可能FPGAシステムは、従来の量子化とTR対応量子化の間を切り替えるために、少数の制御ビットのみを必要とし、効率的なランタイム適応を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。