Skip to main content
QUICK REVIEW

[論文レビュー] Intra-layer Nonuniform Quantization for Deep Convolutional Neural Network

Fangxuan Sun, Jun Lin|arXiv (Cornell University)|Jul 10, 2016
Advanced Image and Video Retrieval Techniques被引用数 5
ひとこと要約

本稿では、活性化分布の特性を活用して、深層畳み込みニューラルネットワーク(DCNN)におけるメモリ使用量を削減するための階層内非一様量子化方式—等距離非一様量子化(ENQ)およびK-meansクラスタリングベース非一様量子化(KNQ)—を提案する。KNQ方式は、VGG-16およびAlexNetにおいて最大50%のメモリ削減を達成し、精度損失は2%未満に抑えられ、先行する最先端手法を上回る性能を示した。

ABSTRACT

Deep convolutional neural network (DCNN) has achieved remarkable performance on object detection and speech recognition in recent years. However, the excellent performance of a DCNN incurs high computational complexity and large memory requirement. In this paper, an equal distance nonuniform quantization (ENQ) scheme and a K-means clustering nonuniform quantization (KNQ) scheme are proposed to reduce the required memory storage when low complexity hardware or software implementations are considered. For the VGG-16 and the AlexNet, the proposed nonuniform quantization schemes reduce the number of required memory storage by approximately 50\% while achieving almost the same or even better classification accuracy compared to the state-of-the-art quantization method. Compared to the ENQ scheme, the proposed KNQ scheme provides a better tradeoff when higher accuracy is required.

研究の動機と目的

  • 低複雑度のハードウェアまたはソフトウェア実装における、深層畳み込みニューラルネットワーク(DCNN)の活性化のメモリ使用量要件を低減すること。
  • VGG-16やAlexNetのような深層ネットワークにおける、フル精度の活性化による高いメモリ容量を是正すること。
  • 活性化分布に適した階層固有の非一様量子化を可能にすることで、既存の量子化手法を改善すること。
  • 各層ごとの適応的量子化を通じて、精度とメモリ使用量のハードウェアフレンドリーなトレードオフを実現すること。
  • 最先端手法と比較して顕著なメモリ節約を実現しながら、分類精度を維持または向上させること。

提案手法

  • 各層の活性化分布統計に基づき、量子化レベル間の間隔を等距離に設定する階層内非一様量子化(ENQ)を提案する。
  • 活性化値にK-meansを適用してクラスターセンタを決定することで、量子化誤差を最小化するK-meansクラスタリングベースの階層内非一様量子化(KNQ)を導入する。
  • 活性化分布の分散に基づき、各層に特化したビット幅割り当てを実施し、精度レベルごとの最小メモリ使用量を最適化する。
  • クラスタリングや等間隔量子化の前処理として、正規化やスケーリングなどの技術を用い、量子化精度を向上させる。
  • TSMC 90nm CMOSプロセスを用いてハードウェアのオーバーヘッドを評価し、量子化ユニットの面積とクリティカルパス遅延が低いことを示した。
  • 先行研究([13])と比較するため、正規化ビット数(NNB)および絶対的メモリサイズ(NB)を用いてベンチマークを実施した。

実験結果

リサーチクエスチョン

  • RQ1階層内非一様量子化は、階層間のアプローチと比較して、DCNN活性化のメモリ使用量をより効果的に削減できるか?
  • RQ2K-meansクラスタリングベースの量子化は、等距離量子化と比較して、活性化量子化においてより優れた精度とメモリ効率を達成できるか?
  • RQ3VGG-16およびAlexNetにおいて、どれほどメモリ使用量を削減できるか、かつ高い分類精度を維持できるか?
  • RQ4前処理は、非一様量子化方式の性能(精度およびビット割り当て)にどのように影響を与えるか?
  • RQ5KNQのハードウェア複雑度は、ENQおよび先行の最先端量子化手法と比較して、どのようなトレードオフを示すか?

主な発見

  • KNQ方式は、[13]で示された最先端手法と比較して、約50%のメモリ使用量削減を達成した。VGG-16では16.8 MBから8.4 MBに、AlexNetでは1.12 MBから0.48 MBに削減された。
  • VGG-16では、KNQが1アクティベーションあたり5ビットで86.58%のトップ-5精度を達成し、[13]の手法を0.36%上回った。
  • ENQ方式は、[13]と比較して50%のメモリ使用量削減を達成した。VGG-16では9.5 MB、AlexNetでは0.48 MBを記録し、半精度浮動小数点モデルと比較して精度損失はわずか1.9%であった。
  • 前処理を適用したKNQは、VGG-16で5ビットで86.58%のトップ-5精度を達成し、AlexNetでは3ビットで78.23%の精度を達成した。
  • KNQユニットのハードウェア実装では、7.5 mm²の面積と0.65 nsのクリティカルパス遅延を達成し、組み込みデプロイメントに適した低オーバーヘッドを示した。
  • ENQおよびKNQの両方の方式が、VGG-16およびAlexNetにおいて、フル精度浮動小数点モデルと比較して2%未満の精度低下に抑えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。