Skip to main content
QUICK REVIEW

[論文レビュー] Understanding the Impact of Precision Quantization on the Accuracy and Energy of Neural Networks

Soheil Hashemi, Nicholas Anthony|arXiv (Cornell University)|Dec 12, 2016
Advanced Neural Network Applications参考文献 18被引用数 7
ひとこと要約

この論文は、深層ニューラルネットワークにおける精度量子化、精度、エネルギー効率のトレードオフを調査する。低精度ネットワークにおける精度損失を軽減するための訓練技術を提案し、大きな低精度モデルが、精度とエネルギー効率の両面で小規模なフル精度モデルを上回ることを示している。最小限の精度低下で最大94.1%のエネルギー節約を達成している。

ABSTRACT

Deep neural networks are gaining in popularity as they are used to generate state-of-the-art results for a variety of computer vision and machine learning applications. At the same time, these networks have grown in depth and complexity in order to solve harder problems. Given the limitations in power budgets dedicated to these networks, the importance of low-power, low-memory solutions has been stressed in recent years. While a large number of dedicated hardware using different precisions has recently been proposed, there exists no comprehensive study of different bit precisions and arithmetic in both inputs and network parameters. In this work, we address this issue and perform a study of different bit-precisions in neural networks (from floating-point to fixed-point, powers of two, and binary). In our evaluation, we consider and analyze the effect of precision scaling on both network accuracy and hardware metrics including memory footprint, power and energy consumption, and design area. We also investigate training-time methodologies to compensate for the reduction in accuracy due to limited bit precision and demonstrate that in most cases, precision scaling can deliver significant benefits in design metrics at the cost of very modest decreases in network accuracy. In addition, we propose that a small portion of the benefits achieved when using lower precisions can be forfeited to increase the network size and therefore the accuracy. We evaluate our experiments, using three well-recognized networks and datasets to show its generality. We investigate the trade-offs and highlight the benefits of using lower precisions in terms of energy and memory footprint.

研究の動機と目的

  • 32ビット浮動小数点までを含む、バイナリから32ビット浮動小数点までのさまざまな数値精度が、ニューラルネットワークの精度とハードウェア効率に与える影響を体系的に評価すること。
  • 訓練時の補正技術を用いて、低精度ネットワークにおける精度低下の課題に対処すること。
  • 低精度によるエネルギー節約を、モデルサイズの増加に再投資することで、ベースライン精度を回復または上回ることの可能性を調査すること。
  • 複数のネットワークアーキテクチャとデータセットを対象に、ハードウェアメトリクス(エネルギー、面積、電力)と推論精度の包括的でデータドリブンな分析を提供すること。
  • 低消費電力システムへの実用的導入を想定した、精度とエネルギー効率の間のパレートフロンティアを確立すること。

提案手法

  • 32ビット浮動小数点、固定小数点(8, 16, 32ビット)、2の累乗量子化、バイナリ重みを含む広範な精度表現のスケールを評価する。
  • 低精度ネットワークにおける精度損失を軽減するため、微調整と再訓練を用いた訓練時の補正戦略を適用する。
  • 標準、拡張(+)、さらに拡張(++)の3つのネットワークバージョンを導入し、幅または深さを増すことで精度損失を補う。
  • シミュレーションとハードウェアモデリングを用いて、メモリフットプリント、エネルギー消費、設計面積などのハードウェアに配慮したメトリクスを測定する。
  • パレートフロンティアの可視化を用いて、精度レベルとネットワークサイズの間のトレードオフを比較し、最適な設計ポイントを特定する。
  • 一般性を保証するため、CIFAR-10データセットを用いて3つのベンチマークネットワーク(ALEX, ALEX+, ALEX++)で結果を検証する。

実験結果

リサーチクエスチョン

  • RQ1ネットワーク重みと活性化のビット精度を低下させると、さまざまなネットワークアーキテクチャにおいて推論精度にどのように影響するか?
  • RQ2微調整や再訓練などの訓練時技術が、低精度ネットワークにおける精度低下をどの程度補うことができるか?
  • RQ3低精度表現によるエネルギー節約を、モデルサイズの増加に効果的に再投資することで、フル精度モデルの精度を回復または上回ることができるか?
  • RQ4低消費電力推論システムにおいて、精度、ネットワークサイズ、ハードウェア効率(エネルギー、面積、電力)の最適なバランスは何か?
  • RQ5実世界のベンチマークにおいて、固定小数点、2の累乗、バイナリなどの異なる量子化方式は、精度とエネルギー効率の面でどのように比較されるか?

主な発見

  • 固定小数点(8,8)は、CIFAR-10でフル精度(32,32)と比較して3.23%の精度低下で85.34%のエネルギー節約を達成した。
  • バイナリネットワーク(1,16)は94.10%のエネルギー節約を達成し、エネルギー消費を335.68 μJから19.79 μJに削減したが、74.84%の精度を維持した。
  • 2の累乗量子化(6,16)を用いた拡張ネットワークALEX++は、81.26%の精度と35.93%のエネルギー節約を達成し、フル精度ベースラインを両方の指標で上回った。
  • 大きな低精度ネットワーク、例えばBinary Net++(1,16)は80.52%の精度と72.89%のエネルギー節約を達成し、アーキテクチャの拡張によって精度損失を回復できることを示した。
  • 固定小数点(4,4)はCIFAR-10で収束しなかったため、訓練安定性が損なわれる精度の下限が存在することが示された。
  • パレートフロンティア分析により、大きな低精度ネットワークが、エネルギー効率と精度の両面でフル精度モデルを上回ることができることが確認された。特に、エネルギー節約をモデルサイズに一部再投資することで、より顕著な優位性が得られることが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。