Skip to main content
QUICK REVIEW

[論文レビュー] Accumulation Bit-Width Scaling For Ultra-Low Precision Training Of Deep Networks

Charbel Sakr, Naigang Wang|arXiv (Cornell University)|Jan 19, 2019
Advanced Neural Network Applications被引用数 13
ひとこと要約

本論文は、部分和の分布から導かれる分散に基づく境界を用いて、深層ニューラルネットワークの超低精度学習における最小蓄積ビット幅を解析的に決定する統計的手法を提案する。この手法により、精度の劣化を伴わずに、FPUハードウェアで最大2.2倍の面積および消費電力削減を実現する。

ABSTRACT

Efforts to reduce the numerical precision of computations in deep learning training have yielded systems that aggressively quantize weights and activations, yet employ wide high-precision accumulators for partial sums in inner-product operations to preserve the quality of convergence. The absence of any framework to analyze the precision requirements of partial sum accumulations results in conservative design choices. This imposes an upper-bound on the reduction of complexity of multiply-accumulate units. We present a statistical approach to analyze the impact of reduced accumulation precision on deep learning training. Observing that a bad choice for accumulation precision results in loss of information that manifests itself as a reduction in variance in an ensemble of partial sums, we derive a set of equations that relate this variance to the length of accumulation and the minimum number of bits needed for accumulation. We apply our analysis to three benchmark networks: CIFAR-10 ResNet 32, ImageNet ResNet 18 and ImageNet AlexNet. In each case, with accumulation precision set in accordance with our proposed equations, the networks successfully converge to the single precision floating-point baseline. We also show that reducing accumulation precision further degrades the quality of the trained network, proving that our equations produce tight bounds. Overall this analysis enables precise tailoring of computation hardware to the application, yielding area- and power-optimal systems.

研究の動機と目的

  • 低精度ディープラーニング学習における最適な蓄積精度を決定する理論的枠組みの欠如に対処すること。
  • 実際の応用では、重みと活性化の精度が低下しても、32ビットの蓄積器が過剰に使用されていることが一般的であり、これによりハードウェア効率が制限されることを是正すること。
  • ブルートフォースシミュレーションやヒューリスティック設計を避ける、正確で解析的に導出された蓄積ビット幅の設定手法を提供すること。
  • 提案された精度境界がタイトで、過剰に慎重ではないことを検証し、完全精度ベースラインへの収束を保証すること。
  • 正確に最小必要精度を予測することで、低精度DNN学習に最適化された、面積および消費電力効率の高いFPU設計を実現すること。

提案手法

  • GEMM演算における部分和の分散と蓄積ビット幅およびシーケンス長との関係を記述する統計モデルを導出する。
  • 蓄積精度の低下に起因する情報損失を定量化するための分散低減比(VRR)指標を導入する。
  • VRRを用いて、分散損失が許容範囲内に保たれるようにするための最小ビット数を計算する。
  • CIFAR-10 ResNet-32、ImageNet ResNet-18、ImageNet AlexNetの3つのベンチマークネットワークに導出式を適用する。
  • 精度摂動(PP)を用いた学習実験により予測を検証し、完全精度ベースラインとの収束を比較する。
  • 通常の蓄積方式とチャンクベースの蓄積方式の両方を検討し、精度予測の感度および耐性を評価する。

実験結果

リサーチクエスチョン

  • RQ1超低精度DNN学習において収束の忠実性を維持するために、最小でどの程度の蓄積ビット幅が必要か?
  • RQ2蓄積精度が低下すると、部分和の分散にどのような影響が生じ、その結果、モデルの収束にどのような影響を与えるか?
  • RQ3分散ダイナミクスに基づく統計モデルは、経験的試行錯誤を伴わずに、安定した学習に必要な最小精度を予測できるか?
  • RQ4導出された精度境界はどの程度タイトか?予測された閾値を下回る精度のさらなる低減が、性能劣化を引き起こすか?
  • RQ5ハードウェア最適化DNN学習において、ヒューリスティック的またはブルートフォース設計手法と比較して、本手法はどの程度の耐性と正確性を示すか?

主な発見

  • 提案手法は、3つのベンチマークネットワークすべてにおいて、完全精度ベースラインとの差が0.5%以内に収束する蓄積ビット幅を的確に予測した。
  • 精度を予測された最小値未満に低下させた場合(PP < 0)、精度が著しく劣化し、導出された境界がタイトであることを確認した。
  • ImageNet ResNet-18は、精度を1ビット低下させると0.5%を超える劣化を示し、最も精度低下に敏感であった。
  • ImageNet AlexNetは、過剰にパラメータ化されたアーキテクチャのため、精度摂動に対してより耐性を示したが、依然として精度が低下する傾向を示した。
  • チャンクベースの蓄積は、通常の蓄積よりも精度低下に対してより感受性が高く、同じビット数の低下が、低精度の割り当てに対してより大きな相対的変化をもたらすためである。
  • 過剰な蓄積精度を排除することで、FPUハードウェアで最大2.2倍の面積削減を実現した。これは、顕著なハードウェア効率の向上を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。