Skip to main content
QUICK REVIEW

[論文レビュー] Neural gradients are near-lognormal: improved quantized and sparse training

Brian Chmiel, Liad Ben-Uri|arXiv (Cornell University)|Jun 15, 2020
Advanced Neural Network Applications被引用数 9
ひとこと要約

この論文は、ニューラル勾配がほぼ対数正規分布に従うことを発見し、これにより2つの新しい分析的手法を可能にした:最適化された6ビット浮動小数点量子化と正確な勾配スパースネスのプルーニング。対数正規統計を活用することで、精度の低下を伴わずImageNetで最先端の結果を達成し、6ビット勾配量子化と最大85%のスパースネスを実現した。これは、損失スケーリングなどのヒューリスティック手法に対する理論的裏付けのある代替手法を提供する。

ABSTRACT

While training can mostly be accelerated by reducing the time needed to propagate neural gradients back throughout the model, most previous works focus on the quantization/pruning of weights and activations. These methods are often not applicable to neural gradients, which have very different statistical properties. Distinguished from weights and activations, we find that the distribution of neural gradients is approximately lognormal. Considering this, we suggest two closed-form analytical methods to reduce the computational and memory burdens of neural gradients. The first method optimizes the floating-point format and scale of the gradients. The second method accurately sets sparsity thresholds for gradient pruning. Each method achieves state-of-the-art results on ImageNet. To the best of our knowledge, this paper is the first to (1) quantize the gradients to 6-bit floating-point formats, or (2) achieve up to 85% gradient sparsity -- in each case without accuracy degradation. Reference implementation accompanies the paper.

研究の動機と目的

  • トレーニング中のニューラル勾配のバックプロパゲーションに伴う計算およびメモリのオーバーヘッドを軽減すること。
  • 従来の量子化およびプルーニング手法がガウス分布やラプラス分布を仮定しているが、勾配の重い尾部の性質により失敗するという限界を克服すること。
  • ニューラル勾配の大きさが対数正規分布に従うという経験的観察に基づき、理論的裏付けのある閉形式の勾配量子化およびプルーニング手法を開発すること。
  • ImageNetにおいて、精度の低下なしに、量子化およびスパーストレーニングの両面で最先端のパフォーマンスを達成すること。

提案手法

  • 著者たちは、統計的検定を通じて勾配の大きさの分布を対数正規分布としてモデル化し、ガウス分布やラプラス分布よりも適合度が高いことを示した。
  • 低精度浮動小数点形式(例:FP6、FP7)における指数部と仮数部の最適なビット割り当てを、量子化ノイズを最小化する閉形式式として導出した。
  • 対数正規分布のパrameterに基づいて、確率的勾配プルーニングの正確なしきい値を計算する手法を提案し、スパースネスレベルを精密に制御可能にした。
  • 異なる層に異なるスパースネスレベルを割り当てる「非一様スパースネス」を導入し、コサイン類似度とモデル精度を保持するように最適化した。
  • 極端値の影響を考慮して、勾配間のコサイン類似度を解析的に計算するため、切断された対数正規分布モデルを提案した。
  • ResNet18を用いてImageNetおよびCIFAR-10で実験し、ベースラインおよび損失スケーリングやトップ-kプルーニングなどのヒューリスティック手法と比較した。

実験結果

リサーチクエスチョン

  • RQ1バックプロパゲーション中のニューラル勾配の大きさを最もよく説明する統計的分布は何か?
  • RQ2勾配の分布に基づいて、低精度浮動小数点表現の最適化を閉形式で導出できるか?
  • RQ3勾配のスパースネスを、勾配分布から導出された理論的しきい値を用いて高精度に設定できるか?
  • RQ4各層ごとに異なるスパースネスレベルを適用する「非一様スパースネス」と、一様スパースネスを比較した場合、精度およびコサイン類似度においてどのような差が生じるか?
  • RQ5提案手法は、精度の低下なしに、量子化およびスパーストレーニングの両面で最先端のパフォーマンスを達成できるか?

主な発見

  • ニューラル勾配の大きさは、適合度検定の強い統計的証拠に基づき、対数正規分布で最もよくモデル化できる。
  • 著者たちは、ImageNetにおいて精度の低下なしに6ビット浮動小数点量子化を実現し、これは新たな最先端の結果である。
  • 解析的に導出されたプルーニングしきい値を用いて、精度の低下なしに最大85%の勾配スパースネスを実現した。これは、新たな最先端の結果である。
  • 各層の対数正規パラメータに基づいてスパースネスレベルを最適化する「非一様スパースネス」は、全体で92%のスパースネスにおいて1%未満の精度低下で、均一スパースネスを上回る性能を示した。
  • コサイン類似度の観点からも、本手法による解析的プルーニングは、トップ-k+確率的プルーニングよりも類似度のばらつきが小さく、より良好な保持を示した。
  • 本手法は損失スケーリングの理論的基盤を提供し、ヒューリスティックなチューニングに代わる、対数正規パラメータに基づく解析的に導出されたスケーリング係数を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。