Skip to main content
QUICK REVIEW

[論文レビュー] Accurate Neural Training with 4-bit Matrix Multiplications at Standard Formats

Brian Chmiel, Ron Banner|arXiv (Cornell University)|Dec 19, 2021
Advanced Neural Network Applications被引用数 6
ひとこと要約

本稿では、標準的な浮動小数点形式を用いた4ビット学習のための、対数的非バイアス量子化(LUQ)を提案する。LUQは、最小の表現可能値またはゼロへの確率的丸めを用いて、勾配の非バイアス量子化を実現し、ハードウェアに依存しない形式や顕著なオーバーヘッドなしに、4ビット学習における最先端の精度を達成する。ImageNetにおけるResNet50のトップ1誤差は1.1%、微調整後は0.32%にまで低下する。

ABSTRACT

Quantization of the weights and activations is one of the main methods to reduce the computational footprint of Deep Neural Networks (DNNs) training. Current methods enable 4-bit quantization of the forward phase. However, this constitutes only a third of the training process. Reducing the computational footprint of the entire training process requires the quantization of the neural gradients, i.e., the loss gradients with respect to the outputs of intermediate neural layers. Previous works separately showed that accurate 4-bit quantization of the neural gradients needs to (1) be unbiased and (2) have a log scale. However, no previous work aimed to combine both ideas, as we do in this work. Specifically, we examine the importance of having unbiased quantization in quantized neural network training, where to maintain it, and how to combine it with logarithmic quantization. Based on this, we suggest a $ extit{logarithmic unbiased quantization}$ (LUQ) method to quantize both the forward and backward phases to 4-bit, achieving state-of-the-art results in 4-bit training without the overhead. For example, in ResNet50 on ImageNet, we achieved a degradation of 1.1%. We further improve this to a degradation of only 0.32% after three epochs of high precision fine-tuning, combined with a variance reduction method -- where both these methods add overhead comparable to previously suggested methods.

研究の動機と目的

  • 前方伝播および逆伝播の両方を標準的な数値形式を用いて量子化することにより、深層ニューラルネットワークの完全な4ビット学習を可能にすること。
  • 特に誤差逆伝播における勾配バイアスという重要な問題に取り組むこと。
  • ハードウェアの移植性を損なう非標準的または特許形式(例:基数4浮動小数点)に依存しないようにすること。
  • 学習中の計算およびメモリのオーバーヘッドを低減しつつ、高いモデル精度を維持すること。
  • 逆伝播では非バイアス量子化が不可欠であるのに対し、前方伝播ではバイアスがそれほど深刻ではないという点を示すこと。

提案手法

  • 標準的なFP4形式([1符号ビット、3指数ビット、0仮数ビット])を用いて、ニューラル勾配の4ビット量子化のための対数的非バイアス量子化(LUQ)を提案する。
  • 最小表現可能値α未満の勾配に対して確率的量子化を適用し、ゼロまたはαにマッピングすることで、非バイアス勾配推定を維持する。
  • 訓練中にαを動的に調整し、最大勾配値が常に表現可能であることを保証する。
  • 表現可能な範囲内で確率的丸めを適用し、勾配推定におけるバイアスを完全に排除する。
  • 既存のINT4量子化(例:SAWB)を重畳して、完全な4ビットGEMM計算を可能にする。
  • 2つの補完的アプローチを導入:確率的勾配の再サンプリングによる分散低減(SMP)、および収束性向上のための高精度微調整(FNT)

実験結果

リサーチクエスチョン

  • RQ1なぜ非バイアス勾配量子化が4ビット学習において重要であり、前方伝播の量子化とはどのように異なるのか?
  • RQ2非標準形式(例:基数2 FP4)を用いても、4ビット逆伝播に効果的に適用可能であり、精度を損なわないのか?
  • RQ3低精度学習における勾配バイアスとモデル精度の観点から、確率的丸めと四捨五入の違いは何か?
  • RQ4確率的勾配量子化における分散の影響は何か? また、非バイアス性を損なわずに分散を低減する方法は?
  • RQ5高精度微調整は、4ビット学習中に失われた精度を効果的に回復できるのか? また、従来手法に比べて計算コストはどの程度か?

主な発見

  • LUQは、完全な4ビット学習を用いて、ResNet50でImageNetにおいて1.1%のトップ1誤差を達成し、非標準形式を用いた先行SOTA手法を上回る。
  • 3エポックの高精度微調整(FNT)を経て、誤差はわずか0.32%にまで低下し、優れた回復能力を示した。
  • 2サンプルを用いた分散低減手法(SMP)は、[23]で提案された2段階丸め手法と同等の計算オーバーヘッドを実現した。
  • LUQを用いた4ビット学習のスループットは、FP16学習の約8倍高速であり、顕著な効率向上を示した。
  • 専用の指数のみおよび仮数のみのオペランド処理により、LUQは乗算を不要とする逆伝播を可能にし、GEMMハードウェア面積を5倍削減した。
  • 従来、低ビット学習で最もコストが高かったFP32累算器の幅を縮小可能であり、さらなる最適化の可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。