Skip to main content
QUICK REVIEW

[論文レビュー] Neural Networks with Few Multiplications

Zhouhan Lin, Matthieu Courbariaux|arXiv (Cornell University)|Oct 11, 2015
Advanced Neural Network Applications参考文献 15被引用数 155
ひとこと要約

この論文では、誤反転伝搬中に重みを確率的に二値化し、活性化を量子化することにより、深層ニューラルネットワークの学習中に浮動小数点乗算を大幅に削減する手法を提案する。このアプローチにより、大部分の乗算がビットシフトと符号反転に置き換えられ、わずかな精度損失で高速な学習が可能になる。驚くべきことに、MNIST、CIFAR10、SVHNにおいて一般化性能が向上する場合すらある。

ABSTRACT

For most deep learning algorithms training is notoriously time consuming. Since most of the computation in training neural networks is typically spent on floating point multiplications, we investigate an approach to training that eliminates the need for most of these. Our method consists of two parts: First we stochastically binarize weights to convert multiplications involved in computing hidden states to sign changes. Second, while back-propagating error derivatives, in addition to binarizing the weights, we quantize the representations at each layer to convert the remaining multiplications into binary shifts. Experimental results across 3 popular datasets (MNIST, CIFAR10, SVHN) show that this approach not only does not hurt classification performance but can result in even better performance than standard stochastic gradient descent training, paving the way to fast, hardware-friendly training of neural networks.

研究の動機と目的

  • 深層学習の学習における高い計算コスト、主に浮動小数点乗算に起因する問題に対処すること。
  • 前向き伝搬および逆伝搬の両方で乗算の大部分を排除することで、学習時間とメモリ使用量を削減すること。
  • 低精度計算であってもモデルの精度を維持または向上させる、ハードウェアにやさしい学習手法を開発すること。
  • 確率的重み二値化と量子化された誤反転伝搬が一般化性能に与える正則化効果を調査すること。

提案手法

  • 前向き伝搬中に、微分可能サンプリング機構を用いて、フル精度重みを±1値に確率的に二値化する。
  • バイナリ接続またはトレナリ接続を適用し、行列乗算を符号反転とビットシフトに変換する。
  • 誤反転伝搬中に活性化および誤差勾配を量子化し、残りの乗算をビットシフトに変換する。
  • 量子化値の動的範囲を制限するビットクリッピング機構を導入し、メモリと計算負荷を低減する。
  • 最適化のためのフル精度リファレンス重みを維持し、量子化された勾配を用いて通常の誤反転伝搬で更新する。
  • 左右に非対称なビットシフトを許容する柔軟な量子化スキームを導入し、表現効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1重みの二値化と活性化の量子化により、浮動小数点乗算を最小限に抑えた状態で、深層ニューラルネットワークを効果的に学習できるか?
  • RQ2提案された量子化および二値化アプローチは、標準的なSGDと比較して、モデルの一般化性能を維持または向上させるか?
  • RQ3量子化された誤反転伝搬におけるビット数の変更が、モデル性能にどの程度影響を及えるか?
  • RQ4確率的重み二値化は最適化ダイナミクスおよび一般化性能にどのような影響を及えるか?
  • RQ5この手法は、専用ハードウェアで効率的に実装可能か? これにより、深層ネットワークの高速学習が可能になるか?

主な発見

  • 提案手法は、前向き伝搬および逆伝搬の両方で、浮動小数点乗算の大部分をビットシフトと符号反転に置き換えている。
  • MNIST、CIFAR10、SVHNにおいて、この手法は標準的なSGDと同等またはそれ以上のテスト誤差率を達成しており、トレナリ接続と量子化された誤反転伝搬が最良のパフォーマンスを示している。
  • 量子化のビット幅設定に関わらず、モデルの精度が安定しており、わずか2ビットのシフト精度でも性能劣化が最小限に抑えられている。
  • 確率的重みサンプリングによる正則化効果があり、最適化がより広い最小値に到達しやすく、一般化性能が向上している。
  • トレナリ重みを用いた量子化された誤反転伝搬は、標準的なバイナリ接続やフル精度学習と比較して、最終的なテスト精度で一貫して優れている。
  • 層間の活性化の分布は非対称であるため、左右のビットシフトの最大値を別々に設定することが正当化されており、性能を損なわず効率性が向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。