Skip to main content
QUICK REVIEW

[論文レビュー] Learning Discrete Weights Using the Local Reparameterization Trick

Oran Shayer, Dan Levi|arXiv (Cornell University)|Oct 21, 2017
Advanced Neural Network Applications被引用数 11
ひとこと要約

この論文は、中心極限定理を用いて前活性化分布をガウス分布として近似することで、離散的バイナリまたはトレナリ重みを用いた深層ニューラルネットワークの学習に、変更を加えたローカル再パラメータ化トリックを適用するLR-netsを提案する。この手法により、離散的重みを介した効果的なバックプロパゲーションが可能となり、MNIST、CIFAR-10、ImageNetにおいて最先端の精度を達成した。トレナリネットワークはバイナリネットワークを上回る表現能力のおかげで優れた性能を示した。

ABSTRACT

Recent breakthroughs in computer vision make use of large deep neural networks, utilizing the substantial speedup offered by GPUs. For applications running on limited hardware, however, high precision real-time processing can still be a challenge. One approach to solving this problem is training networks with binary or ternary weights, thus removing the need to calculate multiplications and significantly reducing memory size. In this work, we introduce LR-nets (Local reparameterization networks), a new method for training neural networks with discrete weights using stochastic parameters. We show how a simple modification to the local reparameterization trick, previously used to train Gaussian distributed weights, enables the training of discrete weights. Using the proposed training we test both binary and ternary models on MNIST, CIFAR-10 and ImageNet benchmarks and reach state-of-the-art results on most experiments.

研究の動機と目的

  • 低パワーやメモリ制限のあるハードウェア上で、バイナリまたはトレナリ重みを有する深層ニューラルネットワークを学習する課題に対処すること。
  • バックプロパゲーション中に離散的重みの微分不能性を克服するため、前活性化分布の滑らかな近似を用いること。
  • ストレートスラッシ推定器や確率的重みサンプリングといった従来手法と比較して、学習の安定性と性能を向上させること。
  • バイナリ重みと比較して、トレナリ重みがパフォーマンスと計算効率のバランスに優れているかどうかを評価すること。
  • 離散的前活性化の原理的で微分可能な近似が、低精度ネットワークで最先端の結果を達成できることを示すこと。

提案手法

  • 各ニューロンの前活性化を、ライアプノフの中心極限定理を用いてガウス分布としてモデル化することで、微分可能なバックプロパゲーションを可能にする。
  • 前活性化分布からのサンプリングに、変更を加えたローカル再パラメータ化トリックを適用し、離散的重みを介した勾配の流れを可能にする。
  • 確率的重みは学習された分布からサンプリングされ、再パラメータ化された前活性化上で標準的なバックプロパゲーションを用いてネットワークを学習する。
  • バイナリ重みの場合、温度パrameter付きシグモイド関数を用いて符号関数を近似する。トレナリ重みは、三値離散分布でモデル化される。
  • すべての設定で学習の安定性を高めるために、バッチ正則化、重み減衰、および学習率スケジューリングを用いる。
  • ストレートスラッシュ勾配や別個の確率的重み更新の必要を避け、代わりに前活性化の連続的で微分可能な近似に依存する。

実験結果

リサーチクエスチョン

  • RQ1離散的前活性化の滑らかで微分可能な近似は、バイナリおよびトレナリ重みネットワークの効果的な学習を可能にするか?
  • RQ2本手法の性能は、ストレートスラッシュ推定器や確率的重みサンプリングといった従来手法と比較してどうか?
  • RQ3中心極限定理を用いて前活性化分布をモデル化することで、直接的な勾配近似と比較して最適化の安定性と精度が向上するか?
  • RQ4バイナリ重みネットワークとトレナリ重みネットワークの間に顕著な性能差があるか。その理由は何か?
  • RQ5本手法は、ImageNetのような大規模ベンチマークで、離散的重みを用いて最先端の結果を達成できるか?

主な発見

  • ImageNetでは、トレナリ重みを用いた提案手法のLR-netがトップ-1誤差率36.5%を達成し、XNOR-Net(48.8%)やBinary-Weight-Network(40.1%)を上回った。
  • ImageNetのResNet-18において、トレナリLR-netはトップ-5誤差率15.2%を達成した。バイナリバージョンは17.7%、XNOR-Netは26.8%であった。
  • MNISTおよびCIFAR-10では、トレナリLR-netが完全精度の参照モデルと1〜2%の誤差率で同等の性能を示し、優れた一般化能力を示した。
  • バイナリネットワークと比較して、トレナリネットワークはより安定した学習が行われ、ハイパーパrameterチューニングの必要が少なかった。これは、より優れた最適化ダイナミクスを示している。
  • 本手法は、バイナリおよびトレナリ重みを用いて、ImageNetを含むすべての評価ベンチマークで最先端の結果を達成した。
  • カーネル可視化の結果、LR-netは完全精度のフィルタが持つ構造的パターンを保持しており、特に完全精度初期化を用いた場合に顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。