Skip to main content
QUICK REVIEW

[論文レビュー] Simultaneously Optimizing Weight and Quantizer of Ternary Neural Network using Truncated Gaussian Approximation

Zhezhi He, Deliang Fan|arXiv (Cornell University)|Oct 2, 2018
Advanced Neural Network Applications参考文献 20被引用数 8
ひとこと要約

本論文は、閉形式の切り捨て正規分布近似を用いて、ネットワーク重みと量子化器のしきい値を同時に最適化する、Ternary Neural Network (TNN) 学習の新規手法を提案する。この手法により、エンドツーエンドのバックプロパゲーションが可能となり、ResNet-50 を用いた ImageNet でトップ-1 精度が 2.16% 延長されるのみで、最先端の精度を達成している。

ABSTRACT

In the past years, Deep convolution neural network has achieved great success in many artificial intelligence applications. However, its enormous model size and massive computation cost have become the main obstacle for deployment of such powerful algorithm in the low power and resource-limited mobile systems. As the countermeasure to this problem, deep neural networks with ternarized weights (i.e. -1, 0, +1) have been widely explored to greatly reduce the model size and computational cost, with limited accuracy degradation. In this work, we propose a novel ternarized neural network training method which simultaneously optimizes both weights and quantizer during training, differentiating from prior works. Instead of fixed and uniform weight ternarization, we are the first to incorporate the thresholds of weight ternarization into a closed-form representation using the truncated Gaussian approximation, enabling simultaneous optimization of weights and quantizer through back-propagation training. With both of the first and last layer ternarized, the experiments on the ImageNet classification task show that our ternarized ResNet-18/34/50 only has 3.9/2.52/2.16% accuracy degradation in comparison to the full-precision counterparts.

研究の動機と目的

  • 固定で最適化されていない量子化器が原因で生じる低ビット量子化ニューラルネットワークにおける精度の低下と収束の遅さを解消すること。
  • Ternarization 関数の微分可能近似を用いて、ネットワーク重みと量子化しきい値の両方をエンドツーエンドで微分可能に訓練可能にする。
  • 直線的推定器における勾配の正確性を最適化することで、学習の安定性と収束速度を向上させること。
  • ImageNet などの大規模データセットにおいて、全層にわたる Ternarization を実装した Ternary Neural Network で最先端の性能を達成すること。

提案手法

  • 切り捨て正規分布近似を用いて、Ternarization しきい値の閉形式表現を導出。これにより、しきい値は微分可能となり、バックプロパゲーションによる学習が可能になる。
  • 層ごとの量子化器しきい値をネットワーク内での学習可能なパラメータとして扱い、ネットワーク重みおよびスケーリング係数と同時に最適化可能にする。
  • バックプロパゲーション中に層ごとのスケーリング係数が引き起こす勾配スケーリングの問題を是正するため、直線的推定器における勾配の正確性を最適化する手法を提案。
  • 全精度事前学習済みの ResNet アーキテクチャにこの手法を適用。学習中に最初の層と最後の層のみを Ternarize し、中間層は全精度を維持する。
  • 重みとしきい値の両方の最適化に、適応的学習率スケジューリングと SGD/Adam オプティマイザを適用。しきい値は、各層の最大絶対重量の 10% で初期化する。

実験結果

リサーチクエスチョン

  • RQ1学習中に量子化器しきい値とネットワーク重みを同時に最適化することで、Ternary Neural Network における精度が向上するか?
  • RQ2Ternarization 関数の閉形式微分可能近似は、量子化器を介して効果的なバックプロパゲーションを可能にするか?
  • RQ3直線的推定器における勾配の正確性最適化は、収束速度と最終的な精度にどのように影響するか?
  • RQ4提案手法におけるしきい値初期化の影響は、学習性能にどのように現れるか?

主な発見

  • 全層を Ternarize した状態で、ResNet-18 を用いた ImageNet において 66.01% のトップ-1 精度を達成。全精度ベースラインと比較して 3.9% の低下にとどまる。
  • ResNet-34 では 70.79% のトップ-1 精度を達成。全精度モデルと比較して 2.52% の低下。
  • ResNet-50 では 73.97% のトップ-1 精度を達成。全精度モデルと比較して 2.16% の精度低下。
  • 特に全 Ternarization 環境下で、先行する最先端手法(APPRENTICE や TTN)を大きく上回る性能を発揮。
  • 直線的推定器に勾配の正確性最適化を適用することで、学習の収束が著しく速くかつ安定する。
  • しきい値初期化の影響は最小限であり、完全に学習可能なしきい値は学習開始からすぐに適応する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。