Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Layer-Wise Precision in Deep Neural Networks

Griffin Lacey, Graham W. Taylor|arXiv (Cornell University)|Jul 3, 2018
Adversarial Robustness in Machine Learning参考文献 1被引用数 3
ひとこと要約

本論文では、トレーニング中にGumbel-Softmaxサンプリングを用いて各層が動的に異なるビット幅を探索する確率的でレイヤー単位の精度割り当て手法を提案する。固定予算下で最適な精度構成を学習し、MNISTおよびILSVRC12において一般化性能を向上させ、均一な精度ベースラインを上回る。MNISTでは最大1.41%の誤差低減、ILSVRC12では2.22%の誤差低減を達成した。

ABSTRACT

Low precision weights, activations, and gradients have been proposed as a way to improve the computational efficiency and memory footprint of deep neural networks. Recently, low precision networks have even shown to be more robust to adversarial attacks. However, typical implementations of low precision DNNs use uniform precision across all layers of the network. In this work, we explore whether a heterogeneous allocation of precision across a network leads to improved performance, and introduce a learning scheme where a DNN stochastically explores multiple precision configurations through learning. This permits a network to learn an optimal precision configuration. We show on convolutional neural networks trained on MNIST and ILSVRC12 that even though these nets learn a uniform or near-uniform allocation strategy respectively, stochastic precision leads to a favourable regularization effect improving generalization.

研究の動機と目的

  • 層間での非均一な精度割り当てが、均一な精度割り当てと比較して深層ニューラルネットワークの性能を向上させるかを調査すること。
  • 固定総ビット予算下で、各レイヤーごとの最適な精度構成を学習する微分可能で確率的なメカニズムを開発すること。
  • 確率的精度探索が正則化として機能し、ハードウェア加速の予測可能性を損なわず一般化性能を向上させるかを評価すること。
  • Gumbel-Softmaxサンプリングによる精度学習が、固定で均一な精度設定よりも高い精度を達成することを示すこと。

提案手法

  • 本手法は、離散的な精度選択の最適化を可能にするGumbel-Softmaxリラクゼーションを用い、トレーニング中に各レイヤーごとに異なる精度構成(ビット幅)をサンプリングする。
  • 各レイヤーの精度は、可能なビット幅のカテゴリカル分布としてモデル化され、ネットワークによって学習可能なロジットでパrameter化される。
  • 総精度予算が制約され、ハードウェア加速の予測可能性を保ちつつ、効率的なデプロイメントを可能にする。
  • 再パrameter化による勾配推定により、精度が離散的であるにもかかわらず、バックプロパゲーションが精度選択を通り抜けても可能になる。
  • 標準的なバックプロパゲーションを用いてエンドツーエンドでモデルを訓練し、各フォワードパスで確率的なビット幅割り当てが行われる。
  • 推論時には、学習済みのGumbel-Softmax分布から最も確率の高い精度構成を硬い割り当てとして採用する。

実験結果

リサーチクエスチョン

  • RQ1層間で非均一な精度割り当てを学習することで、均一な精度割り当てと比較して深層ニューラルネットワークの性能が向上するか?
  • RQ2精度構成の確率的探索が正則化として機能し、一般化性能を向上させるか?
  • RQ3同じ総ビット予算下で、画像分類タスクにおける学習済み精度割り当てと均一割り当ての性能はどのように比較されるか?
  • RQ4モデルは、例えば初期レイヤーに少ないビット数、深層レイヤーに多いビット数を割り当てるなど、意味のある精度分布を学習するか?
  • RQ5この手法は、モデル精度を向上させながらも、ハードウェア加速の決定論的を維持できるか?

主な発見

  • MNISTでは、10ビット予算下で学習済み精度モデルが2.32%のテスト誤差を達成し、均一ベースラインの3.73%を上回った。
  • MNISTの40ビット予算下では、学習済みモデルが1.14%の誤差を達成したのに対し、均一ベースラインは1.18%であった。
  • ILSVRC12では、14ビット予算下で学習済み精度モデルがトップ1誤差を49.68%(均一)から48.54%に低減した。
  • ILSVRC12モデルは非均一な割り当てを学習し、後段のレイヤーに9ビット、初期レイヤーに3〜4ビットを割り当てており、アーキテクチャへの認識を示した。
  • すべての予算下で、学習済み精度構成は一貫して速く収束し、より低いテスト誤差を達成しており、正則化の恩恵が示された。
  • 同じビット予算でより高い精度を達成したため、精度割り当てがチューナブルで学習可能なハイパーパrameterであり、モデルの効率性と性能を向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。