Skip to main content
QUICK REVIEW

[論文レビュー] Training Sparse Neural Networks

Suraj Srinivas, Akshayvarun Subramanya|arXiv (Cornell University)|Nov 21, 2016
Sparse and Compressive Sensing Techniques参考文献 19被引用数 11
ひとこと要約

この論文は、バイナリゲート変数を学習することで、パラメータを動的にプルーニングする微分可能ゲーティング機構を提案している。ゲート変数に二峰性正則化を適用し、0.5でしきい値処理することで、最小限の精度低下で最先端の圧縮を達成した。AlexNetではパラメータを最大10.3倍まで圧縮しながらも、トップ1精度69.04%を維持した。

ABSTRACT

Deep neural networks with lots of parameters are typically used for large-scale computer vision tasks such as image classification. This is a result of using dense matrix multiplications and convolutions. However, sparse computations are known to be much more efficient. In this work, we train and build neural networks which implicitly use sparse computations. We introduce additional gate variables to perform parameter selection and show that this is equivalent to using a spike-and-slab prior. We experimentally validate our method on both small and large networks and achieve state-of-the-art compression results for sparse neural network models.

研究の動機と目的

  • 訓練中に深層ニューラルネットワークに構造的スパarsityを誘導する手法を開発すること。パラメータ数を削減しながら性能を損なわないこと。
  • 従来のL1/L2正則化が非凸な深層学習問題において意味のあるスパarsityを誘導できないという課題に対処すること。
  • 微分可能なゲート機構を通じて重みとプルーニング意思決定を同時に学習することで、スパースネットワークのエンドツーエンド訓練を可能にすること。
  • LeNet-5、AlexNet、VGG-16などの標準的なビジョンベンチマークで最先端のモデル圧縮比を達成すること。
  • 元の重みの大きさに基づいてゲート変数を事前初期化することで、初期化に頑健で、効率的なファインチューニングを可能にすること。

提案手法

  • 微分可能で、ベルヌーイ確率として解釈できる学習可能なゲート変数Gを導入。バイナリサンプルG^sを用いて重みをマスクする。
  • ゲート変数にw×(1−w)の二峰性正則化を適用し、値が0または1に集約するよう促進することでスパarsityを促進する。
  • 推論時に決定論的になるよう、0.5でしきい値処理(最尤抽出)を適用し、実数値ゲートをバイナリマスクに変換する。
  • ゲート変数のL1またはL2正則化と二峰性正則化を組み合わせ、訓練の安定性を高め、スパarsityを強化する。
  • 共同最適化目的関数を採用:損失関数(ŷ(θ,Φ), y) + λ‖Φ‖。ここでΦはG^sから導かれるインデックス集合であり、パラメータ総数のペナルティを課す。
  • 上位k%の重みに対してg=1、それ以外に対してg=0.49として、ゲート変数を重みの大きさに基づいて事前初期化し、初期訓練段階で重要なパラメータを保持する。

実験結果

リサーチクエスチョン

  • RQ1微分可能で学習可能なゲーティング機構は、エンドツーエンド訓練中に深層ニューラルネットワークに構造的スパarsityを効果的に誘導できるか?
  • RQ2非凸な深層学習問題において、ゲート変数に二峰性正則化を適用する方法は、標準的なL1/L2ペナルティと比較して、意味のあるスパarsityを促進するか?
  • RQ3重みの大きさに基づいてゲート変数を事前初期化することで、収束速度と最終的なスパarsity-精度トレードオフにどのような影響を与えるか?
  • RQ4この手法は、AlexNet や VGG-16 といった標準的なビジョンアーキテクチャで、最先端の圧縮比を達成できるか?
  • RQ5従来のプルーニングや圧縮技術と比較して、この手法のトレーニング時間と圧縮効率はどのようにスケーリングするか?

主な発見

  • AlexNetでは、980万パラメータ(インデックスを含む)を10.3倍圧縮し、トップ1精度69.04%を達成。従来手法を上回った。
  • VGG-16では14倍の圧縮率を達成し、トップ1精度69.04%を維持。アーキテクチャを越えて優れた一般化性能を示した。
  • LeNet-5ではパラメータの96%を削減しながら精度低下は0.24%にとどまり、最先端の圧縮パフォーマンスを達成した。
  • AlexNetではファインチューニング時間を約18時間に短縮(従来の173時間から)し、単一のTitan X GPUで18時間のトレーニングで十分だった。
  • 重みの大きさに基づくゲートの事前初期化は、特に全結合層(95%のスパarsityを達成)で最終的なスパarsityと精度を顕著に向上させた。
  • 初期化に頑健であり、定数初期化と確率的初期化の両方で類似したスパarsityレベルを達成した。これは訓練の安定性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。