Skip to main content
QUICK REVIEW

[論文レビュー] Improved Bayesian Compression

Marco Federici, Karen Ullrich|arXiv (Cornell University)|Nov 17, 2017
Anomaly Detection Techniques and Applications参考文献 3被引用数 12
ひとこと要約

本稿では、構造的スパarsityをもたらす変分ドロップアウトと、量子化を可能にするソフトウェイトシェアリングを統合した共同ベイジアン圧縮手法を提案する。重みとその平均の階層的事前分布を用いて重み中心とスパarsityを共同最適化することで、LeNet5で最大482倍の圧縮比を達成し、精度の低下を最小限に抑える。これは、最先端の圧縮比を達成する。

ABSTRACT

Compression of Neural Networks (NN) has become a highly studied topic in recent years. The main reason for this is the demand for industrial scale usage of NNs such as deploying them on mobile devices, storing them efficiently, transmitting them via band-limited channels and most importantly doing inference at scale. In this work, we propose to join the Soft-Weight Sharing and Variational Dropout approaches that show strong results to define a new state-of-the-art in terms of model compression.

研究の動機と目的

  • 従来のベイジアン圧縮手法には、重みをプルーニングする(変分ドロップアウト)か、量子化する(ソフトウェイトシェアリング)かのいずれかの手法に限られるが、両方を同時に実行できないという限界がある。
  • 重みとその中心の階層的事前分布を用いて、スパarsityと効率的な量子化を共同で誘導することで、モデル圧縮を向上させる。
  • 統一された変分推論フレームワーク内に、補い合う2つの圧縮メカニズムを統合することで、精度を損なわず、より高い圧縮比を達成する。
  • プルーニング、クラスタリング、エントロピー符号化を統合したポストトレーニングパイプラインにより、リソース制約のあるデバイスへの実用的導入を可能にする。

提案手法

  • 重み $\mathbf{w}$ とその中心 $\mathbf{m}$ の事後分布を、因子化された変分事後分布 $q_{\boldsymbol{\phi}}(\mathbf{w}, \mathbf{m}) = \prod_i q_{\sigma_i}(w_i|m_i) q_{\theta_i}(m_i)$ でモデル化する。ここで $w_i$ は中心 $m_i$ の周囲にガウス分布に従い、$m_i$ はデルタピークである。
  • 重みのスパarsityを誘導するために、重みの重み付きの重い尾を持つ対数一様事前分布 $p(w_i) \propto 1/|w_i|$ を使用し、中心の周囲にガウス・ミックス・モデル(GMM)事前分布 $p_\psi(m_i)$ を用いてクラスタリングと量子化を可能にする。
  • 変分下界 $\mathcal{L}(\boldsymbol{\phi}, \boldsymbol{\psi}) = L_\mathcal{D}(\boldsymbol{\phi}) - D_{KL}(q_{\boldsymbol{\phi}}||p_{\boldsymbol{\psi}})$ を定式化し、KLダイバージェンスを重み固有と中心固有の成分に分解する。
  • Molchanovら(2017)の手法を応用して、ガウス事後分布と重い尾を持つ事前分布のKLダイバージェンスを近似し、学習の安定性を確保する。
  • ポストトレーニング圧縮パイプラインを適用する:(1) 学習済みGMMを用いて重み中心をクラスタリングし、(2) 0の行・列をプルーニングし、(3) 圧縮されたスパース行(CSR)形式で符号化し、(4) 非ゼロ重みにハフマン符号化を適用する。
  • スパarsityを強制し、効率的なプルーニングと符号化を可能にするために、1つのGMM成分をゼロに固定する。

実験結果

リサーチクエスチョン

  • RQ1変分ドロップアウトとソフトウェイトシェアリングを1つのベイジアンフレームワーク内で統合することで、単独で用いる場合よりも優れた圧縮比が得られるか?
  • RQ2階層的事前分布を用いて重み中心とスパarsityを共同最適化することで、精度を損なわず、モデル圧縮が向上するか?
  • RQ3提案手法は、標準的なビジョンベンチマークで高い圧縮比を達成しながら、モデル性能を保持できるか?
  • RQ4GMMベースのクラスタリングとハフマン符号化の統合は、ポストトレーニング圧縮パイプラインにおける最終的な圧縮効率にどのように寄与するか?

主な発見

  • 提案手法は、LeNet5で元のモデルと比較してテスト精度が0.05%低下するのみで、482倍の圧縮比を達成した。
  • LeNet300-100では、161倍の圧縮比を達成し、98.24%のテスト精度を示した。これは、変分ドロップアウト(131倍)とソフトウェイトシェアリング(34倍)を上回る性能である。
  • 非ゼロ重みを全重みのわずか0.5%にまで削減しながらも、99.14%の高い精度を維持しており、強力なスパarsity誘導効果を示している。
  • GMMベースのクラスタリングとハフマン符号化の統合により、非ゼロ重み1つあたりの平均ビット幅が $k \leq \log K + 1$ にまで低下し、ストレージ効率が著しく向上した。
  • 密接接続層と畳み込み層の両方のアーキテクチャにおいて、L2、SWS、VDのベースライン手法を上回る圧縮比を達成し、新たな最先端性能を確立した。
  • ポストトレーニングパイプラインは、学習中に得られた事後分布構造に従ってクラスタリングとプルーニングが行われるため、モデル性能の保持が効果的に実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。