Skip to main content
QUICK REVIEW

[論文レビュー] Dynamically Hierarchy Revolution: DirNet for Compressing Recurrent Neural Network on Mobile Devices

Jie Zhang, Xiaolong Wang|ArXiv.org|Jun 4, 2018
Speech Recognition and Synthesis参考文献 2被引用数 5
ひとこと要約

DirNet は、階層的な層間でスパarsity と辞書学習を共同最適化することで、最小限の精度損失で高圧縮率を実現する再帰的ニューラルネットワーク向けの動的モデル圧縮フレームワークである。各層ごとにスパarsity を動的に調整し、辞書の原子を動的にマイニングすることで、モバイルデバイス上で 8 倍のモデル圧縮を達成し、リアルタイム推論を実現するとともに、ASR および言語モデリングタスクにおける WER の低下をほとんど認めない。

ABSTRACT

Recurrent neural networks (RNNs) achieve cutting-edge performance on a variety of problems. However, due to their high computational and memory demands, deploying RNNs on resource constrained mobile devices is a challenging task. To guarantee minimum accuracy loss with higher compression rate and driven by the mobile resource requirement, we introduce a novel model compression approach DirNet based on an optimized fast dictionary learning algorithm, which 1) dynamically mines the dictionary atoms of the projection dictionary matrix within layer to adjust the compression rate 2) adaptively changes the sparsity of sparse codes cross the hierarchical layers. Experimental results on language model and an ASR model trained with a 1000h speech dataset demonstrate that our method significantly outperforms prior approaches. Evaluated on off-the-shelf mobile devices, we are able to reduce the size of original model by eight times with real-time model inference and negligible accuracy loss.

研究の動機と目的

  • 大規模な RNN を、計算およびメモリ要件の高いリソース制限のあるモバイルデバイスにデプロイする課題に対処すること。
  • 異なる層レベルの冗長性に動的に適応できず、固定圧縮レートに依存する既存の圧縮手法の限界を克服すること。
  • 層間および再帰的重み行列の圧縮を共同最適化することで、高圧縮率かつ最小限の精度損失を実現すること。
  • RNN の構造的および機能的差異に基づいて、階層的層ごとにスパarsity を適応的に調整する手法を開発すること。
  • オフザシェルのモバイルハードウェア上でモデル性能を維持したままリアルタイム推論を実現すること。

提案手法

  • DirNet は、各層内のプロジェクション辞書行列から動的に辞書の原子をマイニングする高速な辞書学習アルゴリズムを採用し、層固有の圧縮率制御を可能にしている。
  • 共有プロジェクション辞書を用いて、再帰的および層間の重み行列を同時に圧縮することで、ネットワーク全体における表現の一貫性を維持している。
  • 各隠れ層の関数的役割と冗長性に基づいて、スパースコードのスパarsity レベルを適応的に設定し、性能低下を最小限に抑える。
  • パrameterized スパarsity 制御 (Θ⁰) と収縮係数 (γ) を用いた動的収縮メカニズムにより、圧縮レートを調整し、収束性と圧縮品質を最適化している。
  • モデル精度を保持しながら、辞書とスパースコードを段階的に精錬する階層的最適化戦略を採用している。
  • 層間で共有コードブック表現を統合することで、圧縮中のパラメータ効率性と一般化性能を向上させている。

実験結果

リサーチクエスチョン

  • RQ1辞書学習による動的で層固有の圧縮は、RNN において静的または均一な方法よりも高い圧縮率を達成できるか?
  • RQ2階層的層間で適応的スパarsity 制御を適用した場合、圧縮された RNN のモデル精度と推論速度にどのような影響を与えるか?
  • RQ3DirNet は、モバイルデバイス上で最大 8 倍のモデルサイズ削減を実現しながら、元の性能にほぼ近い水準を維持できるか?
  • RQ4動的辞書原子マイニングと適応的スパarsity の組み合わせは、SVD やプルーニングベースの圧縮と比較して、スピードアップと精度の点でどの程度優れているか?
  • RQ5圧縮効率とモデル性能のトレードオフを最適化するパラメータ設定 (Θ⁰ と γ) は何か?

主な発見

  • DirNet は、LibriSpeech で 4.3× 圧縮、129万パラメータ、12.9% WER を達成し、元の 1030万パラメータモデルの 12.7% WER と同等の精度を維持した。一方、SVD および ODL 手法は同程度の圧縮レベルで 3.4–3.9% の WER 悪化を示した。
  • 7.9× 圧縮レベルでも、DirNet は 12.9% WER を維持したが、LSTM-SVD と LSTM-ODL はそれぞれ 16.1% および 14.3% WER に悪化した。これは、精度保持の優位性を示している。
  • 同じ圧縮レベル下で、DirNet はモバイル CPU で 4.2× の高速化を達成したのに対し、LSTM-SVD と LSTM-ODL はそれぞれ 1.4× および 2.6× の高速化にとどまった。
  • 収束速度と圧縮品質の両立を最適化するための最適な初期スパarsity パラメータ Θ⁰ = 10⁷ と収縮係数 γ = 0.4 が得られた。Θ⁰ が低い値では性能が急激に低下した。
  • 適応的階層圧縮により、Neuron 数が同一でも LSTM-SVD よりも低い WER を維持できた。これは、層固有のスパarsity 調整の有効性を裏付けている。
  • DirNet は、8 倍のモデル圧縮とほとんど無視できる精度損失を実現し、オフザシェルのモバイルデバイス上でリアルタイム推論を可能にした。実用的デプロイの可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。