Skip to main content
QUICK REVIEW

[論文レビュー] Learning Compact Recurrent Neural Networks

Zhiyun Lu, Vikas Sindhwani|arXiv (Cornell University)|Apr 9, 2016
Speech Recognition and Synthesis参考文献 9被引用数 21
ひとこと要約

本稿では、下位層に Toeplitz に類似した構造的行列を、上位層に共有された低ランク要因を用いることで、再帰的ニューラルネットワーク(RNN)およびLSTMのハイブリッド圧縮戦略を提案する。この手法により、LSTMのパラメータを75%削減しつつ、語彙誤り率(WER)を0.3%しか増加させない。これは、セル状態の保持が性能に極めて重要であることを示しており、再帰的および非再帰的重みは同程度に圧縮可能であることを示している。

ABSTRACT

Recurrent neural networks (RNNs), including long short-term memory (LSTM) RNNs, have produced state-of-the-art results on a variety of speech recognition tasks. However, these models are often too large in size for deployment on mobile devices with memory and latency constraints. In this work, we study mechanisms for learning compact RNNs and LSTMs via low-rank factorizations and parameter sharing schemes. Our goal is to investigate redundancies in recurrent architectures where compression can be admitted without losing performance. A hybrid strategy of using structured matrices in the bottom layers and shared low-rank factors on the top layers is found to be particularly effective, reducing the parameters of a standard LSTM by 75%, at a small cost of 0.3% increase in WER, on a 2,000-hr English Voice Search task.

研究の動機と目的

  • 再帰的アーキテクチャにおける冗長性を調査し、性能の損失なしに効率的なモデル圧縮を可能にする。
  • RNNおよびLSTMにおけるさまざまな圧縮技術—低ランク因子分解、ハッシュを用いたパラメータ共有、構造的行列—を評価する。
  • 深層LSTMアーキテクチャにおける層、ゲート、重みタイプごとの最適な圧縮戦略を特定する。
  • 音声認識タスクにおいて、パラメータ削減と認識精度のバランスを取るハイブリッド圧縮フレームワークを開発する。

提案手法

  • 再帰的重み(U)と非再帰的重み(W)の下位層の重みを、低位移ランクを持つToeplitzに類似した構造的行列を用いて圧縮し、畳み込みに類似した計算を可能にする。
  • 上位層で共有された低ランク因子分解を用い、ランクを低く抑えた射影行列によりパラメータを削減する。
  • 初期層に構造的行列、深層層に共有された低ランク射影を組み合わせたハイブリッドアーキテクチャを実装する。
  • 再帰的重み(U)、非再帰的重み(W)、および個々のゲート(入力、忘却、出力、セル状態)の各コンponentに対して圧縮を評価する。
  • 2,000時間分の英語音声検索タスクでモデルを学習し、WERを測定することで性能のトレードオフを評価する。
  • 完全なモデルからのソフトラベルを用いて、小規模な圧縮モデルにおける知識蒸留を誘導する。

実験結果

リサーチクエスチョン

  • RQ1LSTMアーキテクチャのどの部分に、効果的な圧縮に適した冗長性が最も多く存在するか?
  • RQ2低ランク因子分解、ハッシュベースのパラメータ共有、構造的行列といった異なる圧縮技術は、性能と効率の面でどのように比較できるか?
  • RQ3再帰的重み(U)を圧縮するか、非再帰的重み(W)を圧縮するかで、性能に差が出るか?
  • RQ4どのゲート(入力、忘却、出力、セル状態)が圧縮に対して最も感受性が強く、圧縮の優先順位をどのように設定すべきか?
  • RQ5構造的行列と共有された低ランク射影を組み合わせたハイブリッド圧縮戦略は、顕著なパラメータ削減と最小限の精度損失を実現できるか?

主な発見

  • 下位層にToeplitzに類似した構造的行列を用いることで、ハッシュ法や低ランク因子分解よりも、より激しいパラメータ削減が可能である。
  • 上位層における共有された低ランク要因は、ネットワーク全体のパラメータ圧縮に非常に効果的である。
  • 下位層にToeplitzに類似した行列、上位層に共有された低ランク射影を組み合わせたハイブリッド戦略により、パラメータを75%削減しつつ、WERは0.3%しか増加しない。
  • 再帰的重みまたは非再帰的重みを圧縮しても性能に顕著な差はなく、圧縮可能性に大きな差がないことが示された。
  • セル状態は最も重要な保持対象であり、その圧縮は0.4%のWER増加を引き起こすが、他のゲートの圧縮はわずかだが測定可能な影響を示す。
  • 入力、忘却、出力ゲートを同時に圧縮すると、WERは0.5%増加し、パラメータは0.14m削減されるが、これは選択的圧縮を超えて収益が減少することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。