Skip to main content
QUICK REVIEW

[論文レビュー] Slim Embedding Layers for Recurrent Neural Language Models

Zhongliang Li, Raymond Kulhanek|arXiv (Cornell University)|Nov 27, 2017
Topic Modeling参考文献 15被引用数 18
ひとこと要約

本論文では、構造的サブベクトルをランダムに共有することによって、再帰的ニューラル言語モデルの入力および出力埋め込み層を圧縮するシンプルでトレーニング可能なパラメータ共有手法を提案する。モデルサイズを最大90%まで削減しながら、類似のパープレキシティおよびBLEUスコアを維持する。この手法により、顕著な性能低下を伴わずにコンactかつ効率的なモデルが実現可能となる。

ABSTRACT

Recurrent neural language models are the state-of-the-art models for language modeling. When the vocabulary size is large, the space taken to store the model parameters becomes the bottleneck for the use of recurrent neural language models. In this paper, we introduce a simple space compression method that randomly shares the structured parameters at both the input and output embedding layers of the recurrent neural language models to significantly reduce the size of model parameters, but still compactly represent the original input and output embedding layers. The method is easy to implement and tune. Experiments on several data sets show that the new method can get similar perplexity and BLEU score results while only using a very tiny fraction of parameters.

研究の動機と目的

  • 再帰的ニューラル言語モデルにおける大規模語彙サイズに起因する高いメモリコストを軽減すること。
  • パフォーマンスを損なわせることなく、入力および出力埋め込み層のモデルパラメータサイズを削減すること。
  • 実装およびチューニングが容易なシンプルでトレーニング可能な圧縮技術を開発すること。
  • 埋め込み層におけるランダムなパラメータ共有が正則化として機能し、一般化性能を向上させるかどうかを検証すること。
  • メモリ制限のあるデバイスおよび分散システムへのコンパクト言語モデルのデプロイを可能にすること。

提案手法

  • 入力および出力埋め込み層の両方において、単語に対してサブベクトルをランダムかつ固定で割り当てる。
  • 各単語の埋め込みは、複数の共有サブベクトルを連結することで構成され、学習可能なパラメータ総数が削減される。
  • サブベクトルの割り当てはランダムに初期化され、トレーニング中は固定されるが、サブベクトルの重みはエンドツーエンドで学習される。
  • アプローチは入力および出力埋め込み層に独立して適用され、顕著な圧縮が可能になる。
  • 推論時に効率的にドット積を計算するために動的計画法を活用する。
  • 従来の学習目的と互換性があり、ノイズ対比推定(NCE)を用いた学習にも適用可能である。

実験結果

リサーチクエスチョン

  • RQ1埋め込み層におけるランダムで構造的なパラメータ共有は、パフォーマンスの著しい劣化を伴わず、モデルサイズを顕著に削減できるか?
  • RQ2提案手法は、フルサイズモデルと比較して、競争力のあるパープレキシティおよびBLEUスコアを維持できるか?
  • RQ3この圧縮手法は、リソースが限られた状況や過学習が生じやすい状況において、正則化として機能し一般化性能を向上させるか?
  • RQ4CPUおよびGPUワークロード下での、圧縮モデルの計算効率は、ベースラインおよびHashNetと比較してどの程度か?
  • RQ5機械翻訳の再ランク付けといった実世界のタスクに、この手法は効果的に応用可能か?

主な発見

  • 提案手法により、Penn Treebankデータセットで、フルサイズモデルと比較してパープレキシティが1〜2ポイント以内に保たれた。モデルパラメータは最大90%まで削減された。
  • WMT12翻訳タスクでは、圧縮モデルがBLEUスコア26.25を達成し、フルモデルの26.11とわずかに低く、優れた汎用性を示した。
  • SEモデルはCPUで0.7秒、GPUで25ミリ秒の推論時間を達成し、HashNet(CPUで80.6秒)を大きく上回り、非圧縮モデル(CPUで2.7秒)に近い性能を示した。
  • 推論時におけるメモリ使用量が著しく低減されたため、メモリ制限のあるデバイスへのデプロイが可能になった。
  • 一部の設定において一般化性能が向上したため、この手法が正則化の一種として機能している可能性が示唆された。
  • 入力および出力層をそれぞれ元のサイズの1/8および1/4に圧縮しても、パフォーマンスの低下が最小限に抑えられ、有効な圧縮が可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。