Skip to main content
QUICK REVIEW

[論文レビュー] Densely Connected Bidirectional LSTM with Applications to Sentence Classification

Zixiang Ding, Rui Xia|arXiv (Cornell University)|Feb 3, 2018
Topic Modeling参考文献 19被引用数 6
ひとこと要約

本論文では、すべての前の層の隠れ状態を連結することで、特徴の再利用と情報の流れを向上させる、Densely Connected Bidirectional Long Short-Term Memory (DC-Bi-LSTM) という深層RNNアーキテクチャを提案する。このモデルは、標準のBi-LSTMや最先端の手法よりも、5つの文分類ベンチマークで顕著な精度向上を達成しており、パラメータ数が少ないにもかかわらず、消失勾配問題にもかかわらず20層まで正常に学習可能である。

ABSTRACT

Deep neural networks have recently been shown to achieve highly competitive performance in many computer vision tasks due to their abilities of exploring in a much larger hypothesis space. However, since most deep architectures like stacked RNNs tend to suffer from the vanishing-gradient and overfitting problems, their effects are still understudied in many NLP tasks. Inspired by this, we propose a novel multi-layer RNN model called densely connected bidirectional long short-term memory (DC-Bi-LSTM) in this paper, which essentially represents each layer by the concatenation of its hidden state and all preceding layers' hidden states, followed by recursively passing each layer's representation to all subsequent layers. We evaluate our proposed model on five benchmark datasets of sentence classification. DC-Bi-LSTM with depth up to 20 can be successfully trained and obtain significant improvements over the traditional Bi-LSTM with the same or even less parameters. Moreover, our model has promising performance compared with the state-of-the-art approaches.

研究の動機と目的

  • 自然言語処理タスクにおける深層スタックされたRNNの消失勾配と過学習の問題に対処すること。
  • 深層双方向LSTMアーキテクチャにおける特徴の再利用と情報の流れを改善すること。
  • 文分類タスクにおいて、20層以上の非常に深いRNNの正常な学習を可能にすること。
  • 標準のBi-LSTMや最先端のモデルよりも、性能とパラメータ効率性に優れた結果を達成すること。

提案手法

  • 各層の入力が、元の入力シーケンスと、すべての直前層の隠れ状態の連結である、密接に接続されたアーキテクチャを採用する。
  • 各層は、双方向LSTMを介して入力を処理し、新しい隠れ状態表現を生成する。
  • すべての直前層の隠れ状態が連結され、その後続層に渡されるため、深層的な特徴の再利用が可能になる。
  • 最終層の隠れ状態が、分類のための文レベル表現として使用される。
  • 標準的な誤差逆伝播法と勾配降下法を用いて、エンドツーエンドで学習される。
  • 最適なパフォーマンスを得るために、深さ(dl)、隠れユニット数(dh)、シーケンス長(th)などのハイパーパrameterが調整される。

実験結果

リサーチクエスチョン

  • RQ1密接に接続されたアーキテクチャは、深層双方向LSTMにおける消失勾配と過学習の問題を緩和できるか?
  • RQ2すべての直前層の隠れ状態を連結することで、特徴表現と分類精度が向上するか?
  • RQ3標準のスタックされたBi-LSTMとは異なり、DC-Bi-LSTMは20層以上の深さでも正常に学習可能か?
  • RQ4標準のBi-LSTMや最先端のモデルと比較して、DC-Bi-LSTMの性能とパラメータ効率性はどのように異なるか?

主な発見

  • 20層のDC-Bi-LSTMは、SST-1で50.2%、SST-2で88.8%の精度を達成し、同じまたはそれ以下のパラメータ数で標準のBi-LSTMベースライン(49.2% および 87.2%)を上回った。
  • 15層(dl=15, dh=13)のモデルは、SST-1で最高の51.9%、SST-2で89.7%のパフォーマンスを示し、この設定における最適な深さであることが示された。
  • パラメータ数を1.44Mに固定した場合、10層(dl=10, dh=20)のDC-Bi-LSTMはSST-1で51.0%、SST-2で88.5%の精度を達成し、Bi-LSTMよりも優れたパラメータ効率性を示した。
  • 深さ(dl)を0から20に増加させることで、SST-1とSST-2の両方で一貫した性能向上が見られ、それぞれ1.7%および1.3%の向上が確認され、より深いアーキテクチャの利点が裏付けられた。
  • 隠れユニット数(dh)を0から20に増加させると、精度は着実に向上し、dh=20でSST-1で51.0%、SST-2で88.5%の精度を達成した。これは、各層の表現能力の重要性を確認するものであった。
  • 標準のスタックされたLSTMとは異なり、20層まで安定して学習可能であり、一方で標準のスタックされたLSTMは5層を超えると急激に性能が低下(例:深さ8で30%の精度)したため、本モデルの訓練上の利点が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。