Skip to main content
QUICK REVIEW

[論文レビュー] Deep Recurrent Models with Fast-Forward Connections for Neural Machine Translation

Jie Zhou, Ying Cao|arXiv (Cornell University)|Jun 14, 2016
Natural Language Processing Techniques参考文献 27被引用数 16
ひとこと要約

この論文は、16層の深さを持つ深層ニューラル機械翻訳(NMT)を可能にするために、ファストフォワード接続とインタラーリーブドバイポーラルLSTMアーキテクチャを導入した。勾配の流れを加速する線形スキップ接続により、WMT'14英語-フランス語翻訳で37.7のBLEUスコアという、単一モデルとしての最先端性能を達成し、浅いNMTおよび最良の従来のSMTシステムを0.7 BLEUポイント上回った。

ABSTRACT

Neural machine translation (NMT) aims at solving machine translation (MT) problems using neural networks and has exhibited promising results in recent years. However, most of the existing NMT models are shallow and there is still a performance gap between a single NMT model and the best conventional MT system. In this work, we introduce a new type of linear connections, named fast-forward connections, based on deep Long Short-Term Memory (LSTM) networks, and an interleaved bi-directional architecture for stacking the LSTM layers. Fast-forward connections play an essential role in propagating the gradients and building a deep topology of depth 16. On the WMT'14 English-to-French task, we achieve BLEU=37.7 with a single attention model, which outperforms the corresponding single shallow model by 6.2 BLEU points. This is the first time that a single NMT model achieves state-of-the-art performance and outperforms the best conventional model by 0.7 BLEU points. We can still achieve BLEU=36.3 even without using an attention mechanism. After special handling of unknown words and model ensembling, we obtain the best score reported to date on this task with BLEU=40.4. Our models are also validated on the more difficult WMT'14 English-to-German task.

研究の動機と目的

  • WMT'14英語-フランス語翻訳タスクにおいて、単一NMTモデルと従来のSMTシステムの性能格差を埋めること。
  • 深層再帰的ネットワークにおける消失勾配問題に対処することで、より深いNMTアーキテクチャの実現を可能にすること。
  • 新しいアーキテクチャ的要素を用いて、深層LSTMにおける学習安定性と一般化性能の向上を図ること。
  • アンサンブル手法を用いずに、深層NMTモデルが浅いモデルや従来のシステムを上回ることを実証すること。

提案手法

  • 勾配の流れを加速するため、非線形活性化関数や再帰的計算を回避する線形スキップ接続型のリンクをLSTM層間に設ける「ファストフォワード接続」を提案する。
  • 文脈表現と勾配伝播を強化するように設計された、インタラーリーブドバイポーラルLSTMアーキテクチャを考案する。
  • ファストフォワード接続を用いて、合計16層(25個のLSTM層)の深層エンコーダ-デコーダトポロジーを実装し、非常に深いネットワークの学習を安定化させる。
  • 標準的なエンコーダ-デコーダ型およびアテンションベースのNMTモデルの両方へこのアーキテクチャを適用し、より良い深さスケーラビリティを実現するエンドツーエンド学習を可能にする。
  • 効率的な推論を実現するため、小さなビームサイズ(3)を用いたビームサーチを適用し、性能を損なわず効率性を確保することを示した。
  • 未知語処理とモデルアンサンブルを適用することで、テストセットにおける性能をさらに向上させた。

実験結果

リサーチクエスチョン

  • RQ1標準的なRNNを用いた深層再帰的アーキテクチャ(16層以上)を、ニューラル機械翻訳に成功裏に学習させることは可能か?
  • RQ2ファストフォワード接続は、標準的な残差接続やスキップ接続と比較して、深層LSTMにおける勾配の流れと学習安定性を顕著に改善するか?
  • RQ3単一の深層NMTモデルが、WMT'14英語-フランス語タスクにおいて、最良の従来のSMTシステムを上回ることができるか?
  • RQ4特に長文シーケンスにおいて、モデルの深さが過学習および一般化性能に与える影響は何か?
  • RQ5未知語は深層NMTモデルの性能にどの程度制限を及えるか?その影響は軽減可能か?

主な発見

  • 提案された16層の深層NMTモデルに加え、ファストフォワード接続を適用した結果、WMT'14英語-フランス語テストセットで37.7のBLEUスコアを達成し、以前の最良単一モデル結果より6.2 BLEUポイント向上した。
  • このモデルは、このタスクで最良の従来のSMTシステム(37.0 BLEU)を超える最初の単一NMTシステムであり、37.7 BLEUという新たな最先端スコアを達成した。
  • アテンション機構を搭載していない状態でも、深層モデルは36.3 BLEUを達成しており、深さとファストフォワード接続の有効性が明確に示された。
  • 未知語処理と3つのモデルのアンサンブルを適用した結果、BLEUスコアは40.4に達し、以前の最良結果より2.9ポイント向上した。
  • 未知語のないテストサブセットでは、アンサンブルモデルが41.4 BLEUを達成しており、未知語が主な性能ボトルネックであることが示された。
  • 同等の訓練誤差率において、浅いモデルと比較して過学習が抑えられていることから、深層モデルはより優れた汎化性能を示していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。