Skip to main content
QUICK REVIEW

[論文レビュー] An Efficient Character-Level Neural Machine Translation

Shenjian Zhao, Zhihua Zhang|arXiv (Cornell University)|Aug 16, 2016
Natural Language Processing Techniques参考文献 17被引用数 5
ひとこと要約

本稿では、語彙の大きな単語レベルのモデルを用いずに、源文の系列をダウンサンプリングするデシメーターと、復元出力をリサンプリングするインタポレーターを用いた、文字レベルのニューラル機械翻訳モデルを提案する。このモデルは、大規模語彙を必要とせず、効率的な学習が可能であり、語彙外語(OOV)や誤字に対しても正しく翻訳でき、意味的に類似した語の意味的埋め込みを学習する。

ABSTRACT

Neural machine translation aims at building a single large neural network that can be trained to maximize translation performance. The encoder-decoder architecture with an attention mechanism achieves a translation performance comparable to the existing state-of-the-art phrase-based systems on the task of English-to-French translation. However, the use of large vocabulary becomes the bottleneck in both training and improving the performance. In this paper, we propose an efficient architecture to train a deep character-level neural machine translation by introducing a decimator and an interpolator. The decimator is used to sample the source sequence before encoding while the interpolator is used to resample after decoding. Such a deep model has two major advantages. It avoids the large vocabulary issue radically; at the same time, it is much faster and more memory-efficient in training than conventional character-based models. More interestingly, our model is able to translate the misspelled word like human beings.

研究の動機と目的

  • 語彙レベルのニューラル機械翻訳における語彙外語(OOV)問題を、文字レベルでモデル化することで解決する。
  • 長大な系列と大きなコンテキスト窓のため、従来の文字レベルモデルの計算効率の低さと学習の難しさを克服する。
  • 語彙レベルの教師信号や語彙レベルの語彙に依存せずに、深層再帰ネットワークをエンドツーエンドで学習可能にする。
  • 大規模語彙を必要とせず、最先端の語彙レベルモデルと同等または優れた翻訳性能を達成する。また、未知語や誤字語の処理能力を維持する。
  • 文字レベルのモデリングが、語彙レベルモデルと同様に意味的に意味的クラスタリングされた語の表現を学習できることを示す。

提案手法

  • 語の境界(例:空白)で源文字系列をサンプリングする、変更を加えたGRUに基づくデシメーターを導入し、符号化の前に系列長を短縮する。
  • デリミタが生成されるまで文字を逐次生成する、変更を加えたGRUに基づくインタポレーターを適用し、語彙レベルのトークン化なしに自然な復元を可能にする。
  • Bahdanauら(2014)と同様に、符号化された源表現から計算されるコンテキストベクトルを用いた標準的なアテンション機構を採用する。
  • バックプロパゲーション・スル・タイムを用いて、デシメーターとインタポレーターをRNNフローに統合し、勾配の流れを維持しながら、全モデルをエンドツーエンドで学習する。
  • 言語の階層的構造(語を単位とする)を活用し、系列の短縮と生成の制御点としてデリミタを用いる。
  • t-SNE可視化を適用し、意味的に類似した語が近接して埋め込まれており、誤字の変形語も近接していることを示す。

実験結果

リサーチクエスチョン

  • RQ1語彙レベルのモデルと同等またはそれ以上の性能を達成しながら、大規模語彙を避けられる文字レベルのニューラル機械翻訳モデルは実現可能か?
  • RQ2提案されたデシメーター・インタポレーター構造は、従来の文字レベルモデルと比較して、学習時間とメモリ使用量を顕著に削減できるか?
  • RQ3語彙レベルの照合や<unk>トークンに依存せず、語彙外語(OOV)や誤字語を正しく翻訳できるか?
  • RQ4このアーキテクチャを用いた文字レベルモデリングは、語の意味的関係を保持するのか?すなわち、語の意味的類似語が埋め込み空間でクラスタリングされるか?
  • RQ5深層再帰ネットワークを用いることで、モデルの性能はどの程度向上するのか?また、Lingら(2015b)のような従来の文字レベルアプローチと比較して、どのように差がつくのか?

主な発見

  • 提案されたDCNMTモデルは、WMT 2014 英語→フランス語翻訳タスクで38.7のBLEUスコアを達成し、語彙レベルモデル(37.8 BLEU)およびLingら(2015b)の文字レベルモデルを上回った。
  • モデルは、'responisble' や 'exrecise' といった誤字語を正しく翻訳し、'<unk>' トークンに依存せずに正確なフランス語訳を出力した。
  • t-SNE可視化により、'exercise' と 'exrecise' のような意味的に類似した語がベクトル空間で近接して埋め込まれており、意味的学習が行われていることが示された。
  • 'April'、'February'、'January'、'June'、'July' といった語が埋め込み空間でクラスタリングされており、文字レベルのパターンから意味的類似性を学習できることを示した。
  • デシメーターは、実効的な入力系列長を短縮し、従来の文字レベルモデルと比較して、学習がはるかに高速かつメモリ効率が良くなった。
  • 深層GRUネットワークを用いても、高い性能を維持しており、より深いアーキテクチャへのスケーラビリティと、さらなる改善の可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。