Skip to main content
QUICK REVIEW

[論文レビュー] A Dependency-Based Neural Reordering Model for Statistical Machine Translation

Christian Hadiwinoto, Hwee Tou Ng|arXiv (Cornell University)|Feb 15, 2017
Natural Language Processing Techniques被引用数 4
ひとこと要約

この論文は、依存構文解析と連続的単語埋め込みを用いて、文法的関係で結ばれた2つの源言語語の翻訳において入れ替えられるかどうかを予測するニューラル再順序付けモデルを提案する。モデルは、頭語-従語関係と兄弟関係の2つの順方向ニューラルネットワークを採用し、単語の連続的表現、品詞タグ、依存関係ラベル、構造的特徴を用いる。中国語-英語翻訳において、従来のSMTシステムよりも0.57 BLEUポイントの向上を達成した。

ABSTRACT

In machine translation (MT) that involves translating between two languages with significant differences in word order, determining the correct word order of translated words is a major challenge. The dependency parse tree of a source sentence can help to determine the correct word order of the translated words. In this paper, we present a novel reordering approach utilizing a neural network and dependency-based embeddings to predict whether the translations of two source words linked by a dependency relation should remain in the same order or should be swapped in the translated sentence. Experiments on Chinese-to-English translation show that our approach yields a statistically significant improvement of 0.57 BLEU point on benchmark NIST test sets, compared to our prior state-of-the-art statistical MT system that uses sparse dependency-based reordering features.

研究の動機と目的

  • 中国語と英語のような構文が著しく異なる言語間における語順再配置の課題に対処すること。
  • 依存関係に基づく再配置意思決定を予測するニューラルネットワークを統合することで、フレーズベースSMTを改善すること。
  • スパarsな手作業による依存関係特徴を、依存度の低い連続的ニューラル埋め込みに置き換えることで、特徴工学への依存を低減すること。
  • 依存関係構造に基づく入力特徴を用いてトレーニングされたニューラル分類器を用いて、ビームサーチによるデコードをガイドすることで翻訳品質を向上させること。

提案手法

  • モデルは、依存構文解析木における頭語-従語関係と兄弟関係の2つの別個の順方向ニューラルネットワークを用いる。
  • 入力特徴には語形、品詞タグ、依存関係ラベル、語の間の符号付き距離、句読点の有無を示す指標が含まれる。
  • 各特徴はルックアップテーブルを介して連続的ベクトル空間に埋め込まれ、ReLU活性化関数を用いた2つの隠れ層を通過する。
  • 最終層は2値予測を出力する:翻訳において2つの語を入れ替える必要がある場合は1、順序を維持する場合は0。
  • ニューラル分類器はビームサーチにおけるデコード特徴として統合され、フレーズベースSMTシステムにおける翻訳仮説選択に影響を与える。
  • 単語以外の特徴(品詞タグ、依存関係ラベル、ブール指標など)に対しても連続的表現を適用することで、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1依存関係で結ばれた2つの源言語語が翻訳において再配置されるかどうかを、ニューラルネットワークが効果的に予測できるか。
  • RQ2単語、品詞タグ、依存関係ラベルに連続的埋め込みを用いることで、スパarsな離散的特徴よりも再配置性能が向上するか。
  • RQ3従来のスパarsな依存関係特徴に比べ、ニューラル再順序付けモデルがフレーズベースSMTで優れた性能を発揮できるか。
  • RQ4提案されたニューラル再順序付けモデルは、エンドツーエンドのニューラル機械翻訳(NMT)と比較して、BLEUスコアおよび学習効率の点で優れているか。

主な発見

  • 提案されたニューラル再順序付けモデルは、NIST中国語-英語テストセットにおいて、スパarsな依存関係特徴を用いた従来の最先端SMTシステムよりも統計的に有意な0.57 BLEUポイントの向上を達成した。
  • 同じフレーズベース再順序付けモデルを用いても、ニューラルモデルは従来のSMTシステムを上回っており、連続的表現とエンドツーエンド学習の利点が示された。
  • 同じデータで学習された単一のNMTシステムよりも性能を上回り、BLEUスコア39.55を達成した(NMTの38.97に対し、p < 0.01)。
  • 手作業による特徴工学への依存を低減し、エンドツーエンドで表現を学習することで、チャートパーサーを必要とせずビームサーチデコードにスムーズに統合できる。
  • 品詞タグと依存関係ラベルに連続的埋め込みを適用することで、離散的表現よりも性能が向上することが、ニューラル依存関係パーサー関連の先行研究でも示されている。
  • NMTよりも学習が効率的で、3日間で学習が完了した(NMTは18日間)が、翻訳品質はさらに優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。