Skip to main content
QUICK REVIEW

[論文レビュー] Local Translation Prediction with Global Sentence Representation

Jiajun Zhang|arXiv (Cornell University)|Feb 27, 2015
Natural Language Processing Techniques参考文献 25被引用数 20
ひとこと要約

本論文は、統計的機械翻訳における局所翻訳予測の向上を目的として、グローバルな文レベルの意味表現を学習する二か国語制約付きチャンクベースの畳み込みニューラルネットワーク(BCCNN)を提案する。この表現をフィードフォワードニューラルネットワークの共同モデルに統合することで、強力な階層的フレーズベースのベースラインに対して最大1.38のBLEUスコア向上を達成し、翻訳品質におけるグローバルな文脈の価値を示している。

ABSTRACT

Statistical machine translation models have made great progress in improving the translation quality. However, the existing models predict the target translation with only the source- and target-side local context information. In practice, distinguishing good translations from bad ones does not only depend on the local features, but also rely on the global sentence-level information. In this paper, we explore the source-side global sentence-level features for target-side local translation prediction. We propose a novel bilingually-constrained chunk-based convolutional neural network to learn sentence semantic representations. With the sentence-level feature representation, we further design a feed-forward neural network to better predict translations using both local and global information. The large-scale experiments show that our method can obtain substantial improvements in translation quality over the strong baseline: the hierarchical phrase-based translation model augmented with the neural network joint model.

研究の動機と目的

  • 既存の統計的機械翻訳モデルがローカルな文脈に依存するという限界を是正するため、より良い翻訳予測のためのグローバルな文レベルの意味を統合すること。
  • ゴールスタンダードのアノテーションを必要とせず、並列文ペアを弱い監視信号として用いることで、ロバストな文レベルの意味表現を学習すること。
  • 長さが可変な文を効果的に処理しつつ、翻訳タスクにおける意味的コンテンツを保持するニューラルネットワークアーキテクチャを設計すること。
  • 階層的フレーズベースの翻訳システムのデコードプロセスに学習されたグローバル表現を統合し、翻訳品質を向上させること。

提案手法

  • 並列文ペアを弱い監視信号として用いることで、ゴールの意味ラベルが不要な二か国語制約付きチャンクベースのCNN(BCCNN)を提案し、文の表現を学習する。
  • 可変長の文を設定可能な数のチャンクに分割することで、最大オーバータイムプーリングよりも多くの意味情報を保持する。
  • 事前学習済みモデル(例:word2vec)からの単語埋め込みを入力とし、畳み込み層とプーリング層を適用して各チャンクごとの局所特徴を抽出し、固定長の文表現に集約する。
  • 局所的およびグローバルな文脈を用いて、ターゲット語の条件付き確率を予測するフィードフォワードニューラルネットワークに学習済みの文表現を統合する。
  • 予測された確率を階層的フレーズベースの翻訳システムの対数線形モデルに統合し、翻訳出力を改善する。
  • 並立した単言語および双方向言語データを用いて、文表現と翻訳予測をエンドツーエンドで最適化する共同学習戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1グローバルな文レベルの意味が、統計的機械翻訳における局所翻訳予測を顕著に改善できるか?
  • RQ2ゴールスタンダードのアノテーションがなくても、効果的に文レベルの意味表現を学習できるか?
  • RQ3可変長の文をどのように構造化すれば、ニューラルネットワークでグローバルな意味を効果的に捉えられるか?
  • RQ4階層的フレーズベースのシステムにおいて、グローバル表現を統合すると翻訳品質にどのような影響を与えるか?

主な発見

  • 4つのチャンクを用いたBCCNNモデル(+BCCNN-4)が最良の性能を示し、最大オーバータイムプーリングや他のチャンク設定を上回った。
  • 4つのチャンクを用いたモデル(+BCCNN-4)は、MT08テストセットにおいてベースライン比最大1.38のBLEUスコア向上を達成した。
  • より多くのチャンク(例:8)を用いることは性能向上に寄与せず、ノイズを引き起こす可能性があるため、チャンク化の最適な範囲があると考えられる。
  • グローバル文表現の統合は、すべてのテストセットで一貫して翻訳品質を向上させ、グローバルな文脈の価値を示している。
  • 二か国語制約付きの学習戦略により、手動でアノテートされた意味ラベルがなくても、意味的意味のある文表現を効果的に学習できることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。