Skip to main content
QUICK REVIEW

[論文レビュー] Bag-of-Words as Target for Neural Machine Translation

Shuming Ma, Xu Sun|arXiv (Cornell University)|May 13, 2018
Natural Language Processing Techniques参考文献 33被引用数 9
ひとこと要約

この論文は、翻訳の参照訳とそれに対応するbag-of-words表現の両方を同時に最適化するニューラル機械翻訳のための新しい学習目的を提案する。bag-of-wordsを二次的目標として組み込むことで、学習データに存在しない多様で正しい翻訳の生成を促進し、中国語-英語データセットにおいて強力なベースラインより4.55 BLEUポイントの向上を達成した。

ABSTRACT

A sentence can be translated into more than one correct sentences. However, most of the existing neural machine translation models only use one of the correct translations as the targets, and the other correct sentences are punished as the incorrect sentences in the training stage. Since most of the correct translations for one sentence share the similar bag-of-words, it is possible to distinguish the correct translations from the incorrect ones by the bag-of-words. In this paper, we propose an approach that uses both the sentences and the bag-of-words as targets in the training stage, in order to encourage the model to generate the potentially correct sentences that are not appeared in the training set. We evaluate our model on a Chinese-English translation dataset, and experiments show our model outperforms the strong baselines by the BLEU score of 4.55.

研究の動機と目的

  • 1文あたり1つの参照訳しか使用しない標準的なNMTモデルが、学習データにないが正しい翻訳に対してペナルティを与えるという制限を解消すること。
  • 複数の正しい翻訳に共通する語の内容を活用することで、ニューラル機械翻訳におけるデータスパarsityを軽減すること。
  • 参照訳のbag-of-wordsと一致する多様で意味的に妥当な翻訳の生成を促進することで、モデルの一般化性能を向上させること。
  • 標準的な交差エントロピー損失を超えて、学習中にbag-of-wordsをソフトな監督信号として用いることで翻訳品質を向上させること。

提案手法

  • モデルは、エンコーダが双方向LSTMで、デコーダがアテンション機構を備えた単方向LSTMである、シーケンス・ツー・シーケンスのアーキテクチャを採用している。
  • bag-of-wordsは、複数のデコーダ位置における語のスコアの合計に基づき、翻訳に語が含まれるかを予測する多ラベル分類問題として扱う。
  • 文単位の語スコアは、各時刻におけるデコーダ出力分布から集約され、シグモイド分類器を適用して、参照のbag-of-wordsに含まれる語のうちどの語を含めるかを予測する。
  • 最終的な損失関数は、ターゲットシーケンスのための標準的な交差エントロピー損失と、bag-of-words予測のためのバイナリ交差エントロピー損失の組み合わせであり、両方の最適化を可能にする。
  • アテンション機構は、デコーダの隠れ状態とエンコーダの表現をソフトアテンション機構を用いてアライメントすることで、コンテキストベクトルを計算する。
  • エンコーダ、デコーダ、語の存在予測ヘッドが同時に更新可能となるように、両方の目的を統合的にエンド・ツー・エンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1bag-of-wordsを二次的学習目標として組み込むことで、ニューラル機械翻訳出力の多様性と正確性が向上するか?
  • RQ2参照シーケンスとそのbag-of-words表現の両方を共同最適化することで、標準的なNMTと比較してBLEUスコアにどのような影響を与えるか?
  • RQ3モデルが訓練データに存在しない高品質な正しくない翻訳をどの程度生成できるか?
  • RQ4bag-of-wordsを監督信号として用いることで、構造的に異なるが意味的に妥当な翻訳に対するペナルティが軽減されるか?
  • RQ5bag-of-wordsを潜在変数または補助損失として用いる既存の手法と比較して、本手法はどのように優れているか?

主な発見

  • 提案手法は、NIST中国語-英語翻訳データセットにおいて、強力なベースラインモデルより4.55 BLEUポイントの向上を達成した。
  • 提案モデルは、ベースラインと比較して、参照のbag-of-wordsからキーワードをよりよくカバーする、より情報量が多く正確な翻訳を生成した。
  • 定性的な例から、提案モデルの翻訳は、重要な内容を省略したり、余分なトークンや未知語を含める可能性が低く、より洗練された出力であることが示された。
  • モデルは、参照のbag-of-words表現と一致させることで、学習データにないが正しい翻訳に対するペナルティを効果的に軽減した。
  • 本手法は、bag-of-wordsを潜在変数や補助制約として用いる既存の手法を上回り、デコーダ出力分布を直接的に監視するという点で優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。