Skip to main content
QUICK REVIEW

[論文レビュー] What Level of Quality can Neural Machine Translation Attain on Literary Text?

Antonio Toral, Andy Way|arXiv (Cornell University)|Jan 15, 2018
Natural Language Processing Techniques被引用数 4
ひとこと要約

本研究では、12部の有名な小説から得た1億語を超える並列テキストを用いて、ニューラル機械翻訳(NMT)とフレーズベース統計的機械翻訳(PBSMT)の両方を学習させ、文学的テキストにおけるNMTの性能を評価した。NMTはPBSMTを著しく上回り、BLEUスコアで3ポイントの絶対的向上(11%の相対的向上)を達成した。また、人間による評価では、小説ごとに17%~34%の割合でNMTの翻訳がプロの翻訳者と同等の品質であると評価された。

ABSTRACT

Given the rise of a new approach to MT, Neural MT (NMT), and its promising performance on different text types, we assess the translation quality it can attain on what is perceived to be the greatest challenge for MT: literary text. Specifically, we target novels, arguably the most popular type of literary text. We build a literary-adapted NMT system for the English-to-Catalan translation direction and evaluate it against a system pertaining to the previous dominant paradigm in MT: statistical phrase-based MT (PBSMT). To this end, for the first time we train MT systems, both NMT and PBSMT, on large amounts of literary text (over 100 million words) and evaluate them on a set of twelve widely known novels spanning from the the 1920s to the present day. According to the BLEU automatic evaluation metric, NMT is significantly better than PBSMT (p < 0.01) on all the novels considered. Overall, NMT results in a 11% relative improvement (3 points absolute) over PBSMT. A complementary human evaluation on three of the books shows that between 17% and 34% of the translations, depending on the book, produced by NMT (versus 8% and 20% with PBSMT) are perceived by native speakers of the target language to be of equivalent quality to translations produced by a professional human translator.

研究の動機と目的

  • 最先端のニューラル機械翻訳(NMT)が文学的テキスト、特に小説において達成可能な翻訳品質を評価すること。
  • ドメイン内文学的並列データ上で、NMTの性能を以前の主流であったフレーズベース統計的機械翻訳(PBSMT)と比較すること。
  • NMTが文学的コンテンツにおいて、プロの翻訳者と同等の品質の翻訳を生成できるかどうかを評価すること。
  • 語彙の豊かさ、学習データに対する新規性、文の長さといったテキスト的特徴が、NMTのPBSMTに対する相対的性能向上に与える影響を調査すること。

提案手法

  • 12部の有名な小説から得た1億語を超える並列テキストを用いて、NMTシステムとPBSMTシステムを学習させた。
  • すべての12部の小説に対してBLEUスコアを用いた自動評価を実施し、NMTとPBSMTの性能を比較した。
  • Appraiseツールを用いて、3部の小説について、NMT、PBSMT、およびプロの翻訳者による翻訳を人間が順位付けする評価を実施した。
  • TrueSkillアルゴリズムを適用し、各翻訳タイプ(HT、NMT、PBSMT)の統計的に有意な総合スコアを算出し、p < 0.05を満たした。
  • NMTがPBSMTを上回る相対的改善度と、語彙の豊かさ、新規性、平均文長の3つの小説固有の特徴との相関を分析した。
  • 3部すべての小説について、NMTとPBSMTの出力の品質を対比較するペアワイズ順位付け分析を実施した。

実験結果

リサーチクエスチョン

  • RQ1NMTはドメイン内文学的テキスト、特に小説において、PBSMTよりも著しく優れた翻訳品質を達成できるか?
  • RQ2NMTは、ネイティブスピーカーによって評価された場合、文学的コンテンツにおいてプロの翻訳者と同等の品質の翻訳をどれくらいの割合で生成できるか?
  • RQ3語彙の豊かさ、学習データに対する新規性、文の長さといったテキスト的特徴は、NMTがPBSMTを上回る相対的性能向上にどのように影響するか?
  • RQ4品質と人間の認識に基づいて、NMTがプロの文学翻訳者による後処理を支援する可能性はどの程度か?

主な発見

  • BLEUスコアによる評価では、NMTは12部すべての小説でPBSMTを著しく上回り、3ポイントの絶対的向上(11%の相対的向上)を達成し、p < 0.01であった。
  • 人間による評価では、NMTの翻訳の17%~34%がプロの翻訳者と同等の品質であると評価されたのに対し、PBSMTは8%~20%であった。
  • 3部すべての小説において、NMTがPBSMTを上回ったケースは41.4%~54.7%にのぼり、PBSMTとNMTが同率だったケースは27.8%~39.4%であった。
  • TrueSkillで導出された総合人間評価スコアから、NMTはPBSMTを著しく上回り、プロの翻訳者よりは低いが、PBSMTベースラインから人間品質までの距離の18%~22%の位置に位置づけられた。
  • 文の長さ以外の特徴では、NMTのPBSMTに対する相対的改善度との間に有意義な相関は認められなかった。
  • 平均文長が最も長い小説では、NMTのPBSMTに対する改善度が相対的に低く、文の長さが性能差の主要因である可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。