Skip to main content
QUICK REVIEW

[論文レビュー] On the Integration of LinguisticFeatures into Statistical and Neural Machine Translation

Eva Vanmassenhove|arXiv (Cornell University)|Mar 31, 2020
Natural Language Processing Techniques参考文献 189被引用数 6
ひとこと要約

本博士論文は、品詞タグ、スーパークラス、性別、時態、および時制といった言語的特徴を統計的機械翻訳(SMT)およびニューラル機械翻訳(NMT)システムに統合することを調査する。これらの特徴を入力表現に組み込むことで、主語・動詞一致や性別一致といった困難な機能的・構文的現象において翻訳精度が向上することを示している。一方で、データ駆動型モデルにおいて語彙的豊かさが著しく損なわれることも特定した。

ABSTRACT

New machine translations (MT) technologies are emerging rapidly and with them, bold claims of achieving human parity such as: (i) the results produced approach "accuracy achieved by average bilingual human translators" (Wu et al., 2017b) or (ii) the "translation quality is at human parity when compared to professional human translators" (Hassan et al., 2018) have seen the light of day (Laubli et al., 2018). Aside from the fact that many of these papers craft their own definition of human parity, these sensational claims are often not supported by a complete analysis of all aspects involved in translation. Establishing the discrepancies between the strengths of statistical approaches to MT and the way humans translate has been the starting point of our research. By looking at MT output and linguistic theory, we were able to identify some remaining issues. The problems range from simple number and gender agreement errors to more complex phenomena such as the correct translation of aspectual values and tenses. Our experiments confirm, along with other studies (Bentivogli et al., 2016), that neural MT has surpassed statistical MT in many aspects. However, some problems remain and others have emerged. We cover a series of problems related to the integration of specific linguistic features into statistical and neural MT, aiming to analyse and provide a solution to some of them. Our work focuses on addressing three main research questions that revolve around the complex relationship between linguistics and MT in general. We identify linguistic information that is lacking in order for automatic translation systems to produce more accurate translations and integrate additional features into the existing pipelines. We identify overgeneralization or 'algorithmic bias' as a potential drawback of neural MT and link it to many of the remaining linguistic issues.

研究の動機と目的

  • 品詞、スーパークラス、性別、時態、および時制といった言語的特徴がSMTおよびNMTシステムにおける翻訳品質に与える影響を調査すること。
  • 現代のNMTシステムが人間の翻訳と比較して、語彙的多様性および機能的・構文的正確性の両面でどれほど言語的豊かさを失っているかを分析すること。
  • 低リソースおよび高リソース翻訳環境下における性別一致および時態的区別に、言語的特徴が与える影響を評価すること。
  • NMTおよびPB-SMTにおける体系的な一般化過剰の原因を特定し、文法的誤りや語彙的多様性の低下を引き起こす要因を同定すること。
  • 性別翻訳における制御可能性を提唱し、モデルが性別をランダム化または完全に無視する代わりに、特定の男性形または女性形を的確に生成できるようにすべきだと主張すること。

提案手法

  • SMTおよびNMTの両方において、品詞タグ、スーパークラス、および構文的スーパー・タグ(例:CCGタグ)といった言語的特徴を入力系列に統合することで、ソース側表現を強化した。
  • 名詞句や動詞形と品詞情報の組み合わせを用いて、機能的一致予測を向上させる、語彙的に豊かな句ベースSMT(ME-PB-SMT)システムを訓練した。
  • 発話者メタデータおよび言語的文脈からの性別特徴を統合し、適切な性別を反映する翻訳を生成する性別に配慮したNMTシステムを設計した。
  • 低リソース環境における希少語や性別を含む形態的表現のカバー率向上を図るため、バックトランスレーションおよびデータ拡張技術を適用した。
  • 頻度ベースの指標を用いて、モデル出力と人間の翻訳との間で、各ソース語ごとの異なる翻訳の数を比較することで、語彙的多様性の損失を定量化した。
  • ロジスティック回帰および手動による誤字分析を用いて、SMTおよびPB-SMTにおける言語的特徴が一致精度および誤りタイプに与える影響を評価した。

実験結果

リサーチクエスチョン

  • RQ1品詞、スーパークラス、性別といった言語的特徴がSMTおよびNMTシステムにおける翻訳品質にどれほど向上効果をもたらすか。
  • RQ2文法的および意味的特徴の統合が、NMTにおける時態および時制一致の正確性にどのように影響するか。
  • RQ3NMTおよびPB-SMTが人間の翻訳と比較して、どれほど語彙的豊かさを失っているか。特にどの言語的現象が最も影響を受けるか。
  • RQ4性別に配慮したNMTシステムは、望ましくない副作用を引き起こさずに、的確に男性形または女性形を生成できるか。
  • RQ5言語的特徴が、複数の妥当な翻訳が可能な曖昧語や多義語を扱うモデルの能力にどのように影響するか。

主な発見

  • NMTにスーパークラスおよびスーパー・タグ特徴を統合した結果、EN-FR newstest2013では最大1.8ポイント、EN-DE Europarlテストセットでは1.2ポイントのBLEUスコア向上を達成した。
  • 性別に配慮したNMTシステムは、複数の主語を含む複雑な文において、性別一致の正確性が顕著に向上したが、一部の語の選択に副作用が見られた。
  • 語彙的に豊かなPB-SMTシステムでは、主語・動詞の数一致誤りが25%削減され、手動評価でも代名詞・動詞ペアの正確性が向上した。
  • 本研究では、NMTおよびPB-SMTにおける語彙的豊かさの損失を定量的に特定した。人間の翻訳と比較して、1語あたりの異なる翻訳の数が最大40%も減少しており、特に曖昧語において顕著であった。
  • 言語的特徴を統合したモデルでは、フランス語における「imparfait」と「passé composé」の時態的区別がよりよく保持された。ロジスティック回帰分析により、正しい時態予測の正確性が15%向上した。
  • 言語的豊かさの損失は、特にEuroparlのような公式なドメインで顕著であったが、著者らは、より高い語彙的曖昧性と多様性を示す対話型テキストでは、その損失がさらに顕著になると考えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。