Skip to main content
QUICK REVIEW

[論文レビュー] Machine Translationese: Effects of Algorithmic Bias on Linguistic Complexity in Machine Translation

Eva Vanmassenhove, Dimitar Shterionov|arXiv (Cornell University)|Jan 30, 2021
Natural Language Processing Techniques被引用数 4
ひとこと要約

本稿は、機械翻訳(MT)システムにおけるアルゴリズム的バイアスが言語的複雑性を低下させることを調査し、その現象を「機械翻訳的語彙(machine translationese)」と呼ぶ。PB-SMT、LSTM、Transformerモデルを用いた語彙的・屈曲的多様性の指標を用いて分析した結果、すべてのMTシステムが訓練データと比較して顕著に語彙的および屈曲的多様性を低下させていることが判明した。特に、フランス語やスペイン語といったより豊かな屈曲的言語では、Transformerでさえも依然として訓練データの水準に達しない。

ABSTRACT

Recent studies in the field of Machine Translation (MT) and Natural Language Processing (NLP) have shown that existing models amplify biases observed in the training data. The amplification of biases in language technology has mainly been examined with respect to specific phenomena, such as gender bias. In this work, we go beyond the study of gender in MT and investigate how bias amplification might affect language in a broader sense. We hypothesize that the 'algorithmic bias', i.e. an exacerbation of frequently observed patterns in combination with a loss of less frequent ones, not only exacerbates societal biases present in current datasets but could also lead to an artificially impoverished language: 'machine translationese'. We assess the linguistic richness (on a lexical and morphological level) of translations created by different data-driven MT paradigms - phrase-based statistical (PB-SMT) and neural MT (NMT). Our experiments show that there is a loss of lexical and morphological richness in the translations produced by all investigated MT paradigms for two language pairs (EN<=>FR and EN<=>ES).

研究の動機と目的

  • データ駆動型MTシステムにおけるアルゴリズム的バイアスが、語彙的および屈曲的多様性の観点で測定可能な言語的豊かさの損失を引き起こすかどうかを調査すること。
  • この減少を『機械翻訳的語彙』—言語の人工的で貧弱な形態—として社会言語学的文脈で捉えること。
  • PB-SMT、LSTM、Transformerといった異なるMTパラダイムが、複数の言語対(EN↔FR、EN↔ES)における言語的多様性に与える影響を比較すること。
  • 語彙的洗練度、同義語頻度、屈曲的多様性を測定するための新規で適応的かつ自動化された評価指標を開発・適用すること。
  • 観察された多様性の損失が、BLEU や TER といった標準的な翻訳品質指標と相関するかどうかを評価すること。

提案手法

  • 第二言語習得分野の語彙的洗練度プロファイル(LFP)を適応し、MT出力における語彙的洗練度と多様性を評価した。
  • シャノンのエントロピーとシンプソンの多様性指数を用い、2つ以上の語形を持つ語彙素(lemmata)における屈曲的多様性を測定した。単一語形を持つ語彙素はバイアスを避けるために除外した。
  • 同義語頻度を捉えるための新規な自動評価手法を提案し、標準的な多様性指標を超えた語彙的豊かさを評価した。
  • 英語–フランス語および英語–スペイン語の2つの言語対について、フレーズベースSMT(PB-SMT)、LSTMベースseq2seq、Transformer(TRANS)の3つのMTアーキテクチャを評価した。
  • 元の訓練データとMT出力の両方に対して多様性スコア(シャノンエントロピー H、シンプソンの多様性 D)を計算し、比較可能性を高めるために [0–100] に正規化した。
  • 翻訳品質との相関を検証するため、標準的なMT評価指標(BLEU、TER)を用い、研究結果の妥当性を裏付けるための相互検証を実施した。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型MTシステムは、訓練データと比較して、どの程度語彙的および屈曲的多様性を低下させるか?
  • RQ2MTアーキテクチャの選択(PB-SMT、LSTM、Transformer)は、翻訳における言語的豊かさの保持にどのように影響するか?
  • RQ3屈曲的多様性の損失は、特に屈曲的豊富な言語において、文法的に正しい形の生成能力に悪影響を及えるか?
  • RQ4言語的多様性とBLEU や TER といった標準的なMT品質指標との間に測定可能な相関関係があるか?
  • RQ5『機械翻訳的語彙』はどの程度アルゴリズム的バイアスを反映しており、その長期的・社会言語学的影響は何か?

主な発見

  • PB-SMT、LSTM、TransformerのすべてのMTシステムが、両言語対(EN↔FR、EN↔ES)において、元の訓練データと比較して顕著に語彙的および屈曲的多様性を低下させている。
  • 屈曲的多様性のシャノンエントロピー(H)とシンプソンの多様性(D)スコアは、MT出力で一貫して低かった。フランス語では、Hは元の75.20からTransformerの73.13に低下し、Dは56.42から57.70に上昇した。スペイン語では、Hは78.42から77.23に低下し、Dは54.96から56.26に上昇した。
  • Transformerモデルは、フランス語およびスペイン語への翻訳において、PB-SMT や LSTM よりも屈曲的多様性をよりよく保持していたが、依然として元のデータ水準に達していなかった。
  • 英語への翻訳では、PB-SMT がLSTMよりも屈曲的多様性で優れており、翻訳言語の文法的特徴に応じたアーキテクチャ固有の影響が見られた。
  • 屈曲的豊富な言語(フランス語およびスペイン語)では、元データとMT出力との間の多様性の差が最も顕著で、英語よりも顕著に開きが生じた。
  • 高い言語的多様性とBLEU/TERスコアの間には強い相関関係が確認され、多様性指標が翻訳品質の意味のある代理指標として機能する可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。