Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Failures of Automatic Translation in the Case of Unambiguous Gender

Adithya Renduchintala, Adina Williams|arXiv (Cornell University)|Apr 16, 2021
Gender Studies in Language参考文献 42被引用数 12
ひとこと要約

本稿は、20ヶ国語における明確な性別文脈のもとで、Transformerベースのニューラル機械翻訳(NMT)システムにおける性別接尾語翻訳の正確性を評価するための新しいベンチマークデータセットを紹介する。文脈的ヒントが明確であるにもかかわらず、モデルの性別接尾語の正確性は50–70%にとどまり、特に女性を示唆するトリガー性別の際には顕著に低い性能を示し、正しい性別が明確に示唆されている場合でさえ、性別推論における体系的な失敗が明らかになった。

ABSTRACT

Transformer based models are the modern work horses for neural machine translation (NMT), reaching state of the art across several benchmarks. Despite their impressive accuracy, we observe a systemic and rudimentary class of errors made by transformer based models with regards to translating from a language that doesn't mark gender on nouns into others that do. We find that even when the surrounding context provides unambiguous evidence of the appropriate grammatical gender marking, no transformer based model we tested was able to accurately gender occupation nouns systematically. We release an evaluation scheme and dataset for measuring the ability of transformer based NMT models to translate gender morphology correctly in unambiguous contexts across syntactically diverse sentences. Our dataset translates from an English source into 20 languages from several different language families. With the availability of this dataset, our hope is that the NMT community can iterate on solutions for this class of especially egregious errors.

研究の動機と目的

  • 性別中立言語(例:英語)から性別を示す言語に翻訳する際、TransformerベースのNMTモデルが性別接尾語を正しく処理できない体系的な失敗を特定し、測定すること。
  • 文脈的性別が明確な状況を保証することで、性別接尾語の誤りを分離できる標準化された、曖昧さのない評価ベンチマークを構築すること。
  • 翻訳における性別バイアスが、アーキテクチャ的要因やトレーニングの制限に起因するのか、それとも元のテキストの曖昧さに起因するのかを調査すること。
  • 性別を示す文脈(例:形容詞、動詞、代名詞)が、性別接尾語処理の性能に与える影響を評価すること。
  • NLPコミュニティが、性別翻訳におけるこうした根深い誤りを是正するための的確な解決策を開発するよう促すこと。

提案手法

  • 「私の母は医者だ」「彼女は看護師だ」といった核心的照応(例:'my mother', 'she')により、文法的に性別中立的だが、明確に性別と結びつけられる職業名詞(例:'doctor', 'nurse')を含む英語の元文を構築すること。
  • 核心的照応代名詞(例:'her', 'him')や名詞(例:'father', 'sister')によって性別が明示的に示される文のテンプレートを設計し、翻訳先の性別について曖昧さがないようにすること。
  • 性別に強く関連する形容詞(例:'handsome', 'pretty')や動詞(例:'protect', 'inspire')を追加して、こうしたヒントがモデルの正確性に与える影響を評価すること。
  • 20の多様な言語(複数の言語家系にまたがる)に対して、複数の最先端のTransformerベースのNMTモデル(例:m2m, Opus-MT)を評価すること。
  • 翻訳の性能を、ターゲット言語における性別接尾語の正確一致で測定し、すべての翻訳について人間による検証済みの正解を用意すること。
  • トリガー語の性別(男性 vs. 女性)、語順(トリガー語が職業名詞の前 or 徎後に来るか)および職業とトリガー語の性別ステレオタイプの整合性に基づく性能差を分析すること。

実験結果

リサーチクエスチョン

  • RQ1元の文脈が性別を明確に示している場合、最先端のTransformerベースのNMTモデルが、職業名詞に文法的性別接尾語を正しく付与できない程度はどの程度か?
  • RQ2核心的照応代名詞や名詞(例:'her' 対 'him')の性別が、モデルの性別接尾語の正確性に顕著に影響を与えるか?
  • RQ3統計的に性別を示す形容詞や動詞が存在する場合、曖昧さのない文脈においてモデルの正しく性別を推論する能力にどのような影響を与えるか?
  • RQ4職業名詞がトリガー語の性別とは異なる性別と強く関連している場合、モデルの性能に差が生じるか?
  • RQ5語順(トリガー語が職業名詞の前 or 後)が、性別接尾語の正確性にどの程度影響を与えるか?

主な発見

  • テストされたすべてのTransformerベースのNMTモデルが、性別接尾語処理で最高で70%の正確性を示したが、ウルドゥー語のような言語では50%未満に低下した。
  • トリガー語が女性を示す場合(例:'her', 'sister')に、男性を示す場合(例:'him', 'brother')よりも顕著に性能が低下した。
  • 元言語の職業名詞の性別とトリガー語の性別が一致している場合、正確性が高かった。これは、ステレオタイプの整合性に偏ったバイアスがあることを示唆している。
  • 統計的に性別を示す形容詞や動詞を含めることで、性別接尾語処理の正確性が向上したが、それでも体系的なモデルの失敗を完全に補填することはできなかった。
  • 同じモデルの小規模版と大規模版は、少ない言語では同等の性能を示した。これは、規模の拡大だけでは根本的な問題を解決できないことを示している。
  • ベンチマークにより、曖昧さが存在しない状況でも、形態的性別接尾語の誤りが継続していることが明らかになった。これは、基本的な言語的特徴に対する注意メカニズムや監視の根本的失敗を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。