Skip to main content
QUICK REVIEW

[論文レビュー] Extending Challenge Sets to Uncover Gender Bias in Machine Translation: Impact of Stereotypical Verbs and Adjectives

Jonas Troles, Ute Schmid|ArXiv.org|Jul 24, 2021
Hate Speech and Cyberbullying Detection参考文献 13被引用数 6
ひとこと要約

この論文は、WinoMTのチャレンジセットを拡張して、70,000件を超える英語-ドイツ語翻訳文を含む大規模な評価セットWiBeMTを構築した。このセットは、性別に関するステレオタイプな形容詞と動詞を含み、ニューラル機械翻訳(NMT)における性別バイアスを特定することを目的としている。研究では、形容詞が翻訳における性別バイアスに顕著な影響を与えることが明らかになった。すべての3つの商用MTシステム(DeepL、Microsoft、Google翻訳)が歪んだ出力を示したが、DeepLは最も低いバイアスを示した。結果は、性別化された形容詞が一部の状況では性別差別の度合いを逆に低下させる可能性があることを示唆しているが、同時に新たな形のバイアスを生じさせることもある。

ABSTRACT

Human gender bias is reflected in language and text production. Because state-of-the-art machine translation (MT) systems are trained on large corpora of text, mostly generated by humans, gender bias can also be found in MT. For instance when occupations are translated from a language like English, which mostly uses gender neutral words, to a language like German, which mostly uses a feminine and a masculine version for an occupation, a decision must be made by the MT System. Recent research showed that MT systems are biased towards stereotypical translation of occupations. In 2019 the first, and so far only, challenge set, explicitly designed to measure the extent of gender bias in MT systems has been published. In this set measurement of gender bias is solely based on the translation of occupations. In this paper we present an extension of this challenge set, called WiBeMT, with gender-biased adjectives and adds sentences with gender-biased verbs. The resulting challenge set consists of over 70, 000 sentences and has been translated with three commercial MT systems: DeepL Translator, Microsoft Translator, and Google Translate. Results show a gender bias for all three MT systems. This gender bias is to a great extent significantly influenced by adjectives and to a lesser extent by verbs.

研究の動機と目的

  • 既存の機械翻訳における性別バイアス評価の範囲が職業用語に限定されているという問題に対処すること。
  • 性別ステレオタイプな形容詞と動詞がニューラルMTシステムの翻訳結果に与える影響を調査すること。
  • 職業以外のより広範な言語的要因を捉える、より大規模で多様なチャレンジセット(WiBeMT)を構築すること。
  • 拡張されたデータセットを用いて、3つの商用NMTシステム(DeepL、Microsoft翻訳、Google翻訳)の性別バイアスを評価すること。
  • 性別化された形容詞と動詞が翻訳出力におけるバイアスを強化するか、緩和するかを評価すること。

提案手法

  • ワード埋め込みと性別固有の語彙リストとのコサイン類似度を用いて、性別ステレオタイプな形容詞と動詞を同定した。
  • 職業とステレオタイプな形容詞・動詞を組み合わせ、整合的・非整合的な性別ペアを生成した。
  • 全70,686件の文を系統立てて作成し、人称代名詞、形容詞、動詞を変化させ、翻訳における性別バイアスをテストした。
  • すべての文を3つの商用NMTシステム(DeepL、Microsoft翻訳、Google翻訳)で翻訳した。
  • %TCG(性別化された代名詞の翻訳正しさ)などの指標を用いて性別バイアスを評価し、男性、女性、中立の状況における正答率を比較した。
  • 形容詞と動詞が翻訳の性別結果に与える影響を分析し、職業名の翻訳への影響と全体的なシステムバイアスへの影響を区別した。

実験結果

リサーチクエスチョン

  • RQ1性別ステレオタイプな形容詞は、ドイツ語-英語翻訳における機械翻訳出力の性別バイアスにどのように影響するか?
  • RQ2性別化された動詞は、ニューラル機械翻訳システムにおけるバイアスの翻訳にどの程度寄与するか?
  • RQ3性別化された形容詞の導入は、男性と女性の代名詞参照における翻訳正答率の乖離を増大させるか、縮小させるか?
  • RQ4性別ステレオタイプな形容詞と動詞を含む文を処理する際、商用NMTシステム(DeepL、Microsoft、Google翻訳)の性別バイアスはどのように比較されるか?
  • RQ5性別化された形容詞の追加が、新たなバイアスを生じさせても、全体的な性別バイアスを逆に低下させることがあるのか?

主な発見

  • 形容詞はNMTシステムにおける性別バイアスに顕著な影響を与える。両方の性別の形容詞が翻訳を女性性にずらすが、女性性の形容詞の方が強い影響を持つ。
  • DeepL翻訳は3つのシステムの中で最も低い性別バイアスを示し、男性と女性の代名詞を含む文における%TCGの差が最小であった。
  • Google翻訳は全体的に男性翻訳への好意が強く、特に動詞を含む文ではMicrosoft翻訳よりも性能が悪かった。
  • 全体的なバイアスが存在する中で、性別化された形容詞の追加により、女性代名詞を含む文の翻訳正答率が向上し、性別正答率のギャップが縮小した。
  • 動詞の性別バイアスへの影響は形容詞ほど大きくなく、DeepLとMicrosoft翻訳では有意に影響を及ぼすが、Google翻訳では顕著でなかった。
  • 本研究では、パラドックス的な効果が明らかになった。形容詞が女性性の翻訳を生じやすくする一方で、女性参照の正答率を向上させることで、システム全体の性別差別を緩和する効果も示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。