Skip to main content
QUICK REVIEW

[論文レビュー] Counterfactual Data Augmentation for Mitigating Gender Stereotypes in Languages with Rich Morphology

Ran Zmigrod, Sebastian J. Mielke|arXiv (Cornell University)|Jun 11, 2019
Natural Language Processing Techniques参考文献 23被引用数 10
ひとこと要約

本稿では、スペイン語やHebrewなどの屈曲語彙的言語において文法的正しさを保ちながらジェンダーのステレオタイプを軽減する、マルコフ確率場(MRF)に基づく反事後的データ拡張手法を提案する。動詞や形容詞、冠詞などの語の品詞的・屈曲的一致ルールを推論・適用することで、スペイン語では90%、ヘブライ語では87%の形態レベルの正確性を達成し、ジェンダーのステレオタイプを平均で2.5倍低減した。文法的正しさに妥協をきたさない。

ABSTRACT

Gender stereotypes are manifest in most of the world's languages and are consequently propagated or amplified by NLP systems. Although research has focused on mitigating gender stereotypes in English, the approaches that are commonly employed produce ungrammatical sentences in morphologically rich languages. We present a novel approach for converting between masculine-inflected and feminine-inflected sentences in such languages. For Spanish and Hebrew, our approach achieves F1 scores of 82% and 73% at the level of tags and accuracies of 90% and 87% at the level of forms. By evaluating our approach using four different languages, we show that, on average, it reduces gender stereotyping by a factor of 2.5 without any sacrifice to grammaticality.

研究の動機と目的

  • 屈曲語彙的言語における性別一致を含むコーパスで学習されたNLPシステムにおけるジェンダーのステレオタイプを是正すること。
  • このような言語では単純な性別交換が文法的に不正となるため、その限界を克服すること。
  • 動詞の性別を変更する際、全文を自動的に再屈曲化する手法を開発すること。
  • 反事後的データ拡張の過程で、文法的正しさを保ちつつ意味的・構文的整合性を維持すること。
  • 複数の言語にわたって内在的・外在的評価を実施し、正確性とバイアス低減の両立を示すこと。

提案手法

  • 性別を変更する際の語彙的・構文的タグ変更を推論するために、任意のニューラルパrameterizationを備えたマルコフ確率場(MRF)を用いる。
  • 入力文から語彙的特徴(基本形、品詞、屈曲タグ)を抽出し、構造的予測モデルを適用して関連語すべての再屈曲化方法を決定する。
  • 文内の語の間の依存関係をモデル化することで語彙的一致を強制し、性別を示す冠詞、形容詞、動詞を一貫して更新する。
  • 4段階のパイプラインに従ってモデルを訓練・評価する:(1) 特徴抽出、(2) 目的語とその性別の固定、(3) 必要なタグ変更の推論、(4) 新しい形に基本形を再屈曲化する。
  • 性別交換された文のペアを生成することで反事後的データ拡張に応用し、文法的に妥当で意味的に整合性のある文を実現する。
  • 外在的評価ではニューラル言語モデルを用いてジェンダーのステレオタイプ低減を測定し、文法的正しさはテストフレーズにおける対数尤度スコアで評価する。

実験結果

リサーチクエスチョン

  • RQ1構造的予測モデルは、屈曲語彙的言語における文法的性別逆転に必要な語彙的・構文的タグ変更を効果的に推論できるか?
  • RQ2提案手法は、文法的に不正な文を生じさせることなく、ニューラル言語モデルにおけるジェンダーのステレオタイプを低減できるか?
  • RQ3MRFベースのアプローチは、単純な語の交換ベースラインと比較して、文法的正しさとバイアス低減の両面で優れているか?
  • RQ4スペイン語、ヘブライ語、イタリア語、フランス語のような豊富な屈曲的形態を持つ言語に、この手法はどの程度一般化可能か?
  • RQ5高い形態レベルの再屈曲化正確性を維持しつつ、顕著なジェンダーバイアス低減を達成できるか?

主な発見

  • スペイン語ではタグレベルで82%のF1スコア、形態レベルで90%の正確性を達成し、ヘブライ語ではF1スコア73%、正確性87%を達成した。
  • 4言語にわたって平均で2.5倍のジェンダーのステレオタイプ低減を達成し、イタリア語では1.2、スペイン語では5.0の低減率を示した。
  • 単純な交換より文法的正しさが保たれたり向上したりしており、ヘブライ語を除き、全言語でMRFアプローチがより高い文法的正しさスコアを示した。
  • スペイン語では、対数尤度ベースのバイアス測定において、交換ベースラインの6.2からMRFの2.0にジェンダーのステレオタイプが低下した一方、文法的正しさスコアは0.25(ベースライン)に対して4.05を維持した。
  • 内在的および外在的評価の両方で、単純な交換より優れた性能を示し、屈曲語彙的言語において文法的正しさとバイアス低減が両立可能であることを実証した。
  • 本手法は、言語的正しさを維持する構造的・文法的意識を持つ方法で、屈曲語彙的言語における性別交換データ拡張を初めて実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。