Skip to main content
QUICK REVIEW

[論文レビュー] Harms of Gender Exclusivity and Challenges in Non-Binary Representation in Language Technologies

Sunipa Dev, Masoud Monajatipoor|arXiv (Cornell University)|Aug 27, 2021
Natural Language Processing Techniques参考文献 38被引用数 4
ひとこと要約

本稿は、NLPシステムにおける偏見の表現によって、ジェンダーに排他的な言語モデルが非連携アイデンティティを抹消する仕組みを調査する。非バイナリー個人のアンケート調査とGloVeおよびBERT埋め込みの分析を通じて、データセットおよびモデルにおけるバイナリー・ジェンダーの仮定が、誤称呼や低代表化を引き起こすことを示している。BERTは単数の「they」の分離表現を示すが、依然としてプロンプト関連タスクを通じてバイアスを拡散している。

ABSTRACT

Gender is widely discussed in the context of language tasks and when examining the stereotypes propagated by language models. However, current discussions primarily treat gender as binary, which can perpetuate harms such as the cyclical erasure of non-binary gender identities. These harms are driven by model and dataset biases, which are consequences of the non-recognition and lack of understanding of non-binary genders in society. In this paper, we explain the complexity of gender and language around it, and survey non-binary persons to understand harms associated with the treatment of gender as binary in English language technologies. We also detail how current language representations (e.g., GloVe, BERT) capture and perpetuate these harms and related challenges that need to be acknowledged and addressed for representations to equitably encode gender information.

研究の動機と目的

  • 言語技術におけるジェンダーをバイナリーとみなすことが、特に非バイナリー個人に与える害を調査すること。
  • モデルおよびデータセットのバイアスが、NLPシステムにおける非バイナリー人の抹消および誤称呼をどのように継続的に生じさせているかを理解すること。
  • 静的(GloVe)および文脈的(BERT)埋め込みが、非バイナリー・ジェンダー表現の問題をどのようにエンコード・拡散しているかを分析すること。
  • 言語モデルが文脈において単数の「they」と複数の「they」をどの程度区別できるか、そしてその区別が誤称呼に与える影響を評価すること。

提案手法

  • AIに精通した非バイナリー個人を対象に、ジェンダー表現に関連するNLPタスクにおける認識された害を特定するためのアンケートを実施した。
  • BERT評価のため、単数の「they」、「he」、「she」、および複数の「they」を含む文のバランスの取れた手動アノテーション済みデータセットを収集・分析した。
  • 語彙的類似度およびバイアスの測定に、コサイン類似度とWEATスコアを用いた。
  • マスキングされたプロンプト予測タスクにBERTを適用し、単数の「they」の表現が複数の「they」とおよびバイナリー・プロンプトから区別可能かどうかを評価した。
  • マスキングされたプロンプトを用いた標準化された文のテンプレートを通じて誤称呼を評価し、異なるジェンダーのプロンプトに対するモデル予測を測定した。
  • GloVeおよびBERTを用いて埋め込み空間を分析し、非バイナリー関連語の表現品質の格差を検出した。

実験結果

リサーチクエスチョン

  • RQ1BERTやGloVeのような現在の言語モデルは、『they』や『xe』のような非バイナリー・プロンプトをどの程度誤って表現するか、または表現できないか。
  • RQ2トレーニングデータおよびモデルアーキテクチャのバイアスが、NLPシステムにおける非バイナリー・アイデンティティの循環的抹消をどのように引き起こすか。
  • RQ3BERTは文脈において単数の「they」と複数の「they」を区別できるか。そして、その区別が誤称呼の結果に影響を与えるか。
  • RQ4非バイナリー抹消を引き起こす下流NLPタスクにおける、語彙埋め込みの具体的な表現格差は何か。
  • RQ5非バイナリー個人は、現実世界の応用においてバイナリー・ジェンダー言語技術の害をどのように認識しているか。

主な発見

  • BERTモデルは、単数の「they」と複数の「they」の表現において顕著に低い類似度を示しており、区別可能な能力は示しているが、下流タスクにおいて依然としてバイアスを示している。
  • バイナリー・プロンプトと非バイナリー・プロンプトのWEATスコアは0.2であり、測定可能なが弱いバイアスを示している。一方、バイナリー語と非バイナリー代理語のスコアは0.718に達し、強い語彙的分離が示された。
  • 『they』(単数)と『he』/『she』間のコサイン類似度はそれぞれ0.395および0.390であり、『them』との類似度は0.389であった。これは、非バイナリー・プロンプトが複数のプロンプトと明確に区別されていないことを示している。
  • 『xe』、『xem』、『zir』などの非バイナリー・プロンプトは、バイナリー・プロンプトと比較して負またはほぼゼロの類似度を示しており、既存の埋め込み空間への統合が不十分であることを示している。
  • BERT分類器は、単数の「they」と複数の「they」を区別する際、83.3%の正確度を達成したが、混同行列からは文脈が曖昧な場合に依然として誤分類が頻発していることが判明した。
  • アンケート結果から、非バイナリー個人はNLPシステムで頻繁に誤称呼や抹消を経験しており、多くの人が現在のモデルが自らのジェンダー・アイデンティティを認識または尊重していないと報告した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。