Skip to main content
QUICK REVIEW

[論文レビュー] Gender Bias in Text: Labeled Datasets and Lexicons

Jad Doughman, Wael Khreich|arXiv (Cornell University)|Jan 21, 2022
Gender Studies in Language被引用数 4
ひとこと要約

本論文は、英語のテキストにおけるジェンダー言及バイアスを検出するための、公開可能でラベル付きのデータセットおよび語彙リストを紹介する。本研究では、4つのバイアス亜タイプ(一般的な彼、一般的な彼女、性別の明示的表記、ジェンダー化された新語)を含む強化された分類法を用いる。著者らは、自動データ取得、高信頼性の人事者間評価(クリッペンドルフのアルファ = 0.75)およびワード埋め込みベースの語彙拡張を組み合わせたハイブリッド手法を採用し、監視ありおよび非監視ありのNLPモデルがジェンダー言及バイアスを検出し、緩和できるリソースを構築した。

ABSTRACT

Language has a profound impact on our thoughts, perceptions, and conceptions of gender roles. Gender-inclusive language is, therefore, a key tool to promote social inclusion and contribute to achieving gender equality. Consequently, detecting and mitigating gender bias in texts is instrumental in halting its propagation and societal implications. However, there is a lack of gender bias datasets and lexicons for automating the detection of gender bias using supervised and unsupervised machine learning (ML) and natural language processing (NLP) techniques. Therefore, the main contribution of this work is to publicly provide labeled datasets and exhaustive lexicons by collecting, annotating, and augmenting relevant sentences to facilitate the detection of gender bias in English text. Towards this end, we present an updated version of our previously proposed taxonomy by re-formalizing its structure, adding a new bias type, and mapping each bias subtype to an appropriate detection methodology. The released datasets and lexicons span multiple bias subtypes including: Generic He, Generic She, Explicit Marking of Sex, and Gendered Neologisms. We leveraged the use of word embedding models to further augment the collected lexicons.

研究の動機と目的

  • 英語のテキストにおけるジェンダー言及バイアスを検出するための代表的でラベル付きのデータセットおよび語彙リストの不足に対処すること。
  • 既存のジェンダー言及バイアス分類法を改善し、構造を再形式化し、新たなバイアスタイプ(ジェンダー化された新語)を追加し、亜タイプを自動検出手法にマッピングすること。
  • 機械学習およびNLPベースのジェンダー言及バイアス検出を支援するため、多様で代表的な文および語の収集、ラベル付け、拡張を行うこと。
  • テキストコンテンツにおけるジェンダー言及バイアスの自動検出および緩和を可能にする、公開可能なリソースを提供すること。
  • クリッペンドルフのアルファを用いた検証を通じて、バイアスラベル付けにおける人事者間信頼性を向上させること。

提案手法

  • 特定のバイアス亜タイプを標的とする情報検索およびフィルタリング技術を用いて、バイアスを含む可能性のある文を取得した。
  • 9名の大学院レベルのラベラーが、洗練された分類法および例示ラベルに基づいて文をラベル付けし、明確さと一貫性を確保した。
  • 人事者間信頼性の検証として、クリッペンドルフのアルファ(0.75)を計算し、ラベル付け基準の共有理解を保証した。
  • 都市辞書(Urban Dictionary)からジェンダー排他的な部分文字列(例:「man」)を含む語をフィルタリングし、コミュニティによる承認を受けるために最低100件の賛成票を要件として、ジェンダー化された新語を収集した。
  • 定義に基づき手作業で最終的な500語を排他的であるとラベル付けし、関連性およびバイアス検出の正確性を保証した。
  • ワード埋め込みモデルを用いて語彙リストを拡張し、NLPパイプラインにおけるカバー範囲および検出性能を向上させた。

実験結果

リサーチクエスチョン

  • RQ1ジェンダー言及バイアス亜タイプの包括的かつ構造的な分類法を、NLPにおける自動検出を支援する形で形式化するにはどうすればよいか?
  • RQ2テキストにおける多様なジェンダー言及バイアス形式をラベル付ける際の人事者間信頼性はどの程度か?
  • RQ3新しく造られた偏見を含む語(ジェンダー化された新語)を、ユーザ生成コンテンツから体系的に特定および抽出するにはどうすればよいか?
  • RQ4ワード埋め込みモデルは、ジェンダー言及バイアス語彙リストのカバー範囲および耐性をどの程度向上させられるか?
  • RQ5高品質で代表的かつ公開可能なデータセットを、ジェンダー言及バイアス検出に適した方法論的パイプラインとしてどのように構築できるか?

主な発見

  • ラベル付けプロセスの人事者間信頼性は、クリッペンドルフのアルファスコア0.75により確認され、強い合意とラベル付け基準の明確さを示した。
  • 最終的なデータセットには、ジェンダー排他的な部分文字列および最低100件の賛成票というコミュニティ承認基準を満たすフィルタリングを経て、都市辞書から抽出された500語の手作業ラベル付きジェンダー化された新語が含まれている。
  • 著者らは、4つのジェンダー言及バイアス亜タイプ(一般的な彼、一般的な彼女、性別の明示的表記、ジェンダー化された新語)にわたる代表的な文を収集・ラベル付けした。
  • ワード埋め込みモデルの使用により、語彙リストの効果的な拡張が可能になり、下流のNLPタスクにおけるカバー範囲が向上した。
  • 本研究では、英語のテキストにおけるジェンダー言及バイアス検出における重要なリソースの欠落を埋める、公開可能なラベル付きデータセットおよび包括的な語彙リストを生成した。
  • 改善された分類法には、再構成された亜タイプと検出手法のマッピングを伴い、新たに「ジェンダー化された新語」というバイアスタイプが追加された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。