[論文レビュー] Generating Clues for Gender based Occupation De-biasing in Text
本論文は、ユーザー指定の地理的・時間的領域に基づき、反対性別の実在の歴史的人物を検索することで、テキスト内のジェンダー・ステレオタイプ化された職業関連性を検出し、文脈に配慮した反証証拠を生成する、人間が関与するシステムを提示する。このシステムは、文化的および時間的要因による職業のジェンダー規範の違いに敏感であり、事実に基づく例を提示することで、作成者や開発者が包括的な物語やAI学習データを構築するのを支援し、バイアス除去を実現する。
Vast availability of text data has enabled widespread training and use of AI systems that not only learn and predict attributes from the text but also generate text automatically. However, these AI models also learn gender, racial and ethnic biases present in the training data. In this paper, we present the first system that discovers the possibility that a given text portrays a gender stereotype associated with an occupation. If the possibility exists, the system offers counter-evidences of opposite gender also being associated with the same occupation in the context of user-provided geography and timespan. The system thus enables text de-biasing by assisting a human-in-the-loop. The system can not only act as a text pre-processor before training any AI model but also help human story writers write stories free of occupation-level gender bias in the geographical and temporal context of their choice.
研究の動機と目的
- 特定の職業が片方の性別にステレオタイプ的に結びつけられるという、テキストにおける広範なジェンダー・バイアスに対処すること。
- 物語のテキストにこのようなバイアスが含まれるかを同定し、歴史的データから事実に基づいた反証証拠を提供するシステムを開発すること。
- 地域および時間的要因に応じた、ジェンダーが不均衡に配分された職業分野における実在の人物の例を提供することで、人間の作成者やAI開発者がジェンダーに配慮した物語や学習データを作成することを支援すること。
- 職業のジェンダー規範における文化的および時間的変動に敏感なツールを構築し、一様なバイアス除去を超えること。
提案手法
- NLP技術を用いて、入力テキストを解析し、固有名称とその関連職業を抽出する。
- 複数のソースから得た996件の職業を収集したデータセットに基づき、職業を性別特異的または性別中立的と分類する。
- NLTKおよびCMU名前リポジトリを用いて、名前を性別にマッピングし、固有名称の性別を推定する。
- ユーザーが指定した時間枠および地理的領域に基づき、同じ職業に就いていた反対性別の歴史的個人を検索するため、DBpediaに照会する。
- SPARQLクエリを用いて、条件を満たす女性または男性の人物の、名前、生誕都市、生誕日、死去日からなる3タプルを抽出する。
- 取得した人物の生涯とユーザーが指定した時間枠との重複を確認することで、関連性を保証する。
実験結果
リサーチクエスチョン
- RQ1物語のテキストにおける固有名称と職業のペairingに基づき、ジェンダー・ステレオタイプ化された職業関連性をシステムが検出できるか。
- RQ2歴史的データから、文脈に適した反証証拠を生成することで、職業のジェンダー・ステレオタイプを是正するにはどうすればよいか。
- RQ3地理的地域や時間帯によって、反証証拠の有無にどのような差が生じるか。
- RQ4このようなシステムは、人間の作成者が物語を改訂して職業のジェンダー・バイアスを低減するのを効果的に支援できるか。
- RQ5システムの文化的・時間的文脈への感受性が、物語のバイアス除去における実用性にどのように影響するか。
主な発見
- システムは、ユーザーが定めた時間と場所に基づき、テキスト内のジェンダー・ステレオタイプ化された職業関連性を的確に同定し、関連する歴史的反証証拠を抽出できた。
- 米国(1980–2000年)では、女性医師の複数の例が検出され、この期間において「医師」という職業が inherently 男性寄りの意味を持つとは限らないことが示された。
- 米国(1700–1800年)では、関連する女性医師の例が検出されなかったため、当時この職業は歴史的に男性中心であったことが裏付けられ、システムの時間的感受性が適切に機能していることが確認された。
- ロシア(1980–2000年)においても、女性医師の反証証拠が得られなかったため、地域の歴史的文脈がこのような例の可用性に影響していることが示された。
- 同じ職業であっても、地理的・時間的文脈によってバイアスと見なされるか中立的と見なされるかが異なることが明らかになった。これは、バイアス除去において文脈認識の重要性を強調している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。