[論文レビュー] Building Socio-culturally Inclusive Stereotype Resources with Community Engagement
本論文は、コミュニティ参加型の手法を用いて作成された、インドを対象とした社会的・文化的に包摂的なステレオタイプリソース「SPICE」を提案する。多様な参加者を対象としたオープンエンドのアンケートを通じて、種族、地域、宗教などのアイデンティティ軸に沿った、2,000件を超える文脈特化型ステレオタイプを収集した。この手法により、西洋中心のデータセットに比べて顕著に表現の多様性が向上し、英語言語モデルにおけるステレオタイプ的バイアスの検出をより正確に行えるようになる。
With rapid development and deployment of generative language models in global settings, there is an urgent need to also scale our measurements of harm, not just in the number and types of harms covered, but also how well they account for local cultural contexts, including marginalized identities and the social biases experienced by them. Current evaluation paradigms are limited in their abilities to address this, as they are not representative of diverse, locally situated but global, socio-cultural perspectives. It is imperative that our evaluation resources are enhanced and calibrated by including people and experiences from different cultures and societies worldwide, in order to prevent gross underestimations or skews in measurements of harm. In this work, we demonstrate a socio-culturally aware expansion of evaluation resources in the Indian societal context, specifically for the harm of stereotyping. We devise a community engaged effort to build a resource which contains stereotypes for axes of disparity that are uniquely present in India. The resultant resource increases the number of stereotypes known for and in the Indian context by over 1000 stereotypes across many unique identities. We also demonstrate the utility and effectiveness of such expanded resources for evaluations of language models. CONTENT WARNING: This paper contains examples of stereotypes that may be offensive.
研究の動機と目的
- グローバルなAIセーフティ研究において、社会的・文化的に代表されないステレオタイプ評価リソースの不足に対処すること。
- 既存のステレオタイプデータセットに見られる西洋中心のバイアスや研究者中心の世界観を是正すること。
- ステレオタイプリソース作成において、インド社会のマイノリティのアイデンティティや現地に根ざした視点を統合すること。
- コミュニティ参加型のデータ収集が、生成言語モデルにおける有害性評価の向上にどのように寄与できるかを示すこと。
- インドを越えて他の文化的文脈にも適用可能なスケーラブルで包摂的なメソドロジーを構築すること。
提案手法
- インドの多様な参加者を対象としたオープンエンドでコミュニティ主導のアンケートを実施し、自由記述形式のステレオタイプ記述を収集する。
- インドに特有のアイデンティティ軸、すなわち種族、地方的出自、宗教、性別に焦点を当てる。
- 参加者からの回答から2,000件を超えるステレオタイプを統合・キュ레이ションし、差別的・中傷的属性に特に注意を払う。
- 得られたSPICEデータセットを用いて、英語言語モデルにおけるステレオタイプ的関連性を評価する。
- コミュニティの知見とモデル評価を組み合わせた混合手法を用い、リソースの有効性を検証する。
- 言語的・運用上の制約のため、データ収集を英語表現に限定するが、将来的な多言語拡張の必要性を認識する。
実験結果
リサーチクエスチョン
- RQ1グローバルサウスの文化的・社会的視点を、ステレオタイプ評価リソースにどのように統合できるか。
- RQ2インドのような非西洋的文脈において、既存のステレオタイプデータセットがどの程度、現地に根ざしたバイアスを反映していないか。
- RQ3コミュニティ参加型のオープンエンドデータ収集は、研究者主導やLLM生成手法に比べ、より包括的かつ代表的なステレオタイプリソースを生み出せるか。
- RQ4SPICEデータセットは、英語での大規模言語モデルが行うステレオタイプ的推論をどの程度効果的に検出できるか。
- RQ5コミュニティベースのデータ収集には、社会的ステレオタイプの全範囲を捉えるという限界があるか。
主な発見
- SPICEデータセットには、インドの社会的・文化的文脈に特化した2,000件を超えるステレオタイプが含まれており、既存のリソースを顕著に拡張している。
- 種族(例:「バングィ」、「不可触」)、地域的アイデンティティ(例:「ハリヤニ」、「ビハール」)、宗教(例:「ムスリム」、「ジャット」)に関連する、従来のリソースで不足していたステレオタイプが同データセットに反映されている。
- 「ギャングスター」「犯罪者」「貧乏」といった差別的属性が、特定の地域的・種族的アイデンティティと結びつけられており、制度的差別の反映である。
- 「カーロ」(暗い肌)や「チンク」(人種差別的スラング)といった、皮膚の色や人種差別的表現がインドの言語的議論において広く存在し、文脈的に強い意味を持つことが判明した。
- 言語モデルがこれらのステレオタイプを再現または反映していることが確認され、本データセットがモデル行動の評価に有効であることが裏付けられた。
- 広範なカバーを実現しているものの、サンプリングの制限やステレオタイプ認識の主観性のため、本データセットは完全ではない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。