Skip to main content
QUICK REVIEW

[論文レビュー] Indian-BhED: A Dataset for Measuring India-Centric Biases in Large Language Models

Khyati Khandelwal, Manuel Tonneau|arXiv (Cornell University)|Sep 15, 2023
Topic Modeling参考文献 61被引用数 4
ひとこと要約

この論文は、インドの文脈における大規模言語モデル(LLM)の caste(種姓)および宗教に基づくバイアスを評価するための新規データセット、Indian-BhED を紹介する。インドにおけるほとんどのLLMは、米国と比較して、とりわけ弱い立場にあるグループに対して顕著に強いステレオタイプ的バイアスを示していることが判明した。また、GPT-3.5では、指示プロンプティング(instruction prompting)がそのようなバイアスを効果的に低減できることを示している。

ABSTRACT

Large Language Models (LLMs), now used daily by millions, can encode societal biases, exposing their users to representational harms. A large body of scholarship on LLM bias exists but it predominantly adopts a Western-centric frame and attends comparatively less to bias levels and potential harms in the Global South. In this paper, we quantify stereotypical bias in popular LLMs according to an Indian-centric frame through Indian-BhED, a first of its kind dataset, containing stereotypical and anti-stereotypical examples in the context of caste and religious stereotypes in India. We find that the majority of LLMs tested have a strong propensity to output stereotypes in the Indian context, especially when compared to axes of bias traditionally studied in the Western context, such as gender and race. Notably, we find that GPT-2, GPT-2 Large, and GPT 3.5 have a particularly high propensity for preferring stereotypical outputs as a percent of all sentences for the axes of caste (63-79%) and religion (69-72%). We finally investigate potential causes for such harmful behaviour in LLMs, and posit intervention techniques to reduce both stereotypical and anti-stereotypical biases. The findings of this work highlight the need for including more diverse voices when researching fairness in AI and evaluating LLMs.

研究の動機と目的

  • 非西洋的、特にインドの文化的・社会的文脈におけるLLMバイアスの評価フレームワークの不足に取り組むこと。
  • インド(種姓および宗教)と西洋(性別および人種)の文脈におけるLLMのステレオタイプ的バイアスのレベルを定量化および比較すること。
  • 指示プロンプティングがインド中心のLLM評価においてバイアスを緩和できるかどうかを調査すること。
  • 既存のLLMバイアス研究および評価において、グローバルサウスの視点が著しく欠落していることを浮き彫りにすること。

提案手法

  • インドにおける種姓および宗教に関するステレオタイプ的および反ステレオタイプ的英語プロンプトを含む、新規のデータセットであるIndian-BhEDを開発した。
  • CrowS-Pairsのサブセットと組み合わせて、米国中心のバイアス(性別および人種)を測定した。
  • モデルの応答がステレオタイプ的対と反ステレオタイプ的対の間でどのように異なるかを、対数尤度スコアを用いて比較した。
  • エンコーダー型およびデコーダー型の両方のLLM、すなわちLLaMA-2、BERT、GPT-3.5を評価した。
  • バイアス低減戦略として、入力プロンプトを変更することで指示プロンプティングを適用した。
  • モデルおよび文脈ごとの比較分析を通じて、バイアス格差を測定した。

実験結果

リサーチクエスチョン

  • RQ1一般的なLLMは、インドにおける種姓および宗教に対するステレオタイプ的バイアスについて、西洋の文脈(性別および人種)と比較してどの程度のレベルで発現するか?
  • RQ2インド中心のLLM評価におけるバイアスの大きさと方向性は、米国中心の評価と比較してどうなっているか?
  • RQ3指示プロンプティングは、インド文脈におけるLLMのステレオタイプ的および反ステレオタイプ的バイアスの両方を効果的に低減できるか?
  • RQ4同じバイアス低減策が講じられているにもかかわらず、なぜインドの文脈でバイアスが強いのか?

主な発見

  • テストされたほとんどのLLMは、インドにおける種姓および宗教に対するステレオタイプ的バイアスが、米国における性別および人種に対するバイアスよりも顕著に強いことが、対数尤度差の観点から明らかになった。
  • LLaMA-2は、ダリットよりブラーマンに対して+4.34、ムスリムよりヒンズー教徒に対して+4.49の対数尤度差を示し、支配的グループへの強い傾向を示した。
  • GPT-3.5は、指示プロンプティングを用いることで、ステレオタイプ的および反ステレオタイプ的バイアスの両方を顕著に低減した。これは、この戦略が効果的であることを示している。
  • 微調整済みモデルを含む多様なモデルアーキテクチャを通じて、バイアス格差が継続的に見られる。これは、トレーニングデータまたはバイアス低減アプローチに根本的な差がある可能性を示唆している。
  • 本研究は、現在のバイアス評価フレームワークが、種姓に基づく階級制度を含め、グローバルサウスの文脈を十分に反映していないことを明らかにした。
  • 二項対比較アプローチにより、ブラーマンのような支配的種姓が評価で過剰に代表されるリスクがあり、公平性指標が歪められる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。