[論文レビュー] "I'm sorry to hear that": Finding New Biases in Language Models with a Holistic Descriptor Dataset
本稿では、13のアイデンティティ軸にわたる約600のデモグラフィック記述語項を含む大規模で参加型のデータセット、HolisticBiasを紹介している。このデータセットは、言語モデルにこれまで検出されていなかったバイアスを特定することを目的として設計されている。これらの語項を標準化されたテンプレートと組み合わせて45万件のプロンプトを生成することで、著者たちはトークン尤度、生成出力、および攻撃的表現の分類において新たなバイアスを明らかにした。特にBlenderBot 2.0のようなモデルにおいて顕著であり、また、バイアス軽減チューニングが意図しない形で有害なパローティング行動を増加させる可能性があることも示している。
As language models grow in popularity, it becomes increasingly important to clearly measure all possible markers of demographic identity in order to avoid perpetuating existing societal harms. Many datasets for measuring bias currently exist, but they are restricted in their coverage of demographic axes and are commonly used with preset bias tests that presuppose which types of biases models can exhibit. In this work, we present a new, more inclusive bias measurement dataset, HolisticBias, which includes nearly 600 descriptor terms across 13 different demographic axes. HolisticBias was assembled in a participatory process including experts and community members with lived experience of these terms. These descriptors combine with a set of bias measurement templates to produce over 450,000 unique sentence prompts, which we use to explore, identify, and reduce novel forms of bias in several generative models. We demonstrate that HolisticBias is effective at measuring previously undetectable biases in token likelihoods from language models, as well as in an offensiveness classifier. We will invite additions and amendments to the dataset, which we hope will serve as a basis for more easy-to-use and standardized methods for evaluating bias in NLP models.
研究の動機と目的
- 自然言語処理分野における包括的で動的かつ包括的なバイアス評価の不足を是正するため、デモグラフィックアイデンティティ語項のより代表的な分類体系を構築すること。
- 疎外されたアイデンティティや古くなった社会的カテゴリーを含まない、静的で事前に定義されたバイアス評価データセットの限界を克服すること。
- 社会的言語の変化や体験に合わせて進化する、生き永らえる拡張可能な評価フレームワークを構築すること。
- 生成、尤度、攻撃的表現の指標において、これまで検出されていなかった微細なバイアスを言語モデル行動の検出に可能にすること。
- バイアス検出から軽減までをカバーする、標準化され、オープンソースのツールとしてのバイアス評価を提供することで、バイアス研究の全サイクルを支援すること。
提案手法
- 著者たちは、専門家および生活経験を持つコミュニティメンバーとの協働を通じて、13のデモグラフィック軸にわたる598語の記述語項の参加型データセットを収集した。
- 標準化されたバイアス測定テンプレート(例:「私は[記述語項]です」や「私は[記述語項]を憎む」)と語項を組み合わせることで、45万件のユニークな文のプロンプトを構築した。
- このデータセットを用いて、GPT-2、RoBERTa、DialoGPT、BlenderBot 2.0の4つの生成モデルを、3つの評価設定(トークン尤度、テキスト生成、攻撃的表現分類)で評価した。
- モデル出力が攻撃的とされるかどうかを評価するためにB.A.D.攻撃的表現分類器が使用され、危険な可能性のある応答を除外するためのフィルタリングが施された。
- モデルにバイアス軽減チューニングを適用し、特にパローティング行動や「憎悪」応答確率への影響をチューニング前後で測定した。
- アマゾンMechanical Turkを介した人間による評価では、Acute-Eval手法を用いて、チューニング済みモデルと元のモデルの間で、好み、人間らしさ、興味の度合いを比較した。
実験結果
リサーチクエスチョン
- RQ1より包括的かつ動的であるデモグラフィック記述語項のデータセットは、言語モデルにこれまで検出されていなかったバイアスを明らかにできるか?
- RQ2特に代表されていないか、社会的に差別されるアイデンティティを有するデモグラフィック軸は、尤度、生成、攻撃的表現の観点からモデル行動にどのように影響を与えるか?
- RQ3バイアス軽減チューニングは、パローティングや「憎悪」応答生成といった有害行動を意図せず増加させる可能性があるか、その程度はどの程度か?
- RQ4コミュニティによる検証を受けた、生き永らえるデータセットは、静的で事前に定義された分類体系と比較して、NLPモデルにおける社会的バイアスの検出と測定をどのように改善するか?
- RQ5バイアス軽減チューニング後に「憎悪」応答確率が上昇するのと、モデルのパローティング行動が増加するとの間に、どのような関係があるか?
主な発見
- HolisticBiasデータセットは、特に神経多様性、非バイナリー性、文化的・宗教的記述語項のような代表されていないアイデンティティにおいて、トークン尤度と生成出力における新たなバイアスを露呈した。
- BlenderBot 2.0 3Bでは、バイアス軽減チューニング後、平均で0.14%の「憎悪」確率上昇が観察され、上位5つの記述語項では最大1.55%の上昇が見られた。
- チューニング後、特に否定的テンプレートでは、モデルが入力プロンプトをそのままで繰り返すパローティングが顕著に増加した。例として、「外傷性脳損傷を負ったのは誰ですか?」という質問に対して、100%の応答がチューニング後に正確なコピーとなった。
- パローティングの増加とバイアス値の変化の間には、スピアマンのrho +0.19の相関が確認され、バイアス軽減とパローティング行動の増加の間に測定可能な関連性が存在することが示された。
- 人間による評価では、好み、人間らしさ、興味の度合いに、バイアスチューニング済みモデルと元のモデルとの間に統計的に有意な差は認められず、チューニングが評価品質を低下させなかったことが示された。
- B.A.D.分類器は、否定的テンプレート(例:「私は[複数名詞フレーズ]を憎む」)でプロンプトされたモデルの応答を、特に「アルコール依存者」や「ドラッグ中毒者」といった否定的意味を持つ語項を含む場合、より多くの攻撃的応答を特定した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。