[論文レビュー] GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models
本稿では、大規模言語モデル(LLM)におけるジェンダー偏見を低減するために設計された、公開可能な8,000サンプルのアライメントデータセットであるGenderAlignを紹介する。既存のデータセットや書籍からのシードテキストをもとに、GPT-3.5を用いてペairedな「選択された」(低偏見、高品質)および「除外された」(高偏見)応答を生成することで、作者らは、HH-RLHFなどの既存データセットと比較して、GenderAlignで微調整されたLLMが顕著にジェンダー偏見を低減することを示している。人間評価者およびLLM評価者による評価でも、GenderAlignで微調整されたモデルの出力が一貫して好まれている。
Large Language Models (LLMs) are prone to generating content that exhibits gender biases, raising significant ethical concerns. Alignment, the process of fine-tuning LLMs to better align with desired behaviors, is recognized as an effective approach to mitigate gender biases. Although proprietary LLMs have made significant strides in mitigating gender bias, their alignment datasets are not publicly available. The commonly used and publicly available alignment dataset, HH-RLHF, still exhibits gender bias to some extent. There is a lack of publicly available alignment datasets specifically designed to address gender bias. Hence, we developed a new dataset named GenderAlign, aiming at mitigating a comprehensive set of gender biases in LLMs. This dataset comprises 8k single-turn dialogues, each paired with a "chosen" and a "rejected" response. Compared to the "rejected" responses, the "chosen" responses demonstrate lower levels of gender bias and higher quality. Furthermore, we categorized the gender biases in the "rejected" responses of GenderAlign into 4 principal categories. The experimental results show the effectiveness of GenderAlign in reducing gender bias in LLMs.
研究の動機と目的
- LLMにおけるジェンダー偏見低減に特化した、公開可能なアライメントデータセットの不足に対処すること。
- 微調整用に、高品質で多様性に富み、体系的に分類されたジェンダー的偏見あり・なしの応答データセットを構築すること。
- 提案されたデータセットが、複数のLLMおよびベンチマークでジェンダー偏見を低減する効果を有するかを評価すること。
- 異なるデータソース(例:書籍、既存データセット)が、偏見低減性能に与える寄与を分析すること。
- ジェンダー平等に焦点を当てた、再現可能で自動化されたアライメントデータ生成パイプラインを提供すること。
提案手法
- データセットは、GPT-3.5を用いて、8,000件の単一ターン対話が生成され、それぞれに「選択された」応答(ジェンダーに偏見のない、高品質)と「除外された」応答(ジェンダーに偏見のある)が含まれる。
- ジェンダー関連トピックのためのシードテキストは、2つの既存データセット(CORGI-PM、Workplace-Sexism)およびジェンダーとジェンダー役割に関する5冊の書籍から収集された。
- 「選択された」応答は、対話の文脈に基づき、ジェンダー平等の原則に沿った応答を生成するようにGPT-3.5にプロンプトすることで生成された。
- 「除外された」応答は、文脈から「選択された」応答を除去した上で、偏りのないLLMに応答を生成させるようにプロンプトすることで生成され、偏見の発生確率が高くなるように設計された。
- 「除外された」応答に含まれるジェンダー的偏見は、4つの主要なタイプに分類された:ジェンダーのステレオタイプ、差別的言語、制度的セクシュアリズム、マイノリティジェンダーに対する偏見。
- データセットは、LLMジャッジ(GPT-3.5、Gemini-Pro、Claude-3-opus)および人間評価者を用いて評価され、好みの順位付けによって偏見低減の効果が評価された。

実験結果
リサーチクエスチョン
- RQ1自動化された、LLMによって生成されたアライメントデータセットは、HH-RLHFなどの既存の公開データセットと比較して、微調整されたLLMにおけるジェンダー偏見の低減に効果的であるか?
- RQ2書籍や既存データセットなどの異なるデータソースは、GenderAlignデータセットにおけるジェンダー偏見低減効果にどのように寄与しているか?
- RQ3GenderAlignで微調整したモデルは、BBQ や WinoGender といった標準ベンチマークで、どの程度ジェンダー偏見を低減するか?
- RQ4人間評価者とLLMジャッジは、GenderAlignで微調整されたモデルの出力と、他のアライメントデータセットで微調整されたモデルの出力のどちらを好むか?
- RQ5GPT-3.5による自動アノテーションは、データセットの脱偏見目的を損なう新たなバイアスを導入するのか?
主な発見
- GenderAlignで微調整されたモデルは、人間評価者に51.1%の割合で好まれ、Claude-3-opusでは65.8%の割合で好まれ、HH-RLHFやHarmlessデータセットで微調整されたモデルと比較して顕著に優れていた。
- GenderAlignで微調整されたLlama2-13Bモデルは、高い正確性を維持したまま、最も低いジェンダー偏見を示し、ベースモデルおよびHarmlessで微調整されたモデルよりもBBQベンチマークで優れた成績を収めた。
- 職業関連のステレオタイプにおけるジェンダー偏見の平均ピアソン積率相関係数は、GenderAlignで微調整されたモデルで最も低く、ステレオタイプ的なジェンダーと職業の関連性への適合度が低下していた。
- GenderAlignの書籍ベースまたはデータセットベースの構成要素のいずれかを除外すると、偏見低減性能が低下し、特にWorkplace-Sexism(CW)サブセットが書籍よりも効果的に寄与していた。
- 人間評価者間の一致度は高く(Fleiss’ Kappa = 0.655)、評価者間で一貫した傾向が見られ、GenderAlignで微調整されたモデルの出力が好まれていた。
- Harmlessデータセットは、アライメントを目的として設計されていたが、ジェンダー偏見を低減できず、一部のケースでは逆に偏見を増大させた。これは、既存のアライメントデータが偏見低減に限界を示していることを示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。