Skip to main content
QUICK REVIEW

[論文レビュー] KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large Language Model Application

Hwaran Lee, Seok‐Hee Hong|arXiv (Cornell University)|May 28, 2023
Topic Modeling被引用数 5
ひとこと要約

KoSBiは、15のカテゴリーにまたがる72のデモグラフィックグループを対象に、LLMによって生成されたデータを用い、人間によるアノテーションを加えた、34,214件のコンテキスト文ペアからなる韓国語の社会的バイアスデータセットである。KoSBi上で微調整された分類器を用いたフィルタリングベースのモデレーション手法により、HyperCLOVA(30Bおよび82B)およびGPT-3において、平均で16.47%の社会的バイアス低減が達成された。これは文化的・言語的に特異な文脈において、効果的なバイアス軽減が可能であることを示している。

ABSTRACT

Large language models (LLMs) learn not only natural text generation abilities but also social biases against different demographic groups from real-world data. This poses a critical risk when deploying LLM-based applications. Existing research and resources are not readily applicable in South Korea due to the differences in language and culture, both of which significantly affect the biases and targeted demographic groups. This limitation requires localized social bias datasets to ensure the safe and effective deployment of LLMs. To this end, we present KO SB I, a new social bias dataset of 34k pairs of contexts and sentences in Korean covering 72 demographic groups in 15 categories. We find that through filtering-based moderation, social biases in generated content can be reduced by 16.47%p on average for HyperCLOVA (30B and 82B), and GPT-3.

研究の動機と目的

  • 韓国における文化的・言語的に特異な社会的バイアスデータセットの不足に応えるため、既存のデータセットがデモグラフィック範囲や文化的関連性において限定的であることを踏まえて。
  • 韓国語の大規模言語モデル(LLM)における社会的バイアスの検出および軽減に役立つ包括的で現地特化型のリソースを構築すること。
  • 選別された人間によるアノテーション済みデータセット上で訓練されたフィルタリングベースのモデレーションシステムを用いて、LLM出力におけるバイアス軽減を効果的に行うこと。
  • 婚姻状態や地域的出自など、代表されないグループを含む文脈特有のデモグラフィックグループをカバーすることで、韓国におけるLLMアプリケーションの安全な展開を確保すること。

提案手法

  • 15のカテゴリーにまたがる72のデモグラフィックグループを対象に、コンテキスト・フォーカスドの少数ショットプロンプティングを用いてHyperCLOVAにより34,214件のコンテキスト文ペアを生成した。
  • 社会的バイアス(ステレオタイプ、偏見、差別など)に焦点を当てたデータ収集とキュレート作業を実施し、国際人権宣言および韓国人権委員会の指針に明確に整合させた。
  • クラウドワーカーを活用して、各コンテキストおよび文を「安全」または「安全でない」としてアノテートし、「安全でない」インスタンスはFiskeの分類法(ステレオタイプ、偏見、差別、その他)を用いてさらにラベル付けした。
  • KoSBiデータセット上で安全な文分類器を訓練し、推論段階でバイアスを含むコンテンツを特定するようにした。
  • 複数の候補応答を生成し、分類器の出力に基づいて最も安全なものを選択する「拒否サンプリング」を用いたフィルタリングベースのモデレーション戦略を実装した。
  • GPT-3およびHyperCLOVAモデルを用いて、1,746件の拡張済みテストコンテキストを対象に人間による評価を通じて、フィルタリングありとなしの生成結果を比較して、アプローチの有効性を検証した。
Figure 1: Example pairs of a context and a sentence with labels pertaining to a given social demographic category and group.
Figure 1: Example pairs of a context and a sentence with labels pertaining to a given social demographic category and group.

実験結果

リサーチクエスチョン

  • RQ1韓国語LLM向けの大規模かつ文化的に特化した社会的バイアスデータセットが、生成されたコンテンツにおけるバイアスを効果的に低減できるか?
  • RQ2KoSBiで訓練された分類器を用いたフィルタリングベースのモデレーションは、韓国語LLMにおける多様なデモグラフィックグループにわたり、どの程度社会的バイアスを低減できるか?
  • RQ3KoSBiをファインチューニングおよびフィルタリングリソースとして用いる場合、GPT-3やHyperCLOVA 30B/82Bといった異なるLLMアーキテクチャ間で、バイアス軽減のパフォーマンスにどのような差が生じるか?
  • RQ4地域的出自や婚姻状態といった代表されないデモグラフィックグループを含めることで、韓国におけるLLM出力の公平性と安全性が向上するか?
  • RQ5フィルタリングありとなしのLLM応答について、人間による評価で文の流暢さ、一貫性、関連性にどのような差が見られるか?

主な発見

  • KoSBiで訓練された分類器を用いたフィルタリングベースのモデレーションにより、HyperCLOVA(82B)、HyperCLOVA(30B)、GPT-3の全モデルで、平均して16.47%の社会的バイアス低減が達成された。
  • フィルタリング戦略は高い文の流暢さと一貫性を維持しており、GPT-3では文法的正しさが2.0%低下し、理解度も2.0%低下したにとどまった。
  • 人間による評価では、15のデモグラフィックカテゴリーすべてで安全性が向上し、特に「LGBTQ+」や「国内の出身地域」などのグループで最も高い安全性向上が観察された。
  • 最も優れた性能を示した分類器であるKcELECTRAは、テストセットにおいて不適切な文を識別する際、92.5%の正確度を達成し、未知のデータへの一般化能力が非常に高いことが示された。
  • 文脈の関連性と応答の質は維持されており、一貫性や適切さにわずかな低下しか生じず、安全性と有用性のトレードオフが最小限に抑えられた。
  • 地域的アイデンティティ(例:慶尙道、全羅道)を含む15のカテゴリーにまたがる72のデモグラフィックグループをカバーするデータセットにより、韓国における包括的かつ公平なバイアス軽減が可能になった。
Figure 2: Human evaluation on the subset of the test set. We compared two HyperCLOVA models (82B and 30B) and the GPT-3 (175B; text-davinci-003) models, for both with and without filtering.
Figure 2: Human evaluation on the subset of the test set. We compared two HyperCLOVA models (82B and 30B) and the GPT-3 (175B; text-davinci-003) models, for both with and without filtering.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。