Skip to main content
QUICK REVIEW

[論文レビュー] CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models

Yufei Huang, Deyi Xiong|arXiv (Cornell University)|Jun 28, 2023
Computational and Text Analysis Methods被引用数 5
ひとこと要約

CBBQは、14の社会的次元にわたる110,000問以上の質問を含む、人間とAIが共同で構築した中国語のバイアスベンチマークデータセットであり、中国語の大規模言語モデルにおける社会的バイアスを検出することを目的としている。このデータセットはステレオタイプと矛盾する明確化された文脈を用い、モデルの回答と説明の両方を評価することで、全10種のテスト済み中国語LLMに顕著なバイアスが存在することを明らかにした。特に教育、障害、外見に関する分野では50%を超えるスコアを示した。

ABSTRACT

Holistically measuring societal biases of large language models is crucial for detecting and reducing ethical risks in highly capable AI models. In this work, we present a Chinese Bias Benchmark dataset that consists of over 100K questions jointly constructed by human experts and generative language models, covering stereotypes and societal biases in 14 social dimensions related to Chinese culture and values. The curation process contains 4 essential steps: bias identification via extensive literature review, ambiguous context generation, AI-assisted disambiguous context generation, snd manual review \& recomposition. The testing instances in the dataset are automatically derived from 3K+ high-quality templates manually authored with stringent quality control. The dataset exhibits wide coverage and high diversity. Extensive experiments demonstrate the effectiveness of the dataset in detecting model bias, with all 10 publicly available Chinese large language models exhibiting strong bias in certain categories. Additionally, we observe from our experiments that fine-tuned models could, to a certain extent, heed instructions and avoid generating outputs that are morally harmful in some types, in the way of "moral self-correction". Our dataset and results are publicly available at \href{https://github.com/YFHuangxxxx/CBBQ}{https://github.com/YFHuangxxxx/CBBQ}, offering debiasing research opportunities to a widened community.

研究の動機と目的

  • 中国語の大規模言語モデルに対する文化的に根ざした包括的なバイアス評価ツールの不足に対処すること。
  • 英語中心で文化的なニュアンスに欠ける既存のベンチマーク(例:BBQ)の限界を克服すること。
  • 現実の中国社会におけるステレオタイプを反映した、スケーラブルで多様性に富み、高品質なデータセットの開発。
  • 人間の専門知識とLLM生成を組み合わせることで、強固で多次元的なバイアス検出を可能にすること。
  • モデルの回答と推論の説明の両方を評価する標準化された評価フレームワークの提供。

提案手法

  • データセットは4段階のプロセスで構築された:文献レビューによるバイアスの特定、曖昧な文脈の生成、LLMを用いたAI支援による明確化、および手動によるレビューと再構成。
  • 明確化された文脈は、有害な社会的ステレオタイプと矛盾する背景情報のみを追加することで作成され、文脈的に公正なシナリオを保証する。
  • 多様で現実的で高品質なテストインスタンスを生成するため、厳格な品質管理のもとで3,000個以上の高品質テンプレートを手作業で作成。
  • モデルの評価には、正しい回答に加え、偏見のない説明が必須であり、完全に適合した場合にのみ非偏見とみなされる。
  • LLMの解釈能力と行動の一貫性の欠如を考慮した、改訂された評価プロトコルを採用。
  • 人間とAIの協働により、反復的フィードバックによって多様性とスケーラビリティを高めつつ、高品質を維持した。

実験結果

リサーチクエスチョン

  • RQ1中国語の大規模言語モデルは、文化的に根ざした多次元バイアスベンチマークでどの程度のパフォーマンスを示すか?
  • RQ2推論の理由を説明するよう促された際、LLMはどの程度「道徳的自己是正」を示せるか?
  • RQ3回答のみの評価と比較して、説明生成を評価に組み込むことで、モデルバイアスの検出はどの程度向上するか?
  • RQ4教育、障害、外見などの分野におけるバイアス感受性について、異なる中国語LLMはどのように比較できるか?
  • RQ5AI支援によるデータキュレーションは、文化的・倫理的整合性を保ちつつ、高品質なバイアスベンチマークのスケーリングを効果的に可能にするか?

主な発見

  • テストされた10種の公開済み中国語LLMすべてに顕著なバイアスが認められ、教育水準、疾患、障害、外見などの主要分野でバイアススコアが50%を超えた。
  • GPT-3.5-turboは全モデルの中で最も低いバイアススコアを示し、公平性の原則に強く適合している可能性を示唆した。
  • 微調整済みモデルは「道徳的自己是正」の兆候を示し、回答の正当性を説明するよう求められると有害な出力を減少させた。
  • 評価に説明生成を組み込むことで、回答のみの評価では見えなかったバイアスの推論的不一致を顕在化し、バイアス検出の精度が著しく向上した。
  • 人間とAIの協働パイプラインにより、中国社会に強く関連した110,000件を超える多様で高品質なインスタンスが成功裏に生成された。
  • ベンチマークは、モデルが公平であるよう促されても、特に医療や教育といった感受性の高い分野で、性別やステレオタイプに基づく仮定に依存していることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。