[论文解读] CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models
CBBQ 是一个由人类与 AI 共同构建的中文偏见基准数据集,包含超过 110,000 个问题,覆盖 14 个社会维度,旨在检测中文大语言模型中的社会偏见。该数据集采用可澄清的语境,其内容与刻板印象相矛盾,并通过答案和解释两方面评估模型,揭示了所有 10 个测试的中文大语言模型中均存在显著偏见,尤其在教育、残疾和外貌等类别中,偏见得分超过 50%。
Holistically measuring societal biases of large language models is crucial for detecting and reducing ethical risks in highly capable AI models. In this work, we present a Chinese Bias Benchmark dataset that consists of over 100K questions jointly constructed by human experts and generative language models, covering stereotypes and societal biases in 14 social dimensions related to Chinese culture and values. The curation process contains 4 essential steps: bias identification via extensive literature review, ambiguous context generation, AI-assisted disambiguous context generation, snd manual review \& recomposition. The testing instances in the dataset are automatically derived from 3K+ high-quality templates manually authored with stringent quality control. The dataset exhibits wide coverage and high diversity. Extensive experiments demonstrate the effectiveness of the dataset in detecting model bias, with all 10 publicly available Chinese large language models exhibiting strong bias in certain categories. Additionally, we observe from our experiments that fine-tuned models could, to a certain extent, heed instructions and avoid generating outputs that are morally harmful in some types, in the way of "moral self-correction". Our dataset and results are publicly available at \href{https://github.com/YFHuangxxxx/CBBQ}{https://github.com/YFHuangxxxx/CBBQ}, offering debiasing research opportunities to a widened community.
研究动机与目标
- 为解决中文大语言模型缺乏文化根基且全面的偏见评估工具的问题。
- 克服现有基准(如 BBQ)以英语为中心且缺乏文化细微差别的局限性。
- 开发一个可扩展、多样化且高质量的数据集,真实反映中国文化中的社会刻板印象。
- 通过结合人类专业知识与大语言模型生成,实现稳健的多维偏见检测。
- 提供一个标准化的评估框架,同时评估模型的答案与推理解释。
提出的方法
- 数据集通过四个阶段构建:文献综述以识别偏见、生成模糊语境、使用大语言模型辅助澄清语境,以及人工审查与重构。
- 通过仅添加与有害社会刻板印象相矛盾的背景信息,生成语境公平的澄清语境,确保语境公允。
- 手工编写高质量模板(3,000 个以上),并实施严格的质量控制,以生成多样化且真实的测试实例。
- 模型评估要求答案正确且解释无偏见,仅当完全符合要求时才计为无偏见。
- 基准采用修订后的评估协议,以考虑大语言模型的解释能力及其行为不一致性。
- 人类与 AI 协作通过迭代优化,提升了数据多样性与可扩展性,同时保持了高质量。
实验结果
研究问题
- RQ1中文大语言模型在基于文化背景的多维偏见基准上的表现如何?
- RQ2当被要求解释其推理过程时,大语言模型在多大程度上能表现出‘道德自我修正’?
- RQ3与仅评估答案相比,评估中加入解释生成如何提升对模型偏见的检测能力?
- RQ4不同中文大语言模型在教育、残疾和外貌等类别中的偏见易感性如何比较?
- RQ5AI 辅助的数据整理能否有效扩展高质量偏见基准的规模,同时保持文化与伦理的准确性?
主要发现
- 所有 10 个公开可用的中文大语言模型在测试中均表现出显著偏见,关键类别(如教育资格、疾病、残疾和外貌)的偏见得分超过 50%。
- GPT-3.5-turbo 在所有模型中表现出最低的偏见得分,表明其与公平原则的对齐程度更强。
- 微调后的模型显示出‘道德自我修正’的迹象,在被要求解释其答案时,有害输出有所减少。
- 在评估中加入解释生成显著提升了对偏见推理的检测能力,揭示了仅评估答案时无法察觉的不一致性。
- 人类与 AI 协作的流水线成功生成了超过 110,000 个多样化、高质量的实例,具有强烈的中国文化相关性。
- 该基准揭示,即使在被提示保持公平的情况下,模型仍常依赖性别化和刻板化的假设,尤其在医疗和教育等敏感领域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。