[论文解读] Towards Auditing Large Language Models: Improving Text-based Stereotype Detection
本文引入了一个包含52,751个实例的新多粒度刻板印象数据集,涵盖性别、种族、职业和宗教四个维度,并提出了一种用于英文文本的多类别刻板印象分类器。该模型在性能上优于一对一二元基线方法,通过XAI工具展现出一致的特征重要性信号,并揭示了GPT系列模型在时间维度上存在可测量的偏见减少趋势,从而建立了一个稳健的框架,用于审计大语言模型中的刻板印象偏见。
Large Language Models (LLM) have made significant advances in the recent past becoming more mainstream in Artificial Intelligence (AI) enabled human-facing applications. However, LLMs often generate stereotypical output inherited from historical data, amplifying societal biases and raising ethical concerns. This work introduces i) the Multi-Grain Stereotype Dataset, which includes 52,751 instances of gender, race, profession and religion stereotypic text and ii) a novel stereotype classifier for English text. We design several experiments to rigorously test the proposed model trained on the novel dataset. Our experiments show that training the model in a multi-class setting can outperform the one-vs-all binary counterpart. Consistent feature importance signals from different eXplainable AI tools demonstrate that the new model exploits relevant text features. We utilise the newly created model to assess the stereotypic behaviour of the popular GPT family of models and observe the reduction of bias over time. In summary, our work establishes a robust and practical framework for auditing and evaluating the stereotypic bias in LLM.
研究动机与目标
- 为应对由有偏见的训练数据导致的大语言模型(LLMs)产生刻板印象输出的日益严重的伦理问题。
- 构建一个全面的、多粒度的数据集,以捕捉性别、种族、职业和宗教等维度的刻板印象。
- 开发一种新型刻板印象分类器,其性能优于传统的“一对一”二元方法。
- 提供一个实用且可审计的框架,用于评估和监控大语言模型中的刻板印象偏见。
- 分析主流大语言模型(如GPT系列)在时间维度上的偏见演变过程。
提出的方法
- 构建包含52,751个人工标注实例的多粒度刻板印象数据集,涵盖四个刻板印象类别。
- 设计一种基于新数据集训练的多类别刻板印象分类器,用于检测英文文本中的刻板印象关联。
- 使用多种可解释人工智能(XAI)工具验证特征重要性信号,确保模型的可解释性。
- 在多类别和一对一二元设置下分别训练分类器,以进行对比评估。
- 将训练好的分类器应用于不同版本的GPT系列模型,以追踪偏见的演变。
- 采用标准化的评估协议,以比较模型性能和偏见趋势。
实验结果
研究问题
- RQ1多类别刻板印象分类器在检测基于文本的刻板印象方面,是否优于传统的“一对一”二元分类器?
- RQ2多种XAI工具是否产生一致的特征重要性信号,表明模型行为具有可靠性?
- RQ3GPT系列模型中的刻板印象偏见在不同代际和版本之间如何演变?
- RQ4新引入的多粒度刻板印象数据集在多大程度上提升了对交叉性刻板印象的检测能力?
- RQ5所提出的框架能否作为实际工具,用于审计和监控部署中的大语言模型的偏见?
主要发现
- 多类别分类器在性能上优于“一对一”二元基线方法,证明了联合检测刻板印象的优势。
- 多种XAI工具产生了稳定的特征重要性信号,证实模型依赖于诸如职业和性别代词等相关语言线索。
- 模型检测到GPT系列模型在后续版本中刻板印象输出显著减少,表明偏见缓解工作已取得进展。
- 多粒度刻板印象数据集有效捕捉了性别、种族、职业和宗教等维度的多样化、交叉性刻板印象。
- 所提出的框架能够实现对大语言模型刻板印象偏见的系统性审计,提供了一条可扩展且可解释的评估流水线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。