[论文解读] On the Intrinsic and Extrinsic Fairness Evaluation Metrics for Contextualized Language Representations
本文研究了在毒性、情感和刻板印象偏见背景下,上下文语言模型中内在公平性与外在公平性度量之间的相关性。通过使用19种模型和多种度量方法,研究发现内在公平性与外在公平性评估之间相关性微弱,突显了上游公平性改进并不能保证下游公平性,且数据集质量、度量对齐和实验配置在现实应用中的偏见检测中起着关键作用。
Multiple metrics have been introduced to measure fairness in various natural language processing tasks. These metrics can be roughly categorized into two categories: 1) \emph{extrinsic metrics} for evaluating fairness in downstream applications and 2) \emph{intrinsic metrics} for estimating fairness in upstream contextualized language representation models. In this paper, we conduct an extensive correlation study between intrinsic and extrinsic metrics across bias notions using 19 contextualized language models. We find that intrinsic and extrinsic metrics do not necessarily correlate in their original setting, even when correcting for metric misalignments, noise in evaluation datasets, and confounding factors such as experiment configuration for extrinsic metrics. %al
研究动机与目标
- 调查直接评估语言模型的内在公平性度量与评估下游系统输出的外在公平性度量之间的关系。
- 识别影响上下文表示中内在与外在公平性度量相关性的因素。
- 评估数据集质量、偏见概念对齐和实验配置对公平性度量可靠性的影响。
- 为NLP系统的偏见评估提供最佳实践,以提升现实世界中的可信度与公平性。
提出的方法
- 在19种预训练语言模型(如BERT、GPT-2)上开展大规模相关性研究,针对毒性、情感和刻板印象三种偏见类型,使用内在和外在度量方法。
- 采用内在度量如CEAT(上下文嵌入关联测试)和ILPS(对数概率提升分数)来评估词嵌入和生成模板中的偏见。
- 应用外在度量如BOLD(偏见导向语言检测)、B-Sent、B-Tox和B-Stereo,以评估下游文本生成和分类任务中的公平性。
- 通过消融研究评估偏见概念不一致、受保护群体定义和数据集噪声对度量相关性的影响。
- 评估外在度量对外部实验配置(如解码温度和分类器鲁棒性)的敏感性,这些配置影响度量计算。
- 使用情感、态度和毒性分类器过滤评估数据集中嘈杂或有偏见的提示,特别是在宗教相关刻板印象的BOLD基准中。
实验结果
研究问题
- RQ1内在与外在公平性度量在不同上下文语言模型和偏见类型之间相关性的程度如何?
- RQ2偏见概念不一致(如毒性与情感)如何影响内在与外在公平性度量之间的相关性?
- RQ3评估数据集中的噪声在多大程度上影响外在公平性度量的可靠性及其与内在度量的相关性?
- RQ4实验配置(如解码温度和分类器选择)如何影响下游任务中公平性测量?
- RQ5通过数据集过滤和度量对齐,内在与外在公平性评估之间的相关性能在多大程度上得到改善?
主要发现
- 在19种模型中,即使经过度量不一致和数据集噪声校正,内在与外在公平性度量之间仍表现出微弱或不一致的相关性。
- 当在种族领域对B-Stereo度量的评估数据源进行对齐后,内在与外在度量之间的相关性从-0.18提升至0.02,改善幅度有限。
- 在BOLD数据集中,使用情感和毒性分类器过滤掉有噪声的提示后,CEAT与B-Sent的相关性提升至0.11,StereoSet与B-Stereo的相关性提升至0.10。
- 在GPT-2中将解码温度从0.5提高到1.0,生成输出中负面情感的比例从4.6%上升至15.6%,表明推理配置对结果敏感。
- 在500篇BOLD生成文本中引入词级噪声(替换/删除),使负面情感比例从13.6%降至12.18%,负面态度比例从25.2%降至22.86%,表明噪声会影响基于分类器的度量得分。
- 本研究揭示,公平性度量对模型超参数、评估数据集质量以及度量计算中使用的辅助模型等混淆因素敏感,从而削弱了基于代理的公平性评估的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。