[论文解读] Nuanced Metrics for Measuring Unintended Bias with Real Data for Text Classification
本文提出了一套与阈值无关的度量指标——基于ROC-AUC、Mann-Whitney U和Equality Gap——以实现对文本分类模型中非预期偏见的细致评估。基于一项新近众包收集的近两百万条带标注的在线评论数据集,作者表明,尽管偏见缓解技术可减少短文本中的偏见,但在较长文本中仍可能残留偏见,揭示了当前公平性干预措施的局限性。
Unintended bias in Machine Learning can manifest as systemic differences in performance for different demographic groups, potentially compounding existing challenges to fairness in society at large. In this paper, we introduce a suite of threshold-agnostic metrics that provide a nuanced view of this unintended bias, by considering the various ways that a classifier's score distribution can vary across designated groups. We also introduce a large new test set of online comments with crowd-sourced annotations for identity references. We use this to show how our metrics can be used to find new and potentially subtle unintended bias in existing public models.
研究动机与目标
- 解决现有基于阈值的度量指标在衡量文本分类中非预期偏见时的局限性。
- 开发一个全面且细致的评估框架,以捕捉不同人口群体中各类偏见形式。
- 创建并发布一个大规模、人工标注的在线评论数据集,其中包含身份相关引用,用于真实世界中的偏见评估。
- 利用真实数据和新度量指标,评估公共毒性分类器中偏见缓解措施的有效性。
- 揭示传统公平性度量所掩盖的隐藏或细微偏见。
提出的方法
- 提出五种基于ROC-AUC、Mann-Whitney U和Equality Gap的与阈值无关的度量指标,用于评估模型在不同身份群体中的公平性。
- 使用合成测试集和一个新近的大规模人工标注数据集(约200万条评论,包含身份相关引用)来评估模型性能。
- 将度量指标应用于两个公开的Perspective API模型——一个带有偏见缓解,一个不带——以比较其偏见特征。
- 通过可视化特定身份群体在有毒和非有毒评论中的得分分布,揭示偏见模式。
- 使用子组AUC、BPSN AUC和负向AEG检测模型在不同人口子群体中行为的差异。
- 通过比较短文本与长文本中模型行为的差异,分析偏见缓解的影响,特别是针对身份术语。
实验结果
研究问题
- RQ1与基于阈值的度量指标相比,与阈值无关的度量指标如何揭示不同类型的非预期偏见?
- RQ2毒性分类器中的偏见缓解在多大程度上减少了不同人口身份群体中的非预期偏见?
- RQ3尽管已知采用了缓解技术,哪些偏见模式仍持续存在于真实世界文本分类模型中?
- RQ4评论长度在多大程度上影响毒性分类模型中非预期偏见的表现?
- RQ5大规模、带有身份标注的数据集能否提升对文本分类器中细微、复杂偏见的检测能力?
主要发现
- 经过偏见缓解的模型(TOXICITY@6)在短文本中,特别是在‘homosexual_gay_or_lesbian’身份群体中,子组AUC和BPSN AUC均有显著提升。
- 对于短文本,原始模型(TOXICITY@1)在与身份相关的术语上,非有毒与有毒得分分布之间存在严重重叠,表明偏见程度很高。
- 尽管已进行缓解,模型在不同身份群体中的度量指标仍表现出更高的方差,特别是对于‘black’和‘asian’等未获得额外非有毒训练数据的群体。
- 度量指标显示,偏见缓解在短文本中最为有效,此时训练数据不平衡程度最高,但在长文本中效果较弱。
- 新数据集使此前被掩盖的偏见得以检测,表明缓解措施并未在评论长度或身份群体之间完全泛化。
- 可视化结果证实,缓解措施将身份术语的非有毒得分向左移动(降低得分),减少了与有毒得分的重叠,尤其在短文本中表现明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。