[论文解读] Designing Evaluations of Machine Learning Models for Subjective Inference: The Case of Sentence Toxicity
本文提出了一套用于设计主观推理任务中机器学习模型评估基准的规范框架,以句子毒性为案例研究。结果表明,传统的多数票聚合方法会扭曲主观性,通过CrowdTruth分析显示,不同标注方案下的标签质量和模糊性存在显著差异,其中设置1(二元有毒/非有毒)的标注结果最为可靠(MSE: 0.0103,AUROC: 0.9452)。
Machine Learning (ML) is increasingly applied in real-life scenarios, raising concerns about bias in automatic decision making. We focus on bias as a notion of opinion exclusion, that stems from the direct application of traditional ML pipelines to infer subjective properties. We argue that such ML systems should be evaluated with subjectivity and bias in mind. Considering the lack of evaluation standards yet to create evaluation benchmarks, we propose an initial list of specifications to define prior to creating evaluation datasets, in order to later accurately evaluate the biases. With the example of a sentence toxicity inference system, we illustrate how the specifications support the analysis of biases related to subjectivity. We highlight difficulties in instantiating these specifications and list future work for the crowdsourcing community to help the creation of appropriate evaluation datasets.
研究动机与目标
- 为解决主观机器学习任务中缺乏标准化评估基准的问题,特别是涉及人类判断与偏见的任务。
- 强调传统机器学习流水线若忽略主观性,可能通过排除少数意见而嵌入并放大偏见。
- 提出一套评估数据集的设计规范,以考虑主观性并减少模型评估中的偏见。
- 探究最先进的众包方法是否能满足主观评估的要求,或需要新的研究。
- 通过实证分析表明,标签聚合方法显著影响评估指标的可靠性。
提出的方法
- 提出一份形式化的规范清单,以指导主观推理评估数据集的设计,重点关注主观性与偏见。
- 应用CrowdTruth框架分析四种不同标注设置下工人的质量(WQS)、标签模糊性(UQS)和分歧度(ADR)。
- 通过人工评估高质量与低质量工人及模糊句子,验证CrowdTruth在识别正确标签与模糊性方面的准确性。
- 计算手动质量评分与CrowdTruth的WQS之间的均方误差(MSE),以评估标签正确性预测的准确性。
- 计算受试者工作特征曲线下面积(AUROC),以评估CrowdTruth基于标签分歧检测模糊句子的能力。
- 比较四种标注方案(设置1–4)在不同标签粒度和毒性类别下的影响,以评估其对标签质量和模糊性的影响。
实验结果
研究问题
- RQ1不同标注方案如何影响主观任务中标签质量与模糊性评估的可靠性?
- RQ2多数票聚合在多大程度上掩盖了个体主观性并扭曲了模型评估?
- RQ3CrowdTruth框架能否准确识别主观标注任务中的高质量与低质量工人及模糊句子?
- RQ4在实际中,实施主观机器学习模型评估规范面临哪些关键挑战?
- RQ5如何改进众包方法,使其更能反映主观性并减少评估数据集中的偏见?
主要发现
- 设置1(采用二元划分:有毒 vs. 非有毒)的MSE最低(0.0103),AUROC最高(0.9452),表明其与人工质量评估高度一致。
- 标签粒度更高的方案(如包含“中性”或多种毒性等级)导致MSE更高(最高达0.3133),AUROC更低(最低达0.4792),表明其可靠性下降。
- CrowdTruth成功识别出97.67%的工人为可靠(排除2.33%的WQS较低者),这些低质量工人主要为刷单者。
- 仅有10.5%的工人始终与多数票一致,而51%的工人约15%的时间与多数票不一致,表明多数票无法代表多数个体观点。
- 4.5%的工人至少20%的时间与多数票不一致,表明有效主观性广泛存在,而多数票聚合方法未能捕捉到这一点。
- 即使在剔除低质量工人后,分歧度(ADR)的分布仍保持稳定,证实CrowdTruth在检测真实主观性方面具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。