[论文解读] Rater Equivalence: Evaluating Classifiers in Human Judgment Settings
本文提出了调查等价性(survey equivalence)方法,用于在主观或存在噪声的人工判断场景中评估分类器性能,通过将分类器的准确率与假设的人工调查结果进行比较。该方法定义了调查等价性为匹配分类器预测性能所需的最少标注者数量(相对于一个保留的标注者),提供了一种可解释、归一化的度量指标,可将分类器性能与人工分歧的方差分离开来。
In many decision settings, the definitive ground truth is either non-existent or inaccessible. We introduce a framework for evaluating classifiers based solely on human judgments. In such cases, it is helpful to compare automated classifiers to human judgment. We quantify a classifier's performance by its rater equivalence: the smallest number of human raters whose combined judgment matches the classifier's performance. Our framework uses human-generated labels both to construct benchmark panels and to evaluate performance. We distinguish between two models of utility: one based on agreement with the assumed but inaccessible ground truth, and one based on matching individual human judgments. Using case studies and formal analysis, we demonstrate how this framework can inform the evaluation and deployment of AI systems in practice.
研究动机与目标
- 解决标准准确率度量在人类标注者存在分歧的主观分类任务中所存在的局限性。
- 开发一种能够将分类器性能与人工标注中的固有变异性分离开来的度量指标。
- 提供一个基准,用于评估分类器相对于人类共识的性能表现。
- 实现跨不同人类标注者一致性水平的数据集之间分类器的公平比较。
- 形式化一种程序,将分类器性能解释为等价于特定规模的人工调查。
提出的方法
- 该方法通过将分类器的预测准确率与一个保留的人工标注者的标签进行比较来评估分类器。
- 通过从可用的 K 个标注者中对每个样本随机抽取 k 个标签,模拟不同规模(k 名标注者)的调查。
- 对每个 k 值,通过多次随机抽取 k 名标注者的样本,计算 k 名标注者调查的期望准确率。
- 通过绘制期望准确率随 k 变化的曲线,构建调查效能曲线,展示准确率随标注者数量增加而提升的趋势。
- 调查等价性定义为最小的 k 值,使得 k 名标注者调查的期望准确率与分类器达到相同水平。
- 分数值通过随机抽样进行解释:例如,4.77 表示 77% 的样本使用 5 名标注者,23% 的样本使用 4 名标注者。
实验结果
研究问题
- RQ1当人类标注者对标签存在分歧时,如何对分类器性能进行有意义的评估?
- RQ2何种度量指标可将分类器质量与人类标注者一致性的水平分离开来?
- RQ3如何在人类标注噪声或主观性水平不同的数据集之间,对分类器性能进行有意义的比较?
- RQ4最少需要多少名人类标注者,其集体判断才能与分类器的预测准确率相当?
- RQ5能否将分类器的性能有意义地解释为等价于某一规模的人工调查?
主要发现
- 调查等价性提供了一种归一化且可解释的度量指标,反映了分类器相对于人类共识的性能表现。
- 该方法确保,无论标注者分歧程度如何,调查等价性更高的分类器其准确率均优于规模更小的人工调查。
- 在大样本极限下,调查等价性对参考标签的选择(多数票 vs. 真实标签)具有不变性。
- 调查效能曲线(即 k 名标注者调查的期望准确率随 k 的变化曲线)用于计算调查等价性,定义为使准确率与分类器相当的最小 k 值。
- 分数形式的调查等价性值(如 4.77)可通过随机抽样策略进行解释,支持实际部署。
- 该方法对不同的评分函数(如 DMI、AUC、精确率)具有鲁棒性,且可使用时间复杂度为 O(K^|L||I||L|) 的优化算法高效计算。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。