[论文解读] Learning under selective labels in the presence of expert consistency
本文提出一种数据增强方法,以解决算法辅助决策中因选择性标注偏差导致的问题,即当人类专家一致预测某一标签时,真实结果未被观测到。通过利用专家的一致性——尤其是当人类对结果为负面的判断高度自信时——该方法生成合成标签,以提升模型的泛化能力。其主要贡献在于提升在选择性标注数据中模型的可靠性与可信度,特别是在检测假阴性及降低系统性歧视风险方面。
Multiple fairness constraints have been proposed in the literature, motivated by a range of concerns about how demographic groups might be treated unfairly by machine learning classifiers. In this work we consider a different motivation; learning from biased training data. We posit several ways in which training data may be biased, including having a more noisy or negatively biased labeling process on members of a disadvantaged group, or a decreased prevalence of positive or negative examples from the disadvantaged group, or both. Given such biased training data, Empirical Risk Minimization (ERM) may produce a classifier that not only is biased but also has suboptimal accuracy on the true data distribution. We examine the ability of fairness-constrained ERM to correct this problem. In particular, we find that the Equal Opportunity fairness constraint [Hardt et al., 2016] combined with ERM will provably recover the Bayes optimal classifier under a range of bias models. We also consider other recovery methods including re-weighting the training data, Equalized Odds, and Demographic Parity, and Calibration. These theoretical results provide additional motivation for considering fairness interventions even if an actor cares primarily about accuracy.
研究动机与目标
- 解决算法辅助决策中选择性标注偏差的挑战,即当人类决策阻止观测时,真实结果未被记录。
- 探究专家一致性——尤其是人类高度自信时——是否可用于在真实标签缺失的情况下指导模型训练。
- 开发一种数据增强框架,整合专家确定性以提升模型对未标注数据区域的泛化能力。
- 评估在选择性标注下学习是否导致不可靠模型,易受系统性歧视影响,使用所提方法作为实证验证工具。
- 探讨依赖专家一致性所带来的风险与收益,尤其是当一致性可能源于共同偏见而非专业知识时。
提出的方法
- 提出一种数据增强方案,对人类决策概率 P(di = 1|xi) < ϵ 的实例添加合成标签,假设专家一致预测表明其正确性。
- 使用预测模型估计 P(di = 1|xi),即真实标签将被观测到的概率,该概率不受选择性标注偏差影响。
- 采用阈值 ϵ = 0.05 识别人类在未观测结果上高度自信的案例(即 di = 0),并基于专家一致性分配半合成标签。
- 生成增强训练数据 SA = So ∪ {(xi, di) : P(di = 1|xi) < ϵ},其中 So 为观测数据,利用该数据在观测数据和专家一致的未标注案例上联合训练模型。
- 在变体中采用逆概率加权方法,以校正增强数据中残余的选择偏差。
- 使用真实世界数据(儿童福利安置)和半合成数据验证该方法,比较模型在观测数据集与增强测试集上的性能。
实验结果
研究问题
- RQ1在选择性标注下,人类决策中的专家一致性是否可被可靠地用于为未标注数据生成合成标签?
- RQ2利用专家一致性进行数据增强是否能提升模型对选择性未标注数据部分的泛化能力?
- RQ3在多大程度上,从选择性标注数据中学习会导致不可靠模型,特别是在假阴性率和系统性歧视方面?
- RQ4模型在增强数据上的表现与在观测数据上的表现有何差异,特别是在识别高风险案例方面?
- RQ5在何种条件下,专家一致性反映的是正确性,而非共同偏见?
主要发现
- 在半合成数据中,仅在观测数据上训练的模型在低敏感度下表现不佳(假阴性率高),而这一缺陷仅在对增强测试集进行评估时才被发现。
- 数据增强方法显著降低了半合成数据中的假阴性,尤其在专家高度自信地筛选出的案例中,表明泛化能力得到改善。
- 在真实世界数据中,由于高可信度筛选案例数量稀少,增强的影响有限,但模型预测在被筛选区域与人类决策高度一致。
- 在增强数据上训练的模型为高度自信筛选出的案例分配了更低的风险评分,表明其与专家一致性更加契合。
- 在增强设置中使用逆概率加权并未显著提升性能,表明核心收益源于基于专家一致性的数据增强本身。
- 该方法成功将专家知识融入模型训练,增强了在人类信心信号具有信息量的决策支持系统中的信任度与可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。