[论文解读] Improving the Fairness of Chest X-ray Classifiers
本文通过比较群体公平性与极小极大公平性定义,研究了胸部X光影像分类器中的公平性问题,发现简单的数据平衡方法优于复杂的去偏方法,且群体公平性方法常导致所有群体性能下降。作者主张应优先分析数据偏见的根源,而非依赖算法修复。
Deep learning models have reached or surpassed human-level performance in the field of medical imaging, especially in disease diagnosis using chest x-rays. However, prior work has found that such classifiers can exhibit biases in the form of gaps in predictive performance across protected groups. In this paper, we question whether striving to achieve zero disparities in predictive performance (i.e. group fairness) is the appropriate fairness definition in the clinical setting, over minimax fairness, which focuses on maximizing the performance of the worst-case group. We benchmark the performance of nine methods in improving classifier fairness across these two definitions. We find, consistent with prior work on non-clinical data, that methods which strive to achieve better worst-group performance do not outperform simple data balancing. We also find that methods which achieve group fairness do so by worsening performance for all groups. In light of these results, we discuss the utility of fairness definitions in the clinical setting, advocating for an investigation of the bias-inducing mechanisms in the underlying data generating process whenever possible.
研究动机与目标
- 评估群体公平性与极小极大公平性中哪一种更适合临床胸部X光影像分类器。
- 在两个公开的胸部X光数据集(MIMIC-CXR 和 CheXpert)上,基于两种公平性定义,对九种公平性方法进行基准测试。
- 调查去偏方法是否能在不降低整体性能的前提下提升最差群体的性能。
- 探讨标签偏见在性能差异中的作用,特别是在“无发现”预测中的影响。
- 基于数据来源分析与多指标性能评估,为医疗领域公平机器学习的部署提供建议。
提出的方法
- 作者在 MIMIC-CXR 和 CheXpert 数据集上使用经验风险最小化(ERM)与平衡经验风险最小化(Balanced-ERM)训练并评估深度学习模型。
- 他们应用九种公平性方法,分别针对群体公平性(如对抗去偏、重加权)与极小极大公平性(如极小极大优化),以提升最差群体的性能。
- 一位放射科医生手动标注了此前由自动NLP系统标记为“无发现”的1,200份 MIMIC-CXR 报告,以评估标签质量。
- 研究通过多种指标(TPR、FPR、校准性)和操作阈值评估公平性与性能。
- 他们在不同受保护群体(如性别、年龄)之间比较性能,并分析校准性与错误率的差异。
- 作者使用统计检验确认显著的性能差距,并评估去偏方法是否减轻或加剧了这些差距。
实验结果
研究问题
- RQ1在胸部X光影像分类中,最小化受保护群体间差异(群体公平性)是否比极小极大公平性带来更好的最差群体性能?
- RQ2现有的算法去偏方法是否能在不降低任何群体性能的前提下提升公平性?
- RQ3“无发现”预测中的性能差距是否源于自动NLP标签过程中的标签偏见?
- RQ4在临床公平性基准中,简单的数据平衡是否优于复杂的公平性感知训练方法?
- RQ5在何种条件下,应通过最小化最差群体性能来定义公平性,而非通过均衡各群体间的错误率?
主要发现
- 简单的数据平衡在提升最差群体性能方面优于所有九种公平性方法,表明数据整理比算法去偏更有效。
- 实现群体公平性的去偏方法常使所有受保护群体的性能恶化,表明公平性与整体准确率之间存在权衡。
- 即使经过去偏处理,受保护群体间(如非裔女性)的TPR与FPR仍存在显著性能差异。
- 由放射科报告自动生成的“无发现”标签中的偏见,是导致性能差距的重要原因,尤其在年长群体中更为明显。
- 不同群体间的校准误差存在差异,表明固定的操作阈值可能导致临床部署中风险估计不均。
- 研究未发现复杂公平性算法在公平性方面优于基础数据平衡,强调了分析数据生成机制的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。