[论文解读] Model Selection's Disparate Impact in Real-World Deep Learning Applications
本文表明,深度学习中的模型选择可能在不同人口群体间引入差异性影响,即使整体性能指标(如AUC)保持稳定。通过在ChestX-Ray8数据集上使用CheXNet,作者发现不同随机种子训练的模型在男性与女性中的真正例率(TPR)存在显著差异,差异最大达0.2892,凸显了人为影响的度量选择在公平性结果中的作用。
Algorithmic fairness has emphasized the role of biased data in automated decision outcomes. Recently, there has been a shift in attention to sources of bias that implicate fairness in other stages in the ML pipeline. We contend that one source of such bias, human preferences in model selection, remains under-explored in terms of its role in disparate impact across demographic groups. Using a deep learning model trained on real-world medical imaging data, we verify our claim empirically and argue that choice of metric for model comparison, especially those that do not take variability into account, can significantly bias model selection outcomes.
研究动机与目标
- 调查人为影响的模型选择(尤其是性能度量的选择)如何在现实世界的深度学习应用中导致不同人口群体间的差异性影响。
- 考察在使用相同超参数但不同随机种子训练的模型中,子群体性能(如男性与女性患者)的变异程度。
- 挑战在高风险领域(如医学影像)中,整体性能指标(如AUC)稳定即代表公平性的假设。
- 倡导在公平性评估中加强对模型选择实践和度量的审查,尤其是在真实世界数据集中。
- 呼吁建立更具问责性、透明性与鲁棒性的模型选择流程,超越整体指标,充分考虑子群体性能。
提出的方法
- 使用固定的ImageNet预训练权重和相同的超参数,在ChestX-Ray8数据集上训练了50个CheXNet实例,仅随机种子不同。
- 所有训练运行均使用相同的优化器和训练流程,模型差异仅源于不同随机种子导致的批量打乱。
- 对于每个模型,通过在训练集上最大化F1分数来选择最优预测阈值,以在低患病率条件下优先提升召回率。
- 分别在男性和女性测试子集上测量每项异常的真正例率(TPR),以评估子群体性能差异。
- 比较各模型在整体AUC和TPR上的表现,评估在不同人口群体间性能与公平性的一致性。
- 分析各模型间男性与女性TPR差异的变异情况,识别观察到的最大差异和范围。
实验结果
研究问题
- RQ1基于单一性能度量(如AUC)的模型选择在多大程度上掩盖了不同人口群体间子群体性能的差异?
- RQ2在使用相同超参数但不同随机种子训练的多个模型实例中,男性与女性患者的真正例率(TPR)存在多大程度的变异?
- RQ3即使整体模型性能(AUC)保持稳定,子群体性能(如男性与女性间TPR差异)是否仍可能产生显著差异?
- RQ4模型选择度量的选择在多大程度上影响公平性结果,特别是在低患病率的医学影像任务中?
- RQ5集成或自动化方法在多大程度上可减少模型选择中的子群体性能变异?
主要发现
- 尽管各模型的AUC值保持一致(以‘Mass’异常为例,最大范围为0.0227),但男性与女性之间的真正例率(TPR)差异在不同模型间存在显著波动。
- 在任意模型中观察到的男性与女性之间TPR的最大差异达到0.2892,表明即使整体性能稳定,仍存在重大公平性风险。
- 对于单一异常,各模型间TPR差异的范围达到0.2258,表明模型选择可能因模型选择不同而放大或减轻公平性问题。
- 子群体性能的变异性与整体AUC无关,表明整体指标无法捕捉与公平性相关的差异。
- 整体性能相近的模型在男性与女性患者子群体上表现出截然不同的行为,凸显了仅依赖整体指标选择模型的风险。
- 本研究揭示,模型选择并非中立过程——受人为偏好影响的度量选择可能导致差异性影响,即使数据和模型架构保持不变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。