[论文解读] Fairness With Minimal Harm: A Pareto-Optimal Approach For Healthcare
本文提出了一种医疗机器学习中公平性的Pareto最优方法,通过最小化敏感子群体之间的风险差异,同时避免对任何群体造成不必要的伤害。通过使用动态风险平衡损失训练神经网络,该方法在最小性能下降的前提下实现了最先进的公平性,其有效性在ICU死亡率预测和皮肤病变分类数据集上得到验证。
Common fairness definitions in machine learning focus on balancing notions of disparity and utility. In this work, we study fairness in the context of risk disparity among sub-populations. We are interested in learning models that minimize performance discrepancies across sensitive groups without causing unnecessary harm. This is relevant to high-stakes domains such as healthcare, where non-maleficence is a core principle. We formalize this objective using Pareto frontiers, and provide analysis, based on recent works in fairness, to exemplify scenarios were perfect fairness might not be feasible without doing unnecessary harm. We present a methodology for training neural networks that achieve our goal by dynamically re-balancing subgroups risks. We argue that even in domains where fairness at cost is required, finding a non-unnecessary-harm fairness model is the optimal initial step. We demonstrate this methodology on real case-studies of predicting ICU patient mortality, and classifying skin lesions from dermatoscopic images.
研究动机与目标
- 通过最小化敏感子群体之间的风险差异,解决高风险医疗应用中的公平性问题。
- 将公平性形式化为Pareto最优性,确保在不损害其他群体的前提下,任何群体都不会变得更差。
- 开发一种避免事后校正的训练方法,同时保持模型的实用性。
- 在ICU死亡率预测和皮肤病变分类等实际医疗任务中展示该方法的有效性。
- 证明Pareto公平模型在保持整体性能的同时,实现了最小的风险差异。
提出的方法
- 该方法使用子群体风险的Pareto前沿来定义公平性,即在不损害其他群体的前提下,无法进一步改善任一子群体的风险。
- 将最优分类器形式化为在Pareto前沿内最小化子群体间最大成对风险差距的分类器。
- 引入一种可微分的自适应风险均等化损失,以在训练过程中动态平衡子群体的风险。
- 该方法可兼容任何标准分类器或回归模型,且无需在推理时访问敏感属性。
- 该算法应用于使用交叉熵和Brier评分损失的神经网络,辅以群体特定的风险正则化。
- 在MIMIC-III(ICU死亡率)和HAM10000(皮肤病变)数据集上,采用准确率和Brier评分作为评估指标进行评估。
实验结果
研究问题
- RQ1是否可以以一种避免对任何子群体造成不必要的伤害的方式,形式化医疗机器学习中的公平性?
- RQ2是否可能在不降低整体模型性能的前提下实现最小风险差异?
- RQ3与事后公平性校正方法相比,Pareto最优性在实用性与公平性方面表现如何?
- RQ4所提出的方法是否可在无需在测试时访问敏感属性的前提下,应用于实际医疗任务?
- RQ5Pareto公平模型是否在各类子群体中均优于标准基线,在公平性与准确率方面均表现更优?
主要发现
- 在MIMIC-III数据集上,Pareto公平分类器的Brier得分为0.29,准确率为78.9%,在公平性方面优于Naive和Rebalanced Naive基线,同时保持了较强的实用性。
- 在皮肤病变分类任务中,Pareto公平模型将准确率差异从Naive模型的96.0%降低至31.7%(差异),同时保持了78.6%的平均准确率。
- 在MIMIC-III上,Pareto公平模型实现了最低的风险差异差距(0.29),在HAM10000上实现了最低的差异值(0.501),优于Zafar和ReN基线。
- 与Naive分类器相比,Pareto公平方法在MIMIC-III上实现了56.3%的风险差异降低,且未造成显著性能下降。
- 在HAM10000数据集上,Pareto公平模型将Brier评分差异从Naive模型的1.667降低至0.501,表明公平性显著提升。
- Pareto公平模型在所有子群体中均达到Pareto最优,意味着在不改善其他群体的前提下,没有任何一个群体的风险被恶化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。