[论文解读] Fairness in machine learning: against false positive rate equality as a measure of fairness
本文挑战了在机器学习中使用假阳性率(FPR)相等作为公平性度量的伦理正当性,认为其无法追踪具有规范意义的公平性。通过一种伦理框架,罗伯特·朗证明FPR相等作为标准是不一致的,因为它与公平原则不一致,从而破坏了人们普遍认为的校准与FPR相等之间存在必要权衡的假设。
As machine learning informs increasingly consequential decisions, different metrics have been proposed for measuring algorithmic bias or unfairness. Two popular fairness measures are calibration and equality of false positive rate. Each measure seems intuitively important, but notably, it is usually impossible to satisfy both measures. For this reason, a large literature in machine learning speaks of a fairness tradeoff between these two measures. This framing assumes that both measures are, in fact, capturing something important. To date, philosophers have not examined this crucial assumption, and examined to what extent each measure actually tracks a normatively important property. This makes this inevitable statistical conflict, between calibration and false positive rate equality, an important topic for ethics. In this paper, I give an ethical framework for thinking about these measures and argue that, contrary to initial appearances, false positive rate equality does not track anything about fairness, and thus sets an incoherent standard for evaluating the fairness of algorithms.
研究动机与目标
- 检验假阳性率(FPR)相等是否构成机器学习中公平性的一种规范性有意义的衡量标准。
- 挑战广泛接受的假设,即FPR相等与校准代表一种必要的公平性权衡。
- 对公平性度量进行伦理分析,重点探讨FPR相等是否捕捉到一种道德上相关联的属性。
- 论证FPR相等作为公平性标准的失败,原因在于其缺乏规范一致性。
- 通过拒绝FPR相等作为算法公平性的合法标准,重新定义公平性辩论。
提出的方法
- 基于规范伦理学构建一个伦理框架,以评估公平性度量。
- 分析FPR相等与校准作为公平性标准的概念与道德基础。
- 研究校准与FPR相等之间的统计不相容性,质疑两者是否都能获得伦理上的正当性。
- 运用哲学推理评估FPR相等是否反映真正的公平关切,还是在伦理上不一致。
- 将FPR相等与其他公平性度量进行对比,以凸显其概念上的缺陷。
- 论证FPR相等无法追踪公平性,因为它即使在系统性不公的情况下也能被满足。
实验结果
研究问题
- RQ1FPR相等是否代表了机器学习中一种道德上重要的公平性标准?
- RQ2为何人们普遍认为校准与FPR相等之间存在权衡,这种观点在伦理上为何存在问题?
- RQ3FPR相等能否被合理化为一种规范性公平性标准,还是其在概念上不一致?
- RQ4应以何种伦理原则作为评估算法决策中公平性的基础?
- RQ5FPR相等作为公平性度量的失败,如何影响关于算法公平性的整体话语?
主要发现
- FPR相等无法追踪公平性中具有规范重要性的属性,因此作为评估算法公平性的标准是失败的。
- 认为FPR相等是一种有意义的公平性度量的假设在伦理上缺乏正当性,且在概念上不一致。
- 人们广泛引用的校准与FPR相等之间的权衡,是基于一个有缺陷的前提,因为FPR相等缺乏伦理基础。
- 即使在系统性不公的情况下,FPR相等仍可能被满足,因此它作为公平性的代理指标是不可靠的。
- 本文结论认为,FPR相等不应用于伦理评估机器学习系统的公平性标准。
- 本文所构建的伦理框架为拒绝FPR相等提供了依据,同时保留了校准作为公平性标准的正当性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。