[论文解读] The cost of fairness in classification
本文提出一个框架,通过将公平性建模为代价敏感风险的约束,量化二分类中公平性与准确率之间的权衡。研究表明,最优公平分类器是类别概率函数η(x)的实例相关阈值化结果,并引入了一种非对齐度量,用于量化因公平性约束导致的性能下降。
We study the problem of learning classifiers with a fairness constraint, with three main contributions towards the goal of quantifying the problem's inherent tradeoffs. First, we relate two existing fairness measures to cost-sensitive risks. Second, we show that for cost-sensitive classification and fairness measures, the optimal classifier is an instance-dependent thresholding of the class-probability function. Third, we show how the tradeoff between accuracy and fairness is determined by the alignment between the class-probabilities for the target and sensitive features. Underpinning our analysis is a general framework that casts the problem of learning with a fairness requirement as one of minimising the difference of two statistical risks.
研究动机与目标
- 正式化具有敏感属性的监督分类中公平性与准确率之间的权衡。
- 分析公平性约束如何影响最优分类器的结构。
- 通过目标特征与敏感特征之间对齐程度的度量,量化公平性要求导致的性能下降。
提出的方法
- 将公平感知学习表述为最小化两个统计风险之间的差异:一个用于预测性能,另一个用于公平性。
- 通过引理1和引理2,将两种常见的公平性度量——人口统计均等和机会均等——简化为代价敏感风险的表达形式。
- 推导出贝叶斯最优公平分类器是类别概率函数η(x)的实例相关阈值化结果,其阈值由代价参数和公平性约束决定。
- 引入一种非对齐函数,用于度量目标特征与敏感特征之间类别概率的不匹配程度,该函数决定了性能下降的程度。
- 提出一种插件估计器,通过分别为目标特征和敏感特征训练独立模型,再通过阈值化组合以实现公平感知分类。
- 在德国信用数据集上,采用COV方法和平衡误差风险评估权衡,验证了理论框架的有效性。
实验结果
研究问题
- RQ1公平性约束在分类中如何与代价敏感风险最小化形式化关联?
- RQ2在代价敏感风险下,公平性约束的最优分类器具有何种结构形式?
- RQ3目标特征与敏感特征概率之间的对齐程度在多大程度上决定了公平性的性能成本?
- RQ4与现有方法相比,基于插件的估计器能否实现具有竞争力的公平性-准确率权衡?
- RQ5类别概率之间的非对齐程度如何影响在公平性约束下可达到的最小误差?
主要发现
- 如人口统计均等和机会均等等公平性度量可重新表述为代价敏感风险,从而实现统一的优化框架。
- 最优公平感知分类器是类别概率函数η(x)的实例相关阈值化结果,其阈值由代价参数和公平性约束决定。
- 因公平性导致的性能下降可通过一种非对齐函数进行量化,该函数度量目标特征与敏感特征类别概率函数之间的不匹配程度。
- 当目标特征与敏感特征高度对齐(非对齐度低)时,公平性约束带来的性能成本最小;非对齐度增加则导致公平性成本上升。
- 在德国信用数据集上的实证结果表明,所提出的插件估计器在公平性-准确率权衡方面与Zafar等人(2016)提出的COV方法具有可比性能。
- 理论分析证实,代价敏感风险与基线之间的差距符号与差异影响阈值一致,验证了该框架的预测能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。