[论文解读] Fairness Improvement with Multiple Protected Attributes: How Far Are We?
本文在多个受保护属性上评估了11种最先进的机器学习公平性改进方法,发现针对某一属性优化公平性往往会损害其他属性的公平性——影响高达88.3%的场景,而性能(准确率)则基本保持稳定。研究强调了必须在交叉属性上评估公平性,并超越单一属性的公平性度量。
Existing research mostly improves the fairness of Machine Learning (ML) software regarding a single protected attribute at a time, but this is unrealistic given that many users have multiple protected attributes. This paper conducts an extensive study of fairness improvement regarding multiple protected attributes, covering 11 state-of-the-art fairness improvement methods. We analyze the effectiveness of these methods with different datasets, metrics, and ML models when considering multiple protected attributes. The results reveal that improving fairness for a single protected attribute can largely decrease fairness regarding unconsidered protected attributes. This decrease is observed in up to 88.3% of scenarios (57.5% on average). More surprisingly, we find little difference in accuracy loss when considering single and multiple protected attributes, indicating that accuracy can be maintained in the multiple-attribute paradigm. However, the effect on F1-score when handling two protected attributes is about twice that of a single attribute. This has important implications for future fairness research: reporting only accuracy as the ML performance metric, which is currently common in the literature, is inadequate.
研究动机与目标
- 研究专为单一受保护属性设计的公平性改进方法在同时应用于多个受保护属性时的影响。
- 评估针对某一属性的公平性改进是否会导致未考虑的其他属性出现意外的公平性下降。
- 在同时考虑多个受保护属性时,评估公平性-性能权衡,特别是精确率和召回率方面的表现。
- 在多样化数据集、模型和公平性度量下,对11种最先进的公平性方法进行基准测试,以理解其在交叉公平性设置下的有效性。
提出的方法
- 本研究评估了11种公平性改进方法——涵盖预处理、训练中和后处理技术——这些方法选自机器学习和软件工程文献。
- 在金融、社会和医疗领域广泛使用的五个数据集上应用这些方法,使用包括逻辑回归、随机森林和神经网络在内的多种机器学习模型。
- 评估使用了15项公平性-性能度量,包括多种群体公平性度量(如统计独立性差异、平等机会差异)和性能度量(准确率、精确率、召回率)。
- 分析聚焦于交叉公平性,通过测量受保护属性组合形成的子组之间的差异来实现。
- 研究人员系统比较了所有受保护属性的公平性结果,识别出在优化某一属性公平性时,另一属性公平性恶化的案例。
- 通过测量在同时考虑多个属性时准确率、精确率和召回率的变化,量化了公平性-性能权衡。
实验结果
研究问题
- RQ1在存在多个受保护属性时,为单一受保护属性改进公平性在多大程度上会负面影响未考虑的其他受保护属性的公平性?
- RQ2当多个受保护属性同时被考虑时,公平性改进方法在交叉公平性方面的表现如何?
- RQ3与仅针对单一属性优化公平性相比,同时在多个受保护属性上优化公平性对模型性能(准确率、精确率、召回率)有何影响?
- RQ4不同的公平性度量和模型架构如何影响多属性设置下的公平性-性能权衡?
主要发现
- 在平均57.5%的场景中,为单一受保护属性改进公平性会导致未考虑属性的公平性显著下降,而在所有实验中,这一比例高达88.3%。
- 公平性下降在精确率和召回率上尤为明显,当同时考虑多个属性时,其受影响程度约为准确率的五倍和八倍。
- 尽管存在显著的公平性权衡,但从单一受保护属性公平性改进转向多受保护属性公平性改进时,准确率损失仍保持极低,表明性能可以得到保持。
- 本研究发现,当前的公平性评估实践——过度依赖准确率——是不充分的,因为它们未能捕捉到在多属性设置下对精确率和召回率的不成比例影响。
- 受保护属性之间存在强相关性,这可能是观察到的公平性下降的原因,表明属性之间的相互作用在公平性权衡中起着关键作用。
- 对11种方法的基准测试表明,没有一种方法在所有数据集和度量下始终优于其他方法,凸显了需要根据上下文选择公平性方法的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。