QUICK REVIEW
[论文解读] Auditing ML Models for Individual Bias and Unfairness
Songkai Xue, Mikhail Yurochkin|arXiv (Cornell University)|Mar 11, 2020
Explainable Artificial Intelligence (XAI)参考文献 26被引用 9
一句话总结
该论文提出了一种基于凸优化和渐近推断的黑箱审计框架,用于检测机器学习模型中的个体偏差。该框架提供精确的置信区间和假设检验,以评估公平性违规情况,成功在Northpointe的COMPAS再犯预测工具中检测出性别和种族偏差,且控制了第一类错误率。
ABSTRACT
We consider the task of auditing ML models for individual bias/unfairness. We formalize the task in an optimization problem and develop a suite of inferential tools for the optimal value. Our tools permit us to obtain asymptotic confidence intervals and hypothesis tests that cover the target/control the Type I error rate exactly. To demonstrate the utility of our tools, we use them to reveal the gender and racial biases in Northpointe's COMPAS recidivism prediction instrument.
研究动机与目标
- 解决缺乏校准的统计工具来检测和定位机器学习模型中个体偏差的问题。
- 开发能够精确控制第一类错误率的推断工具,用于公平性违规的审计。
- 使审计人员能够在仅拥有模型黑箱访问权限的情况下评估公平性,而无需了解模型内部结构。
- 通过公平性约束优化问题的最优解,实现对偏差的可解释性定位。
- 通过揭示COMPAS再犯预测系统中系统性的性别和种族偏差,展示该方法的实用性。
提出的方法
- 将个体公平性审计形式化为一个凸优化问题,通过相似性度量加权最小化模型在相似输入对之间的输出差异。
- 推导在固定鲁棒性半径下最优值的渐近分布,由于目标函数的不规则性,该分布非正态。
- 构建最优值的渐近精确置信区间和假设检验,以评估公平性违规。
- 通过将观测到的审计值与公平性阈值δ进行比较,利用最优值的抽样分布进行推断,从而应用该框架进行模型审计。
- 通过在审计值上执行单侧置信区间检验,将该方法整合到模型选择中:选择通过检验的模型。
- 在真实数据上应用该方法,使用数据驱动的相似性函数和ℓ₁-正则化的逻辑回归,在公平性与准确性之间实现平衡。
实验结果
研究问题
- RQ1我们能否开发一种统计上严谨的方法,以精确的第一类错误率控制来检测机器学习模型中的个体公平性违规?
- RQ2如何仅通过黑箱访问来审计机器学习模型,同时保持计算效率和可解释性?
- RQ3在固定鲁棒性半径下,公平性约束凸优化问题的最优值的渐近分布是什么?
- RQ4所提出的框架在多大程度上能够检测并定位现实世界机器学习系统(如COMPAS)中的性别和种族偏差?
- RQ5该框架能否整合到模型选择过程中,以确保个体公平性与高预测性能?
主要发现
- 由于目标函数的不规则性,公平性审计问题中最优值的渐近分布是非正态的,这一结果具有独立的理论意义。
- 所提出的方法成功检测出Northpointe的COMPAS再犯预测系统中存在显著的性别和种族偏差,FaiTH值表明存在强烈的公平性违规。
- 在FaiTH约束下选择的ℓ₁-正则化逻辑回归模型实现了较低的FaiTH值,且未能拒绝个体公平性原假设,同时保持了具有竞争力的准确性。
- 群体公平性方法(如重加权)虽减少了群体层面的差异,但加剧了个体公平性违规,表现为高FaiTH值以及对种族等受保护属性的系数较大。
- 该方法通过置信区间实现了第一类错误率的精确控制,其中使用95%的下置信边界在模型选择过程中筛选出公平模型。
- 所选模型排除了性别作为预测变量,表明无需依赖受保护属性即可实现公平性,同时保持了预测性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。