Skip to main content
QUICK REVIEW

[论文解读] Hunting for Discriminatory Proxies in Linear Regression Models

Samuel Yeom, Anupam Datta|arXiv (Cornell University)|Oct 16, 2018
Corruption and Economic Development被引用 15
一句话总结

本文提出了线性回归模型中代理使用的形式化定义,其中代理是指与受保护属性具有统计相关性且在因果上具有影响力的一组输入变量的组合。作者提出了一种高效的凸优化方法——求解二阶锥规划(SOCP),以检测此类代理,并将其扩展至处理合理的豁免情形,实证表明该方法在真实预测警务数据集中有效识别出歧视性模式。

ABSTRACT

A machine learning model may exhibit discrimination when used to make decisions involving people. One potential cause for such outcomes is that the model uses a statistical proxy for a protected demographic attribute. In this paper we formulate a definition of proxy use for the setting of linear regression and present algorithms for detecting proxies. Our definition follows recent work on proxies in classification models, and characterizes a model's constituent behavior that: 1) correlates closely with a protected random variable, and 2) is causally influential in the overall behavior of the model. We show that proxies in linear regression models can be efficiently identified by solving a second-order cone program, and further extend this result to account for situations where the use of a certain input variable is justified as a `business necessity'. Finally, we present empirical results on two law enforcement datasets that exhibit varying degrees of racial disparity in prediction outcomes, demonstrating that proxies shed useful light on the causes of discriminatory behavior in models.

研究动机与目标

  • 形式化线性回归模型中代理使用的概念,其中代理是与受保护属性相关联且影响模型输出的特征组合。
  • 开发一种高效、可扩展的算法,利用凸优化(特别是二阶锥规划)检测此类代理。
  • 将检测方法扩展以考虑‘业务必要性’豁免,即尽管某些变量与受保护属性相关,但其使用是合理正当的。
  • 在真实世界预测警务数据集上实证评估该方法,以评估其识别歧视性结果根源原因的能力。
  • 提供一种实用且计算上可行的框架,用于审计机器学习模型中的基于代理的歧视行为。

提出的方法

  • 将代理定义为与受保护属性具有高度统计关联性且对模型输出具有显著因果影响的输入变量的线性组合。
  • 将代理检测建模为二阶锥规划(SOCP),通过凸优化实现代理的高效且精确计算。
  • 引入一种松弛技术,用于处理KKT矩阵奇异的情况,从而在控制假阳性率的前提下实现近似检测。
  • 修改优化框架,排除由豁免变量导出的代理,确保合理相关性不会引发误报。
  • 使用影响度作为因果影响的度量,定义为代理相对于模型输出的方差,以量化其潜在的歧视性。
  • 将该算法应用于两个预测警务数据集,比较代理强度与单个特征的相关性及模型输出。

实验结果

研究问题

  • RQ1能否将代理使用的正式定义从分类模型有意义地扩展到线性回归模型?
  • RQ2是否可以利用凸优化技术高效检测线性回归模型中的代理?
  • RQ3如何调整检测算法以考虑尽管与受保护属性相关但可合理使用的变量?
  • RQ4所识别出的代理在多大程度上解释了现实世界预测警务模型中非平等影响的根源原因?
  • RQ5在歧视性影响方面,单个特征相关性与复合代理之间存在何种关系?

主要发现

  • 当精确SOCP求解器收敛时,所提出的算法检测代理时无假阳性,确保了对歧视性行为的可靠识别。
  • 在C&C数据集中,由58个变量组成的代理影响度达到0.34,ε = 0.85,显著高于任一单个特征的影响度。
  • 在一个数据集中,最强的非豁免代理远弱于最强的一般代理,表明单一豁免变量可能解释了大部分歧视性效应。
  • 模型表现出的影响度为模型自身方差的14.5倍,展示了全模型中抵消效应如何掩盖强潜在代理的存在。
  • 近似检测算法无假阴性,但当δ超过真实最大影响度时可能产生假阳性,凸显了灵敏度与精确度之间的权衡。
  • 实证结果表明,该算法运行迅速,能准确识别模型中最具问题的组成部分,为非平等影响的成因提供了可操作的洞察。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。