[论文解读] Verifying Individual Fairness in Machine Learning Models
该论文提出了首个用于验证机器学习模型个体公平性的框架,通过检查全局鲁棒性:即根据灵活的、属性特定的度量标准,相似输入是否获得相似预测。该框架为线性分类器和核化分类器(多项式/RBF)设计了可靠但不完备的验证算法,利用半定规划(SDP)松弛来界定预测差异,并在公开数据集上进行了实验验证,有效检测出个体偏见。
We consider the problem of whether a given decision model, working with structured data, has individual fairness. Following the work of Dwork, a model is individually biased (or unfair) if there is a pair of valid inputs which are close to each other (according to an appropriate metric) but are treated differently by the model (different class label, or large difference in output), and it is unbiased (or fair) if no such pair exists. Our objective is to construct verifiers for proving individual fairness of a given model, and we do so by considering appropriate relaxations of the problem. We construct verifiers which are sound but not complete for linear classifiers, and kernelized polynomial/radial basis function classifiers. We also report the experimental results of evaluating our proposed algorithms on publicly available datasets.
研究动机与目标
- 为解决缺乏针对个体公平性的验证技术的问题,个体公平性要求在所有输入上具备全局鲁棒性,而非仅群体层面公平性或局部对抗鲁棒性。
- 开发一种形式化且可靠的验证方法,通过检查在灵活度量下相近的输入是否产生显著不同的模型输出,来检测个体偏见。
- 将现有验证方法——此前仅限于局部鲁棒性或群体公平性——扩展到全局、个体公平性设置。
- 为使用数学优化(特别是半定规划)的白盒模型提供一个实用的公平性验证框架。
- 在公开数据集上对方法进行实证评估,证明其能够检测现实世界模型中的个体层面不公平性。
提出的方法
- 论文通过一种灵活的度量定义个体公平性,将输入属性划分为若干子集,每个子集具有允许扰动的阈值,若各属性上的差异在对应阈值内,则认为输入相近。
- 对于线性分类器,验证问题被简化为线性规划,该方法精确但时间复杂度可能呈指数级增长;对于核化模型,则通过平方和(SOS)技术松弛为半定规划(SDP)。
- 核心方法利用半定规划松弛来计算相近输入之间最大输出差异的下界,从而实现公平性的可靠验证。
- 对于RBF核模型,算法在敏感属性空间中迭代可行的输入扰动对,并求解约束优化问题以找到最小预测差异。
- 该方法利用Putinar的Positivstellensatz和SOS层级结构,构建半代数集上多项式优化问题的下界,确保方法的可靠性。
- 该框架输出相近输入之间最大输出差异的下界,若差异超过公平性阈值,则提供反例。
实验结果
研究问题
- RQ1我们能否通过检查所有输入对之间的全局鲁棒性,来形式化验证机器学习模型中的个体公平性?
- RQ2如何将原本针对局部对抗鲁棒性或群体公平性设计的现有验证技术,适应到全局个体公平性设置中?
- RQ3哪些数学松弛技术可用于在非线性模型(如核化分类器)中可靠地验证个体公平性?
- RQ4半定规划和平方和松弛在多大程度上可用于界定输入扰动下的预测差异?
- RQ5所提出的框架在检测现实世界数据集中个体层面偏见方面的有效性如何?
主要发现
- 所提出的验证框架对线性和核化分类器是可靠但不完备的,线性模型的精确验证时间复杂度可能呈指数级增长。
- 对于核化模型,该方法基于平方和表示的半定规划松弛,计算相近输入之间最大输出差异的下界。
- 该框架通过识别在小输入扰动下输出差异较大的输入对,成功检测出RBF核模型中的个体偏见。
- 在公开数据集上的实验评估证实,该方法能够识别不公平的预测,且输出的下界反映了最坏情况下的公平性违规。
- 该方法通过统一的、灵活的度量框架,将群体公平性和反事实公平性均纳入其中,推广了以往的公平性定义。
- 利用Putinar的Positivstellensatz使得在复杂输入约束下对半代数集进行约束优化成为可能,从而实现即使在复杂约束下也能进行公平性验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。