Skip to main content
QUICK REVIEW

[论文解读] Fairness-Aware Neural Réyni Minimization for Continuous Features

Vincent Grari, Boris Ruf|arXiv (Cornell University)|Nov 12, 2019
Adversarial Robustness in Machine Learning参考文献 29被引用 8
一句话总结

该论文提出两种基于神经网络的方法,通过最小化Hirschfeld-Gebelein-Rényi(HGR)相关系数来提升连续敏感属性回归模型的公平性。第一种方法利用受MINE启发的神经估计器,最小化χ²散度的上界;第二种方法采用对抗性架构,直接最小化HGR。两种方法在真实世界和合成数据集上均实现了最先进的公平性表现,优于以往的公平性指标方法,包括FairQuant。

ABSTRACT

The past few years have seen a dramatic rise of academic and societal interest in fair machine learning. While plenty of fair algorithms have been proposed recently to tackle this challenge for discrete variables, only a few ideas exist for continuous ones. The objective in this paper is to ensure some independence level between the outputs of regression models and any given continuous sensitive variables. For this purpose, we use the Hirschfeld-Gebelein-Rényi (HGR) maximal correlation coefficient as a fairness metric. We propose two approaches to minimize the HGR coefficient. First, by reducing an upper bound of the HGR with a neural network estimation of the $χ^{2}$ divergence. Second, by minimizing the HGR directly with an adversarial neural network architecture. The idea is to predict the output Y while minimizing the ability of an adversarial neural network to find the estimated transformations which are required to predict the HGR coefficient. We empirically assess and compare our approaches and demonstrate significant improvements on previously presented work in the field.

研究动机与目标

  • 解决敏感属性为连续变量(如年龄或收入)的回归模型中的公平性问题。
  • 开发一种可泛化的最小化模型输出与连续敏感变量之间依赖关系的方法。
  • 改进以往仅关注离散或二值敏感属性的方法。
  • 提出一种基于HGR相关性的公平性度量,以捕捉非线性依赖关系。
  • 在真实世界和人工数据集上通过严格的公平性评估,实证验证所提方法的有效性。

提出的方法

  • 使用神经网络估计并最小化模型预测与连续敏感属性之间χ²散度的上界,灵感来自互信息神经估计(MINE)。
  • 采用对抗性神经网络架构,其中判别器学习非线性变换以预测HGR系数,而主模型则被训练以最小化该预测能力。
  • 引入两种公平性损失函数:一种基于χ²散度估计(χ²-NN),另一种通过对抗训练直接最小化HGR(Fair HGR NN)。
  • 应用标准深度学习组件:Tanh激活函数、Xavier初始化、Dropout正则化,以及回归任务的均方误差(MSE)损失。
  • 使用超参数λ在模型准确率(MSE)与公平性目标之间进行平衡。
  • 提出一种新颖的公平性度量FairQuant,通过在敏感属性的50个分位数上评估公平性,以减少估计偏差。

实验结果

研究问题

  • RQ1基于神经网络的χ²散度估计是否能有效最小化模型输出与连续敏感属性之间的依赖关系?
  • RQ2与间接方法相比,直接对抗性最小化HGR系数是否能带来更优的回归模型公平性?
  • RQ3与现有方法(如Mary2019)相比,所提方法在公平性与预测准确率方面表现如何?
  • RQ4数据集规模在多大程度上影响χ² KDE与χ² NN等公平性估计器的可靠性?
  • RQ5基于分位数公平性的FairQuant度量,是否能提供比标准HGR或χ²估计更稳健的评估?

主要发现

  • Fair HGR NN在所有数据集上均实现了准确率与公平性的最佳平衡,优于标准神经网络和Mary2019基线模型。
  • 在美国人口普查数据集上,Fair HGR NN实现了最低的FairQuant得分(1.12),表明其在统计独立性方面表现更优。
  • 在等化残差任务中,Fair HGR NN实现了最低的FairQuant值(Crime数据集为0.98,UC Census为1.02,Adult为1.05),展现出强大的公平性表现。
  • χ²-NN方法表现略逊于Fair HGR NN,但在大多数指标上仍优于Mary2019,尤其在大样本数据集上表现更优。
  • 在小样本Crime数据集(2,000个样本)上,χ² KDE与χ² NN显示出显著差异,凸显了低数据环境下估计的不稳定性。
  • 基于MINE的方法在公平性与准确率方面均劣于Fair HGR NN与χ²-NN,表明该实现存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。