Skip to main content
QUICK REVIEW

[论文解读] Approaching Machine Learning Fairness through Adversarial Network

Xiaoqian Wang, Heng Huang|arXiv (Cornell University)|Sep 6, 2019
Ethics and Social Impacts of AI参考文献 15被引用 8
一句话总结

本文提出FAIAS,一种新颖的对抗性网络框架,通过联合优化数据表征与模型预测,提升机器学习的公平性。通过使用特征采样与对抗性训练以最小化敏感特征的影响,FAIAS在三个基准数据集上的公平性度量与预测准确率均达到最先进水平。

ABSTRACT

Fairness is becoming a rising concern w.r.t. machine learning model performance. Especially for sensitive fields such as criminal justice and loan decision, eliminating the prediction discrimination towards a certain group of population (characterized by sensitive features like race and gender) is important for enhancing the trustworthiness of model. In this paper, we present a new general framework to improve machine learning fairness. The goal of our model is to minimize the influence of sensitive feature from the perspectives of both the data input and the predictive model. In order to achieve this goal, we reformulate the data input by removing the sensitive information and strengthen model fairness by minimizing the marginal contribution of the sensitive feature. We propose to learn the non-sensitive input via sampling among features and design an adversarial network to minimize the dependence between the reformulated input and the sensitive information. Extensive experiments on three benchmark datasets suggest that our model achieve better results than related state-of-the-art methods with respect to both fairness metrics and prediction performance.

研究动机与目标

  • 解决机器学习模型中日益严重的偏见与歧视问题,特别是在刑事司法与信用评分等高风险领域。
  • 克服现有公平性方法仅优化数据或模型视角的局限性,避免预测性能下降。
  • 开发一种统一框架,同时在数据输入层面减少敏感特征的影响,并最小化其在模型预测中的边际贡献。
  • 通过对抗性训练耦合数据与模型优化,实现在不牺牲预测性能的前提下提升公平性。

提出的方法

  • 提出一种两组件对抗性框架:一个选择器函数,用于学习采样非敏感特征;一个预测器,用于最小化敏感特征的边际贡献。
  • 使用可微分的选择器向量 w = 1/(1+e^−θ) 实现端到端训练,基于学习到的重要性选择特征,同时保持与数据无关。
  • 通过对抗性损失训练选择器,以最小化重构输入与敏感特征之间的依赖性,使用判别器衡量这种依赖性。
  • 使用标准交叉熵损失优化预测器,同时通过敏感特征的边际贡献约束确保公平性。
  • 为预测器采用四层神经网络,激活函数为SELU,优化器为Adam,使用Keras/TensorFlow实现。
  • 应用特征归一化,并采用60/20/20的训练/验证/测试集划分,进行5次随机运行以确保评估的稳健性。

实验结果

研究问题

  • RQ1一种同时优化数据表征与模型预测的统一框架,是否能在不降低预测性能的前提下提升公平性?
  • RQ2对抗性训练在多样化数据集上,能否有效降低敏感特征对模型预测的影响?
  • RQ3与最先进方法相比,联合优化数据与模型视角是否能带来更优的公平性度量结果(包括预处理、在线处理与后处理方法)?
  • RQ4通过对抗性选择器进行特征采样,在保留预测效用的同时,能在多大程度上消除敏感信息?
  • RQ5在真实世界数据集上,该方法在多种公平性度量(平等机会、平均奇偶性、Theil指数)下的公平性与准确率表现如何?

主要发现

  • FAIAS在所有三个基准数据集上均实现了最高的分类准确率与平衡准确率,优于基线模型及四种最先进公平性方法。
  • 在COMPAS数据集上,FAIAS将绝对平等机会差异降低至0.028,相较于其他方法展现出显著提升的公平性。
  • 在Bank Marketing数据集上,FAIAS将绝对平均奇偶性差异最小化至0.031,表明在不同年龄组间具有更优的群体公平性。
  • FAIAS的Theil指数始终接近于零(如COMPAS数据集上为0.012),表明其在群体公平性与个体公平性度量上均表现优异。
  • FAIAS在实现最先进公平性的同时保持了高预测性能,证明公平性约束不会损害模型准确率。
  • 对抗性特征选择器成功从输入表征中消除了敏感信息,证据为重构输入与敏感特征之间的依赖性较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。