[论文解读] A survey on datasets for fairness-aware machine learning
本综述全面概述了公平性感知机器学习中使用的表格数据集,分析了其结构、通过贝叶斯网络揭示的偏见关系,以及公平性与性能之间的权衡。研究识别了医疗、金融和刑事司法等领域的关键数据集,发现偏见往往源于数据本身,且受保护属性、类别不平衡和代理特征等数据集特征的显著影响,这些特征对公平性评估结果起关键作用。
As decision-making increasingly relies on Machine Learning (ML) and (big) data, the issue of fairness in data-driven Artificial Intelligence (AI) systems is receiving increasing attention from both research and industry. A large variety of fairness-aware machine learning solutions have been proposed which involve fairness-related interventions in the data, learning algorithms and/or model outputs. However, a vital part of proposing new approaches is evaluating them empirically on benchmark datasets that represent realistic and diverse settings. Therefore, in this paper, we overview real-world datasets used for fairness-aware machine learning. We focus on tabular data as the most common data representation for fairness-aware machine learning. We start our analysis by identifying relationships between the different attributes, particularly w.r.t. protected attributes and class attribute, using a Bayesian network. For a deeper understanding of bias in the datasets, we investigate the interesting relationships using exploratory analysis.
研究动机与目标
- 系统性地收集并表征公平性感知机器学习研究中使用的现实世界表格数据集。
- 利用贝叶斯网络分析受保护属性、类别标签及其他特征之间的关系,以揭示隐藏的偏见结构。
- 在不同数据集中评估预测性能与公平性表现,以凸显模型结果的变异性。
- 识别现有数据集中的关键缺口,包括过时的数据、缺乏时间或空间上下文信息,以及对现代公平性概念代表性不足的问题。
- 倡导开发新型、开放且多样化的基准数据集,以反映当前社会与技术挑战下的公平性感知人工智能。
提出的方法
- 通过基于引用的筛选标准,从同行评审的出版物中收集数据集,重点关注在至少三项公平性相关研究中使用过的数据集。
- 应用贝叶斯网络学习方法,建模属性之间的条件依赖关系,特别是受保护属性与目标标签之间的关系。
- 基于贝叶斯网络结构进行探索性数据分析,识别涉及受保护属性和代理属性的直接与间接关系。
- 在每个数据集上对分类模型进行定量评估,使用公平性度量(例如,人口均等性、机会均等性)和预测性能度量(例如,准确率、AUC)。
- 根据应用领域、受保护属性、维度、类别不平衡程度及公平性挑战对数据集进行分类,以支持研究中的数据集选择。
- 使用公开数据仓库(如 UCI、Kaggle)并排除非公开或不可复现的数据集,以确保可访问性与可复现性。
实验结果
研究问题
- RQ1在公平性感知机器学习研究中,哪些现实世界的表格数据集被最广泛使用?
- RQ2在这些数据集中,受保护属性如何与目标标签及其他特征相关联?代理属性在其中扮演什么角色?
- RQ3数据集特征(如类别不平衡、维度、受保护属性数量)在多大程度上影响公平性与预测性能?
- RQ4不同数据集上的公平性度量有何差异?这对算法评估意味着什么?
- RQ5当前基准数据集在反映现代公平性挑战(如时间公平性或分布公平性)方面存在哪些关键局限?
主要发现
- 来自1994年美国人口普查的Adult数据集是公平性感知机器学习研究中最广泛使用的数据集,包含超过45,000个实例和14个特征。
- 贝叶斯网络分析显示,性别和种族等受保护属性与多个其他特征(如‘marital-status’、‘occupation’和‘native-country’)存在条件依赖关系,表明存在强烈的代理关系。
- 用于再犯预测的COMPAS数据集表现出显著的种族偏见:与白人被告相比,非裔被告被错误分类为高风险的可能性几乎高出两倍。
- 在60%的调查数据集中存在类别不平衡问题,其中德国信用数据集显示良好与不良信用申请人的比例为2:1,这可能加剧公平性问题。
- 公平性度量在不同数据集中差异显著:人口均等性在德国信用数据集中为0.12,在ProPublica的COMPAS数据集中高达0.89,凸显了基于数据集的公平性评估的必要性。
- 所调查数据集的平均年龄为20年,最老的(SUPPORT)已收集48年,最新的(KKBox)也来自7年前,表明亟需更新、现代化的基准数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。