[论文解读] Fairness without Imputation: A Decision Tree Approach for Fair Prediction with Missing Values
本文提出 Fair MIP Forest,一种集成决策树方法,通过将缺失值作为属性(MIA)并结合混合整数规划(MIP),在不进行显式数据插补的情况下联合优化公平性与准确性,从而处理缺失值并确保公平性。该方法在真实世界数据集上优于在插补数据上训练的公平性感知模型,表明当缺失模式在不同群体间不同时,单独进行插补和公平性修正会导致偏差结果。
We investigate the fairness concerns of training a machine learning model using data with missing values. Even though there are a number of fairness intervention methods in the literature, most of them require a complete training set as input. In practice, data can have missing values, and data missing patterns can depend on group attributes (e.g. gender or race). Simply applying off-the-shelf fair learning algorithms to an imputed dataset may lead to an unfair model. In this paper, we first theoretically analyze different sources of discrimination risks when training with an imputed dataset. Then, we propose an integrated approach based on decision trees that does not require a separate process of imputation and learning. Instead, we train a tree with missing incorporated as attribute (MIA), which does not require explicit imputation, and we optimize a fairness-regularized objective function. We demonstrate that our approach outperforms existing fairness intervention methods applied to an imputed dataset, through several experiments on real-world datasets.
研究动机与目标
- 探究当缺失模式在社会人口学群体间不同时,标准公平性算法在插补数据上应用是否仍能保持公平性。
- 识别并分析在数据插补后应用公平性干预这一常见做法中,三种不同的歧视风险来源。
- 开发一种端到端方法,无需显式插补即可联合优化公平性与准确性,从而在群体依赖的缺失模式下保持公平性。
- 通过实验表明,所提出方法在公平性-准确性权衡上优于现有公平性算法在插补数据集上的表现。
提出的方法
- 该方法使用缺失值作为属性(MIA),将缺失性视为决策树分裂中的独立类别,从而消除显式插补的需要。
- 将学习目标表述为混合整数规划(MIP),联合优化模型准确性和公平性,采用公平性正则化的目标函数。
- 将公平性约束直接整合到树构建过程中,确保公平性与预测性能同步优化。
- 使用公平树的集成模型(Fair MIP Forest)以提升泛化能力并减少训练时间,相较于单棵树更具优势。
- 公平性正则化参数(λ)通过调优以平衡准确性和公平性,在不同数据集上测试了不同取值。
- 该方法在三个真实世界数据集(HSLS、COMPAS 和 Adult)上进行评估,人工设计的缺失模式旨在反映群体依赖的缺失模式。
实验结果
研究问题
- RQ1当缺失模式在社会人口学群体间不同时,对插补数据应用公平性算法是否仍能保持公平性?
- RQ2在使用独立的插补与公平性修正流程时,歧视风险的三个主要来源是什么?
- RQ3能否设计一种统一框架,联合处理缺失数据与公平性,从而优于标准的两阶段方法(先插补后修正)?
- RQ4是否存在一种普遍公平的插补方法在不同下游学习任务中均适用的根本性限制?
- RQ5在具有群体依赖缺失模式的数据集中,所提出的 Fair MIP Forest 方法与现有公平性算法在公平性-准确性权衡上的表现如何比较?
主要发现
- 研究识别出两阶段插补-公平性流程中存在三种关键的歧视风险来源:群体间插补偏差、训练与推理阶段插补不一致,以及无法实现普遍公平的插补方法。
- Fair MIP Forest 在 HSLS、COMPAS 和 Adult 数据集上,相较于在插补数据上应用公平性算法的方法,实现了更优的公平性-准确性权衡。
- 在 HSLS 数据集中,Fair MIP Forest 显著减少了白人学生与代表性不足的少数族裔(URM)学生在预测结果上的公平性差异,尤其体现在次级照护人教育程度和大学规划等变量上。
- 该方法在高缺失率下仍保持高准确性,同时显著降低了不同人口群体间的假阳性和假阴性率差异。
- 30 棵树的集成模型,树深为 3,每棵树限制 60 秒训练时间,在所有数据集中实现了性能与计算成本的最佳平衡。
- 公平性正则化的 MIP 公式成功平衡了公平性与准确性,最优 λ 值分别为:HSLS 为 0.1,COMPAS 为 1.0,Adult 为 3.0。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。