[论文解读] FAHT: An Adaptive Fairness-aware Decision Tree Classifier
FAHT 是 Hoeffding Tree 算法在数据流分类任务中的公平性感知扩展,通过引入一种新颖的公平信息增益分裂准则,在预测准确率与公平性之间实现平衡。它能自适应地减少演化数据流中的歧视行为,同时保持适中的性能表现,在公平性指标上优于标准 Hoeffding Tree,且不损失模型可解释性。
Automated data-driven decision-making systems are ubiquitous across a wide spread of online as well as offline services. These systems, depend on sophisticated learning algorithms and available data, to optimize the service function for decision support assistance. However, there is a growing concern about the accountability and fairness of the employed models by the fact that often the available historic data is intrinsically discriminatory, i.e., the proportion of members sharing one or more sensitive attributes is higher than the proportion in the population as a whole when receiving positive classification, which leads to a lack of fairness in decision support system. A number of fairness-aware learning methods have been proposed to handle this concern. However, these methods tackle fairness as a static problem and do not take the evolution of the underlying stream population into consideration. In this paper, we introduce a learning mechanism to design a fair classifier for online stream based decision-making. Our learning model, FAHT (Fairness-Aware Hoeffding Tree), is an extension of the well-known Hoeffding Tree algorithm for decision tree induction over streams, that also accounts for fairness. Our experiments show that our algorithm is able to deal with discrimination in streaming environments, while maintaining a moderate predictive performance over the stream.
研究动机与目标
- 解决由于历史数据存在偏差而导致自动化决策系统缺乏公平性的问题。
- 克服静态公平性方法的局限性,实现对数据流分布演化的自适应能力。
- 开发一种决策树分类器,在保持高预测性能的同时,最小化对敏感群体的歧视。
- 提出一种公平信息增益准则,在树构建过程中联合优化准确率与公平性。
- 通过优先选择与敏感属性相关性较低的特征作为决策边界依据,确保模型可解释性。
提出的方法
- 提出一种公平信息增益(FIG)分裂准则,将传统信息增益与公平性增益项结合,对可能加剧歧视的分裂操作施加惩罚。
- 修改 Hoeffding Tree 算法,使用 FIG 替代标准信息增益进行节点分裂,从而实现在数据流上的在线学习。
- 采用统计均等性作为公平性度量标准,确保敏感群体与非敏感群体的正向分类率相等。
- 采用预序贯(先测试后训练)评估设置,实现实时模型更新,标签一旦可用即可立即应用。
- 重构决策边界以最小化与敏感属性的相关性,降低由相关特征引发的间接偏见。
- 实现自适应模型更新机制,能够响应数据分布的变化,同时保持公平性约束。
实验结果
研究问题
- RQ1公平性感知决策树能否在保持预测性能的前提下,有效适应演化中的数据流?
- RQ2所提出的公平信息增益准则相较于标准信息增益,在公平性与准确率方面表现如何?
- RQ3与标准 Hoeffding Tree 相比,FAHT 在多大程度上降低了敏感属性与决策边界之间的相关性?
- RQ4在公平性约束下,FAHT 的模型复杂度(如节点数量)与标准 Hoeffding Tree 相比如何?
- RQ5在流式环境中,特征选择对公平性与模型可解释性有何影响?
主要发现
- FAHT 在 Adult 数据集上的歧视得分显著低于标准 Hoeffding Tree,敏感属性与预测边界的相关性降低了 21%(从 -0.21 降至 -0.20)。
- FAHT 的模型复杂度低于 HT,树中节点数量更少,表明其结构更具保守性,可能更具可解释性。
- FAHT 保持了适中的预测性能,预测值与真实类别边界的相关性为 0.23,而 HT 为 0.52,表明其与真实情况的对齐程度更高。
- 公平信息增益准则成功降低了敏感属性对决策边界的影响,表现为敏感属性与预测分裂之间皮尔逊相关系数更低。
- FAHT 多次重新选择 'age' 作为关键分裂属性,该属性与收入强相关,且相比 'capital-gain' 更少存在偏见,从而实现更公平且更稳定的预测。
- 模型通过动态调整分裂策略,展现出对演化数据流的适应能力,同时保持公平性,适用于现实世界中的在线应用场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。