[论文解读] Fairness in Algorithmic Profiling: A German Case Study
本研究利用行政数据评估了德国求职者长期失业预测的统计模型,比较了逻辑回归、惩罚回归、随机森林和梯度提升模型。研究发现,分类政策显著影响公平性,非德国籍求职者在高风险群体中被系统性地低估优先级,强调了在算法画像系统中实施严格审计以防止歧视的必要性。
Algorithmic profiling is increasingly used in the public sector as a means to allocate limited public resources effectively and objectively. One example is the prediction-based statistical profiling of job seekers to guide the allocation of support measures by public employment services. However, empirical evaluations of potential side-effects such as unintended discrimination and fairness concerns are rare. In this study, we compare and evaluate statistical models for predicting job seekers' risk of becoming long-term unemployed with respect to prediction performance, fairness metrics, and vulnerabilities to data analysis decisions. Focusing on Germany as a use case, we evaluate profiling models under realistic conditions by utilizing administrative data on job seekers' employment histories that are routinely collected by German public employment services. Besides showing that these data can be used to predict long-term unemployment with competitive levels of accuracy, we highlight that different classification policies have very different fairness implications. We therefore call for rigorous auditing processes before such models are put to practice.
研究动机与目标
- 评估使用真实行政数据预测德国求职者长期失业的统计模型的预测性能。
- 研究不同分类政策(如针对风险评分前10%、25%或中间50%)对公平性结果的影响。
- 考察数据处理决策(如训练数据时间段和阈值选择)对统计差异等公平性指标的影响。
- 评估并探讨受保护属性(性别、国籍)是否在未被纳入训练的情况下仍会影响模型预测。
- 倡导在部署前对算法画像系统进行系统性审计,以防止无意中的歧视。
提出的方法
- 在匿名化的德国劳动力市场行政数据上训练了四种机器学习模型:逻辑回归、惩罚逻辑回归、随机森林和梯度提升。
- 通过使用不同的历史训练窗口(完整数据与时间受限数据)构建了两种模型变体,以评估对数据可用性的敏感性。
- 实施了三种分类政策:针对预测长期失业风险评分的前10%(极高风险)、前25%(高风险)和中间50%(中等风险)。
- 使用标准指标(如准确率、AUC)衡量预测性能,并通过受保护群体(性别、国籍)之间的统计差异衡量公平性。
- 通过控制教育水平进行条件公平性分析,以隔离受保护属性的影响。
- 在不同阈值和数据约束条件下评估模型行为,以检验其稳健性及对设计选择的敏感性。
实验结果
研究问题
- RQ1使用真实行政数据时,不同机器学习模型在预测德国求职者长期失业方面的表现如何?
- RQ2不同分类政策(如针对前10%与中间50%)如何影响公共就业服务机构中基于风险的优先排序的公平性?
- RQ3即使在训练中未包含这些属性,模型预测在性别和国籍之间是否存在系统性差异?
- RQ4数据处理决策(如训练数据持续时间与阈值选择)如何影响算法画像中的公平性结果?
- RQ5观察到的差异对政策设计有何影响,特别是对肯定性行动和反歧视目标的影响?
主要发现
- 模型实现了具有竞争力的预测准确率,性能与其它国家类似系统相当,表明其在德国公共就业服务中具有实际部署的强潜力。
- 所有模型均加剧了男性与女性求职者之间以及德国籍与非德国籍求职者之间的长期失业分类率差异,即使在训练中未包含受保护属性。
- 统计差异在国籍方面比性别更为显著,非德国籍求职者在前10%和前25%政策下被归类为高风险的可能性更低。
- 聚焦于中等风险案例的分类政策逆转了这一趋势,提高了非德国籍求职者被归类为高风险的可能性,表明公平性结果依赖于政策设计。
- 控制教育水平后,公平性差异有所减少但未完全消除,表明与国籍相关的未观测或代理变量仍会影响预测。
- 时间受限的训练数据并未显著减少公平性差异,表明即使在历史数据有限的情况下,模型仍能稳健地捕捉结构性劳动力市场不平等。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。