Skip to main content
QUICK REVIEW

[论文解读] Evaluation of Fairness Trade-offs in Predicting Student Success

Hansol Lee, René F. Kizilcec|arXiv (Cornell University)|Jun 30, 2020
Online Learning and Analytics参考文献 9被引用 9
一句话总结

本研究利用美国一所研究型大学的行政数据,评估了学生成功预测模型中的公平性权衡,通过事后阈值调整提升机会均等性。研究发现,优化单一公平性指标(机会均等性)会恶化正向预测均等性和人口均等性,揭示了教育人工智能系统中各类公平性标准之间的固有权衡。

ABSTRACT

Predictive models for identifying at-risk students early can help teaching staff direct resources to better support them, but there is a growing concern about the fairness of algorithmic systems in education. Predictive models may inadvertently introduce bias in who receives support and thereby exacerbate existing inequities. We examine this issue by building a predictive model of student success based on university administrative records. We find that the model exhibits gender and racial bias in two out of three fairness measures considered. We then apply post-hoc adjustments to improve model fairness to highlight trade-offs between the three fairness measures.

研究动机与目标

  • 使用真实世界的行政数据,研究学生成功预测模型中的公平性权衡。
  • 评估事后阈值调整对三种统计公平性度量的影响:人口均等性、机会均等性和正向预测均等性。
  • 研究针对某一公平性标准进行优化,如何影响模型在性别和种族/族裔群体中的准确率与公平性。
  • 展示在教育预测建模中,公平性度量不可能结果的实际影响。

提出的方法

  • 使用2014年秋季至2019年春季的5,443名学生记录,训练了一种随机森林模型,特征包括人口统计学信息、考试成绩、GPA和先前课程成绩。
  • 模型预测六门必修课程中取得中等及以上成绩,其中78.4%的数据用于训练,21.6%用于测试。
  • 通过事后阈值调整实现机会均等性:男性与女性学生的阈值分别为0.48和0.58,非URM与URM学生的阈值分别为0.46和0.59。
  • 使用三种度量评估公平性:人口均等性(正向预测率相等)、机会均等性(各群体召回率相等)和正向预测均等性(各群体精确率相等)。
  • 通过相等比例检验评估群体差异的统计显著性,p值报告为p < 0.001、p < 0.05和p < 0.1。

实验结果

研究问题

  • RQ1标准的学生成功预测模型在性别和种族/族裔群体中的公平性表现如何?
  • RQ2在事后调整模型阈值时,人口均等性、机会均等性和正向预测均等性之间的权衡是什么?
  • RQ3将机会均等性作为优化目标,对其他公平性度量的公平性影响有多大?
  • RQ4是否可能在不加剧其他不公平性的情况下,使模型对某一公平性标准实现公平?

主要发现

  • 原始模型表现出显著偏差:URM学生比非URM学生召回率低20.2%(p < 0.001),男性学生比女性学生召回率低10.5%(p < 0.001),违反了机会均等性。
  • 在调整阈值以实现机会均等性后,URM/非URM群体的召回率差异降至0.1%,男性/女性群体的差异降至-0.1%,表明公平性得到成功改善。
  • 人口均等性在修正后得到改善:正向预测率差异从28.1%(URM对非URM)降至8.0%(p < 0.05),性别差异从12.9%降至1.0%。
  • 正向预测均等性恶化:URM/非URM群体的精确率差异从1.7%上升至6.8%,男性/女性群体的差异从5.2%上升至8.7%,表明非URM和女性学生的精确率更高。
  • 模型准确率对URM学生略有提升(从0.695升至0.736),对非URM学生保持稳定,整体测试准确率为0.73。
  • 结果证实,无法同时满足所有三项公平性度量,因为提升一项指标会导致其他指标的退化,尤其是正向预测均等性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。