Skip to main content
QUICK REVIEW

[论文解读] An Empirical Study on Learning Fairness Metrics for COMPAS Data with Human Supervision

Hanchen Wang, Nina Grgić-Hlača|arXiv (Cornell University)|Oct 22, 2019
Ethics and Social Impacts of AI参考文献 30被引用 19
一句话总结

本文通过使用对COMPAS数据集中刑事再犯风险的调查中人类标注的判断,提出了一种学习个体公平性度量的方法。通过将度量学习算法(LMNN、MMC、LSML)应用于人类对再犯风险和保释决定的评分,研究发现,所学习的度量在捕捉人类一致的相似性方面显著优于欧几里得距离和基于精确度的基线方法,尤其是在使用三元组约束损失时,证明了仅从绝对人类判断中推断公平性度量的可行性。

ABSTRACT

The notion of individual fairness requires that similar people receive similar treatment. However, this is hard to achieve in practice since it is difficult to specify the appropriate similarity metric. In this work, we attempt to learn such similarity metric from human annotated data. We gather a new dataset of human judgments on a criminal recidivism prediction (COMPAS) task. By assuming the human supervision obeys the principle of individual fairness, we leverage prior work on metric learning, evaluate the performance of several metric learning methods on our dataset, and show that the learned metrics outperform the Euclidean and Precision metric under various criteria. We do not provide a way to directly learn a similarity metric satisfying the individual fairness, but to provide an empirical study on how to derive the similarity metric from human supervisors, then future work can use this as a tool to understand human supervision.

研究动机与目标

  • 探究是否可以利用人类对刑事再犯风险的标注判断来学习个体公平性度量。
  • 评估多种度量学习算法(LMNN、MMC、LSML)从绝对人类评分中学习公平性度量的性能。
  • 将学习到的度量与基线度量(欧几里得距离、精确度)在预测准确性和与人类判断的一致性方面进行比较。
  • 评估学习到的度量对超参数(如三元组约束中最小距离阈值σ)的敏感性。
  • 探讨绝对人类评分——在实际应用中易于获取——是否可作为训练公平性度量的有效替代方案,避免使用更复杂的相对判断数据。

提出的方法

  • 通过在线调查收集了来自ProPublica COMPAS数据集中200名随机选取被告的判断,使用五级李克特量表对再犯可能性和保释决定进行评分。
  • 从人类评分中构建三元组约束,以确保人类判断为更相似的个体在度量空间中距离更小。
  • 应用三种度量学习算法——大边缘最近邻(LMNN)、度量最大化聚类(MMC)和对数-求和-指数度量学习(LSML)——以学习具有公平意识的距离度量。
  • 使用三种评估损失:三元组相对比较损失(基于有序距离的合页损失)、kNN L1损失(预测与真实评分之间的ℓ1散度)和kNN L2损失(ℓ2散度)。
  • 对超参数进行调优,如LSML中的正则化系数α(设为0.01)和kNN损失中的邻居数k(设为5)。
  • 在人类判断数据和原始COMPAS数据集上评估学习到的度量,比较不同三元组约束构建阈值σ下的性能表现。

实验结果

研究问题

  • RQ1是否可以有效利用人类标注的再犯风险和保释决定的绝对评分来学习个体公平性度量?
  • RQ2与欧几里得距离和精确度等基线度量相比,不同度量学习算法(LMNN、MMC、LSML)在从人类判断中学习公平性度量方面的表现如何?
  • RQ3学习到的度量是否能很好地泛化到未见数据,特别是在保持与人类排序相似性判断一致方面?
  • RQ4学习到的度量性能对超参数(如三元组约束中的最小距离阈值σ)的敏感性如何?
  • RQ5在实际应用中常见且易于获取的绝对人类判断,是否可作为训练公平性度量的可行替代方案,从而避免使用更复杂的相对判断数据?

主要发现

  • 所学习的度量,特别是使用LSML算法时,在三元组相对比较损失上显著优于欧几里得距离和精确度基线,表明其与人类排序相似性判断的对齐性更好。
  • 在kNN L1和L2损失上,所学习的度量略微优于欧几里得距离和精确度基线,表明在评分恢复方面具有更高的预测准确性。
  • 随着三元组约束构建中阈值σ的增加,所有度量的损失均下降,证实了更大的类间距离使学习任务更简单。
  • 在σt = 6时,改进的LSML方法在ProPublica数据集上的损失为0.30 ± 0.034,优于欧几里得度量(0.31 ± 0.033)和基线LSML(0.29 ± 0.060)在相同阈值下的表现。
  • 结果表明,即使仅使用绝对人类评分,度量学习仍可生成与人类对相似性的感知一致的公平性度量。
  • 尽管各类方法在评分恢复上的预测性能相近,但三元组一致性损失揭示了显著差异,凸显了仅依赖准确性的评估不足以衡量公平性度量的优劣。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。