Skip to main content
QUICK REVIEW

[论文解读] Bias In, Bias Out? Evaluating the Folk Wisdom

Ashesh Rambachan, Jonathan Roth|arXiv (Cornell University)|Sep 18, 2019
Anthropology: Ethics, History, Culture参考文献 28被引用 22
一句话总结

本文挑战了‘偏见输入,偏见输出’的常识,表明在选择性标注和未观测变量的情境下,算法决策规则可能逆转偏见:警察对某一群体的种族偏见越严重,其生成的算法对边缘化群体反而越有利。这种偏见逆转源于极端偏见导致训练数据中该群体被过度采样,从而减少了预测中的选择性偏见。

ABSTRACT

We evaluate the folk wisdom that algorithmic decision rules trained on data produced by biased human decision-makers necessarily reflect this bias. We consider a setting where training labels are only generated if a biased decision-maker takes a particular action, and so "biased" training data arise due to discriminatory selection into the training data. In our baseline model, the more biased the decision-maker is against a group, the more the algorithmic decision rule favors that group. We refer to this phenomenon as "bias reversal." We then clarify the conditions that give rise to bias reversal. Whether a prediction algorithm reverses or inherits bias depends critically on how the decision-maker affects the training data as well as the label used in training. We illustrate our main theoretical results in a simulation study applied to the New York City Stop, Question and Frisk dataset.

研究动机与目标

  • 评估算法决策规则是否必然继承人类决策者带来的偏见。
  • 探究在何种条件下,有偏见的训练数据会导致偏见反转而非偏见传播。
  • 阐明人类偏见的形式——尤其是其对样本选择与标签测量的影响——如何影响算法公平性。
  • 证明在特定情境下,允许算法使用群体身份(如种族)可减少而非增加歧视。

提出的方法

  • 作者构建了一个理论模型,包含三个核心要素:选择性标注(仅当决策者采取行动时才观测到标签)、基于偏好的歧视(决策者因偏好而偏袒或排斥特定群体)以及未观测变量(对标签具有预测力但未包含在训练数据中的特征)。
  • 推导出人类偏见增强时,算法对弱势群体产生优待的条件,这一现象被作者称为‘偏见反转’。
  • 利用纽约市‘盘查、询问与搜身’(SQF)数据集,通过调整黑人与白人个体的搜查阈值,模拟具有不同种族偏见水平的合成训练数据。
  • 使用逻辑回归对合成选择的数据估计违禁品存在的预测函数,同时改变选择过程中种族偏见的程度。
  • 比较不同偏见水平下的预测结果,测量随着偏见增加,高风险预测群体中黑人所占比例的变化。
  • 通过分析违禁品存在预测函数及合成搜查标志的预测函数对偏见增加的响应,验证理论结果。

实验结果

研究问题

  • RQ1在何种条件下,人类对训练数据的有偏选择会导致算法对边缘化群体产生优待,而非偏见传播?
  • RQ2影响选择但未出现在训练数据中的未观测变量,如何影响算法公平性?
  • RQ3当人类决策者的偏见影响样本选择而非测量标签时,算法预测会发生什么变化?
  • RQ4在预测任务中,允许算法使用群体身份(如种族)是否可减少而非增加歧视?
  • RQ5标签选择(如关注结果 vs. 人类决策)如何改变人类偏见与算法偏见之间的关系?

主要发现

  • 随着警察对非裔美国人偏见加剧(以对黑人更高的搜查阈值衡量),算法预测的高风险个体中非裔美国人比例下降,表明出现偏见反转。
  • 当警察极度偏见,对所有非裔美国人无差别搜查时,算法在训练数据中学习到非裔美国人携带违禁品的可能性较低,从而产生更优待的预测。
  • 对于估计违禁品存在的预测函数,偏见增加导致非裔美国人风险评分降低,证实‘偏见输入’导致‘优待输出’。
  • 相比之下,对于建模合成搜查决策本身的预测函数,偏见增加导致算法对非裔美国人预测搜查可能性更高,符合‘偏见输入,偏见输出’的常规直觉。
  • 模拟结果显示,当对非裔美国人的搜查比例达到95%(对比80%)时,高风险预测群体中非裔美国人占比显著下降,清晰展示了反转效应。
  • 即使算法仅基于可观测搜查数据进行训练,该结果依然成立,表明在选择性标注与未观测异质性条件下,偏见反转是该模型的稳健特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。