Skip to main content
QUICK REVIEW

[论文解读] Measuring Social Biases of Crowd Workers using Counterfactual Queries

Bhavya Ghai, Q. Vera Liao|arXiv (Cornell University)|Apr 4, 2020
Mobile Crowdsensing and Crowdsourcing参考文献 5被引用 8
一句话总结

本文提出了一种新颖的方法,通过反事实查询来衡量众包工作者的社会偏见,其中每个工作者对其查询及其人口统计学反事实(例如改变性别或种族)的标签进行比较,以计算偏见分数。该方法通过识别并降低有偏见标注者的权重,实现无偏见的数据集整理,而无需依赖自我报告或真实标签,为传统偏见测量技术提供了一种成本更低、隐蔽性更强的替代方案。

ABSTRACT

Social biases based on gender, race, etc. have been shown to pollute machine learning (ML) pipeline predominantly via biased training datasets. Crowdsourcing, a popular cost-effective measure to gather labeled training datasets, is not immune to the inherent social biases of crowd workers. To ensure such social biases aren't passed onto the curated datasets, it's important to know how biased each crowd worker is. In this work, we propose a new method based on counterfactual fairness to quantify the degree of inherent social bias in each crowd worker. This extra information can be leveraged together with individual worker responses to curate a less biased dataset.

研究动机与目标

  • 为解决众包训练数据集中存在的社会偏见这一关键问题,此类偏见可能在机器学习模型中持续造成不公平。
  • 开发一种方法,以量化个体众包工作者内在的社会偏见(例如性别、种族),而无需依赖自我报告调查或黄金标准标签。
  • 创建一种可扩展、隐蔽且成本效益高的技术,可无缝集成到现有的众包工作流程中。
  • 通过为每个工作者提供特定的偏见分数,实现更公平的标签聚合,从而改进数据整理。
  • 提供一种特别适用于主观标注任务的解决方案,其中真实标签无法获取或不切实际。

提出的方法

  • 该方法通过仅改变敏感属性(例如性别或种族)而保持其他所有特征不变,生成反事实查询。
  • 对于每个工作者,偏见分数计算为其在一组 n 个查询-反事实对中,对原始查询和其反事实所分配标签的平均绝对差值。
  • 通过在数值特征中注入噪声、对虚拟属性(例如姓名)进行修改以及对文本进行改写,对反事实进行混淆,以防止基于记忆的识别。
  • 该方法设计为对工作者不可见,通过避免明确的评估情境,减少社会期望偏差。
  • 该方法应用于数据整理阶段,其中偏见分数用于指导标签聚合——例如,降低或过滤掉高度有偏见的工作者。
  • 特别适用于主观任务(例如毒性评分),在这些任务中缺乏客观真实标签,使得传统公平性度量方法不适用。

实验结果

研究问题

  • RQ1如何客观地测量众包工作者的社会偏见,且不依赖自我报告或黄金标准标签?
  • RQ2基于反事实的偏见分数与传统公平性度量或自我报告偏见的相关程度如何?
  • RQ3该方法能否有效检测并量化主观标注任务中的种族或性别等人口统计学偏见?
  • RQ4如何通过混淆反事实来防止工作者识别出他们正被用于偏见评估?
  • RQ5工作者的偏见分数对下游数据集中聚合标签的公平性有何影响?

主要发现

  • 所提出的方法使用原始查询与反事实查询标签之间的平均绝对差值,计算每个工作者的特定偏见分数,零分表示完全公平。
  • 由于通过注入噪声、虚拟特征和改写对反事实进行混淆,该方法对记忆效应具有鲁棒性,可防止识别。
  • 该方法无需真实标签或黄金问题,因此成本低,且适用于缺乏客观标准的主观任务。
  • 通过将偏见分数整合到标签聚合中,该方法可在不改变原始标注工作流程的前提下,实现更少偏见的数据集整理。
  • 该技术避免了社会期望偏差,因为工作者并未意识到自己正在被评估,与自我报告调查不同。
  • 该方法提供了一种可扩展、自动化且透明的方式,在模型训练前的数据整理阶段评估和减轻偏见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。