Skip to main content
QUICK REVIEW

[论文解读] To Trust, or Not to Trust? A Study of Human Bias in Automated Video Interview Assessments

Chee Wee Leong, Katrina Crotts Roohr|arXiv (Cornell University)|Nov 27, 2019
Social and Intergroup Psychology被引用 8
一句话总结

本研究通过分析外貌、种族和性别等人口统计与视觉元数据如何影响人工评分员的评分,并进而影响基于这些评分训练的机器学习模型,探究了自动化视频面试评估中的人类偏见。尽管偏见特征与模型预测之间的相关性较低,但这些元数据对模型表现有显著影响,引发了人们对高风险招聘系统公平性的担忧。

ABSTRACT

Supervised systems require human labels for training. But, are humans themselves always impartial during the annotation process? We examine this question in the context of automated assessment of human behavioral tasks. Specifically, we investigate whether human ratings themselves can be trusted at their face value when scoring video-based structured interviews, and whether such ratings can impact machine learning models that use them as training data. We present preliminary empirical evidence that indicates there might be biases in such annotations, most of which are visual in nature.

研究动机与目标

  • 探究人工评分员在评分基于视频的结构化面试时是否表现出隐性偏见。
  • 评估人工标注标签中的此类偏见是否会在训练模型时传播并影响机器学习模型的性能。
  • 评估人口统计与视觉元数据(例如外貌、种族、性别)对人工评分和自动化预测模型的影响。
  • 探索利用多模态深度学习和偏见元数据增强技术检测与缓解自动化评估系统中偏见的方法。
  • 确定即使与核心表现构念无关,偏见特征是否仍对模型表现有实质性贡献。

提出的方法

  • 通过亚马逊机械 Turk 从美国参与者处收集了 1,887 份结构化视频面试数据,采用标准化问题和七点评分制。
  • 由五名训练过的评分员对每份面试进行评分,取平均分作为真实标签,组内一致性信度(ICC)为 0.79,平均相关性(R_mean)为 0.74。
  • 为每位面试者在 10 个类别中进行偏见元数据标注:环境、墙面、性别、外貌、种族、年龄、体重、面部特征、口音。
  • 使用包含 2D 卷积和门控循环单元(GRUs)的深度神经网络(DNN)对多模态特征(音频与视频)进行训练,将面试表现作为二分类任务进行预测。
  • 采用两种方法对 DNN 模型进行增强:(1)与偏见预测结果进行逐元素逻辑与运算;(2)通过堆叠泛化方法结合 DNN 概率值与原始偏见元数据。
  • 使用 F1 分数评估模型性能,并进行统计分析(Wilcoxon 符号秩检验、Cohen’s Kappa 系数以及随机森林特征重要性分析)。

实验结果

研究问题

  • RQ1人工评分员在视频面试评分中在多大程度上反映了与外貌、种族、性别及其他人口统计因素相关的偏见?
  • RQ2这些人工标注的偏见如何影响基于此类标签训练的机器学习模型的性能?
  • RQ3偏见元数据能否提升或扭曲多模态模型在自动化面试评估中的预测能力?
  • RQ4偏见元数据特征与 DNN 模型预测之间的相关性如何?这是否表明存在与构念无关的影响?
  • RQ5尽管与实际表现构念的相关性较低,人口统计元数据特征是否仍对模型表现有实质性贡献?

主要发现

  • 多模态 DNN 模型在测试集上取得了 0.70 的 F1 分数,优于先前的 SVM 基线模型(F1 = 0.66)。
  • 使用堆叠泛化方法进行偏见元数据增强的模型整体 F1 性能优于逻辑与方法。
  • 偏见元数据与模型预测之间的 Cohen’s Kappa 值接近零(例如,性别:κ = 0.04),表明一致性极低。
  • 尽管相关性较低,偏见元数据特征在随机森林模型中共同贡献了 27% 的特征重要性,表明其影响不可忽视。
  • DNN 模型本身占特征重要性的 9%,排名最高,表明其捕捉了大部分表现方差。
  • 结果表明,尽管与核心表现特征无关,人口统计与视觉元数据仍显著影响模型预测,这在高风险招聘应用中引发了公平性方面的担忧。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。