Skip to main content
QUICK REVIEW

[논문 리뷰] To Trust, or Not to Trust? A Study of Human Bias in Automated Video Interview Assessments

Chee Wee Leong, Katrina Crotts Roohr|arXiv (Cornell University)|2019. 11. 27.
Social and Intergroup Psychology인용 수 8
한 줄 요약

이 연구는 인간 평가자들이 자동화된 영상 인터뷰 평가에서 어떻게 편향을 보이는지 분석함으로써, 외모, 인종, 성별 등의 인구통계학적 및 시각적 메타데이터가 인간 평가자의 점수에 영향을 주고, 그 결과 기계학습 모델에 영향을 미치는지 조사한다. 편향 특성과 모델 예측 간 상관관계가 낮음에도 불구하고 이러한 메타데이터는 성능에 상당한 영향을 미치며, 고위험 채용 시스템에서의 공정성 문제를 제기한다.

ABSTRACT

Supervised systems require human labels for training. But, are humans themselves always impartial during the annotation process? We examine this question in the context of automated assessment of human behavioral tasks. Specifically, we investigate whether human ratings themselves can be trusted at their face value when scoring video-based structured interviews, and whether such ratings can impact machine learning models that use them as training data. We present preliminary empirical evidence that indicates there might be biases in such annotations, most of which are visual in nature.

연구 동기 및 목표

  • 영상 기반의 표준화된 인터뷰에서 인간 평가자가 암묵적인 편향을 보이는지 조사하기.
  • 인간에 의해 주어진 레이블에 포함된 이러한 편향이 기계학습 모델에 전파되고 영향을 미치는지 평가하기.
  • 외모, 인종, 성별 등 인구통계학적 및 시각적 메타데이터가 인간 평가 점수와 자동화된 예측 모델에 미치는 영향 평가하기.
  • 다중모달 딥 러닝과 편향 메타데이터 증강을 활용한 자동 평가 시스템에서 편향 탐지 및 완화 방법 탐색하기.
  • 핵심 성과 구성요소와 상관관계가 낮더라도 편향 특성이 모델 성능에 의미 있게 기여하는지 확인하기.

제안 방법

  • 미국 참가자들로부터 1,887개의 표준화된 영상 인터뷰 데이터셋을 아마존 메카니컬 터크를 통해 수집함. 질문은 동일하고, 7점 리커트 척도로 평가함.
  • 다섯 명의 훈련된 평가자가 각 인터뷰를 평가하고 평균 점수를 산출하여 신뢰도를 확보함. ICC = 0.79, R_mean = 0.74.
  • 각 인터뷰이에 대해 10개 카테고리(환경, 벽, 성별, 외모, 인종, 나이, 체중, 얼굴 기형, 발음)에 대해 편향 메타데이터를 주석 처리함.
  • 음성 및 영상의 다중모달 특징을 기반으로 2D 컨볼루션과 GRU를 사용한 딥 네ural 네트워크(DNN)를 훈련하여 성과 예측을 이진 분류 문제로 수행함.
  • DNN 모델을 두 가지 방법으로 증강함: (1) 편향 예측과 요소별 논리곱 연산 적용, (2) DNN 확률과 원본 편향 메타데이터를 결합한 스태킹 일반화.
  • 모델 성능 평가에 F1 점수를 사용하고, 통계 분석(윌콕슨의 순서합 검정, 코헨의 카파, 랜덤 포레스트 기능 중요도)을 실시함.

실험 결과

연구 질문

  • RQ1영상 인터뷰에서 인간 평가자의 점수가 외모, 인종, 성별 등 인구통계학적 요인과 관련된 편향을 얼마나 반영하고 있는가?
  • RQ2이러한 인간 주석 편향이 이러한 레이블 기반으로 훈련된 기계학습 모델의 성능에 어떻게 영향을 미치는가?
  • RQ3편향 메타데이터는 다중모달 모델의 예측 능력을 향상시키거나 왜곡시키는가?
  • RQ4편향 메타데이터 특성과 DNN 모델의 예측 간 상관관계는 얼마이며, 이는 구성요소와 무관한 영향을 의미하는가?
  • RQ5실제 성과 구성요소와의 상관관계가 낮음에도 불구하고 인구통계학적 메타데이터 특성이 모델 성능에 의미 있게 기여하는가?

주요 결과

  • 다중모달 DNN 모델은 테스트 세트에서 F1 점수 0.70을 기록하여 이전의 SVM 기반 베이스라인(F1 = 0.66)을 초월함.
  • 편향 메타데이터 증강을 위한 스태킹 일반화 방법이 논리곱 접근법보다 더 높은 전체 F1 성능을 기록함.
  • 편향 메타데이터와 모델 예측 간 코헨의 카파 값은 근처 0에 가까움(예: 성별: κ = 0.04), 즉 매우 낮은 일치도를 보임.
  • 낮은 상관관계에도 불구하고 편향 메타데이터 특성은 랜덤 포레스트 모델에서 기능 중요도의 27% 기여함으로써 비중 있는 영향을 미침.
  • DNN 모델 자체는 기능 중요도의 9% 기여를 하며 랭킹 상위를 차지함으로써, 대부분의 성과 변동성을 반영함.
  • 결과적으로 핵심 성과 특성과 상관관계가 없음에도 불구하고 인구통계학적 및 시각적 메타데이터가 여전히 모델 예측에 상당한 영향을 미치며, 고위험 채용 응용 분야에서의 공정성 문제를 제기함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.