Skip to main content
QUICK REVIEW

[논문 리뷰] Regional Negative Bias in Word Embeddings Predicts Racial Animus--but only via Name Frequency

Austin van Loon, Salvatore Giorgi|arXiv (Cornell University)|2022. 01. 20.
Opinion Dynamics and Social Influence인용 수 4
한 줄 요약

이 논문은 미국 메트로폴리탄 지역에서의 워드 임베딩 연관 테스트(WEAT)를 통해 추정된 반흑인 편견이 실제 언어적 편견이 아니라, 소셜 미디어 데이터에서 흑인 성씨의 상대 빈도에 의해 유도된 결과물임을 입증한다. 성씨 빈도를 보정한 후에는 WEAT 점수와 인종적 증오도를 측정하는 지표들—예: 암묵적 편견과 분리 정도—사이의 모든 상관관계가 사라지며, 이는 의미적 편견이 아니라 용어 빈도에 기반한 오락성 관계임을 드러낸다.

ABSTRACT

The word embedding association test (WEAT) is an important method for measuring linguistic biases against social groups such as ethnic minorities in large text corpora. It does so by comparing the semantic relatedness of words prototypical of the groups (e.g., names unique to those groups) and attribute words (e.g., 'pleasant' and 'unpleasant' words). We show that anti-black WEAT estimates from geo-tagged social media data at the level of metropolitan statistical areas strongly correlate with several measures of racial animus--even when controlling for sociodemographic covariates. However, we also show that every one of these correlations is explained by a third variable: the frequency of Black names in the underlying corpora relative to White names. This occurs because word embeddings tend to group positive (negative) words and frequent (rare) words together in the estimated semantic space. As the frequency of Black names on social media is strongly correlated with Black Americans' prevalence in the population, this results in spurious anti-Black WEAT estimates wherever few Black Americans live. This suggests that research using the WEAT to measure bias should consider term frequency, and also demonstrates the potential consequences of using black-box models like word embeddings to study human cognition and behavior.

연구 동기 및 목표

  • 미국 메트로폴리탄 지역에서 WEAT 기반의 반흑인 언어적 편견 추정치가 진정한 인종적 증오도를 반영하는지 아니면 방법론적 오류를 반영하는지 조사하기 위해.
  • WEAT 점수와 지역적 인종적 증오도 측정치 사이의 관찰된 상관관계가 관측되지 않은 변수로 인해 오락성인지 여쭤보기 위해.
  • 소셜 미디어 코퍼스에서 흑인 성씨의 상대 빈도가 워드 임베딩에서 나타나는 명백한 반흑인 편견을 설명하는지 테스트하기 위해.
  • 기본 사회인구통계적 보정 조치를 적용했을 때 WEAT가 언어적 편견 측정치로 얼마나 견고한지 평가하기 위해.
  • 어떤 종류의 혼동 요인(예: 용어 빈도)을 고려하지 않은 채 블랙박스 NLP 모델(예: 워드 임베딩)을 사용해 인간의 인지 및 사회적 태도를 연구할 경우 발생할 수 있는 위험을 부각하기 위해.

제안 방법

  • 연구는 메트로폴리탄 통계지역(MSA) 수준에서 워드 임베딩의 코사인 유사도를 이용해 WEAT 점수를 산출하기 위해 지리적 태그가 부여된 미국 티커트 데이터를 사용한다. 이는 흑인 성씨, 백인 성씨, 긍정/부정적 속성어 단어의 워드 임베딩 간 유사도를 측정함으로써 반흑인 편견을 측정한다.
  • WEAT 점수와 인종적 증오도 측정치(예: 암묵적 편견 테스트(IAT) 점수 및 주거 분리도) 사이의 관계를 검증하기 위해 다중 회귀 모델을 적용한다.
  • 핵심 방법론적 혁신은 상대적 흑인 성씨 빈도—즉, 코퍼스에서 고유한 흑인 성씨 비율을 백인 성씨 비율 대비로 정의한 변수를 제어 변수로 포함시키는 것이다.
  • 이들은 이름 빈도 제어 유무에 따라 모델의 적합도와 계수 유의성의 차이를 비교하여 그 제어 변수의 설명력의 크기를 분리해낸다.
  • 비율에 따른 흑인 거주자 비율과 데이터 내 흑인 성씨 비율 간 강한 상관관계를 보여주기 위해 LOWESS 스무딩을 사용한다.
  • 분석은 워드 임베딩을 티커트 코퍼스에서 학습한 Word2Vec 기반으로 수행되며, WEAT 점수는 표준 공식에 따라 속성어와 범주어 쌍 간의 평균 코사인 유사도를 사용해 계산된다.

실험 결과

연구 질문

  • RQ1WEAT는 미국 지역 사회 미디어 코퍼스에서 진정한 반흑인 언어적 편견을 감지하는가, 아니면 인구통계적 요인에 의해 혼동되는가?
  • RQ2코퍼스 내 흑인 성씨의 상대 빈도가 WEAT 점수와 인종적 증오도 측정치 사이의 관찰된 상관관계를 어느 정도 설명하는가?
  • RQ3기본 사회인구통계적 보정 조치가 워드 임베딩에서 용어 빈도로 인한 편향을 보정하는 데 충분한가?
  • RQ4관찰된 반흑인 WEAT 점수는 실제 인종적 태도와 무관하게 흑인 성씨의 빈도로 완전히 설명될 수 있는가?
  • RQ5이 혼동 요인이 계산사회과학 분야에서 워드 임베딩을 사용해 문화적 또는 사회적 편견을 측정할 때 어떤 함의를 지니는가?

주요 결과

  • Project Implicit의 암묵적 편견(IAT) 점수와 WEAT 추정치 사이의 상관관계는 보정하지 않은 상태에서는 유의미하지만, 상대적 흑인 성씨 빈도를 보정한 후에는 유의미하지 않아진다.
  • 이주 분리도와 WEAT 점수 사이의 관계도 이름 빈도를 제어 변수로 포함시키면 사라진다.
  • 이름 빈도를 보정함으로써 WEAT 상관관계의 크기가 모든 표준 사회인구통계적 보정 조치를 합친 것보다 더 크게 감소한다.
  • 코퍼스 내 흑인 이름 비율은 관찰된 반흑인 WEAT 점수의 50퍼센트 이상의 분산을 설명하며, 강력한 혼동 효과임을 시사한다.
  • 이 연구는 WEAT 추정치가 의미적 편견을 측정하는 것이 아니라, 데이터 내 흑인 이름의 희귀성에 대한 잡음이 많은 지표임을 발견한다.
  • 결과적으로 워드 임베딩은 용어 빈도와 긍정성의 혼합을 초래하며, 지역 간 그룹의 표현 방식이 다를 경우 오락성 편견 추정치를 초래한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.