Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Gender Bias in Transformer-based Models: A Case Study on BERT

Bingbing Li, Hongwu Peng|arXiv (Cornell University)|2021. 10. 15.
Topic Modeling참고 문헌 19인용 수 11
한 줄 요약

이 논문은 주로 성별 대명사와 직업 간의 주의 점수를 분석하여 BERT 내 성별 편향을 탐지하기 위한 주의 맵 기반의 새로운 방법을 제안한다. 분석 결과, 쿼리 및 킷지 행렬 ($\mathbf{W_q}$, $\mathbf{W_k}$)이 다른 모듈보다 훨씬 더 많은 성별 편향을 유발하며, 편향이 모델 내에서 주기적으로 전파되고 $\mathbf{Q}$, $\mathbf{K}$, $\mathbf{V}$ 및 잔차층에서 증폭되지만, 평균 주의 맵을 통해 감소됨을 밝혀냈다.

ABSTRACT

In this paper, we propose a novel gender bias detection method by utilizing attention map for transformer-based models. We 1) give an intuitive gender bias judgement method by comparing the different relation degree between the genders and the occupation according to the attention scores, 2) design a gender bias detector by modifying the attention module, 3) insert the gender bias detector into different positions of the model to present the internal gender bias flow, and 4) draw the consistent gender bias conclusion by scanning the entire Wikipedia, a BERT pretraining dataset. We observe that 1) the attention matrices, Wq and Wk introduce much more gender bias than other modules (including the embedding layer) and 2) the bias degree changes periodically inside of the model (attention matrix Q, K, V, and the remaining part of the attention layer (including the fully-connected layer, the residual connection, and the layer normalization module) enhance the gender bias while the averaged attentions reduces the bias).

연구 동기 및 목표

  • BERT의 내부 표현 내에서 직업과 관련된 성별 편향이 존재하는지 조사하기 위해.
  • 평가 시 위치 기반 편향을 피하는 주의 맵을 활용한 성별 편향 탐지 방법을 개발하기 위해.
  • 변환기 아키텍처의 다양한 구성 요소를 통해 성별 편향의 흐름을 추적하기 위해.
  • 대규모 위키백과 기반 데이터셋을 사용하여 층 간 편향 분포 및 강화 패턴을 분석하기 위해.

제안 방법

  • 위치 효과를 제거하기 위해 성별을 바꾼 문장 쌍을 사용하여 편향 탐지에서의 영향을 최소화한다. 남성/여성 대명사와 직업 간의 주의 점수를 비교한다.
  • 성별 대명사와 직업 토큰 간의 주의 점수 ($\mathbf{AS}$)를 추출하고 비교하여 성별 경향성 값을 계산한다.
  • 모델의 여러 위치(임bedding, $\mathbf{Q}$, $\mathbf{K}$, $\mathbf{V}$, $\mathbf{AvgAttention}$, 및 레이어 출력)에 성별 편향 탐지기를 삽입하여 내부 편향 흐름을 추적한다.
  • 주의 점수 행렬 ($\mathbf{AS}$)과 평균 주의 맵 ($\mathbf{AvgAttention}$)은 표준 변환기 공식을 사용하여 유도한다: $\mathbf{AS} = \mathrm{Softmax}(\frac{\mathbf{Q}\mathbf{K}^T}{\sqrt{D_k}})$ 및 $\mathbf{AvgAttention} = \mathbf{AS} \cdot \mathbf{V}$.
  • 남성 대명사와 여성 대명사 간 주의 점수의 차이를 사용하여 편향 정도를 정량화하며, 전체 위키백과 미리훈련 데이터셋에서 일관성을 검증한다.
  • 상자 그림과 차이 곡선을 사용하여 144개의 주의 헤드와 12개의 레이어에서 편향 분포 및 강화 확률에 대한 통계 분석을 수행한다.

실험 결과

연구 질문

  • RQ1성별 편향이 직업과 관련하여 BERT의 내부 표현, 특히 주의 메커니즘 내에서 나타나는가?
  • RQ2주의 메커니즘이 다양한 레이어와 구성 요소에서 성별 편향을 어떻게 증폭하거나 감소시키는가?
  • RQ3자기 주의 모듈의 특정 구성 요소들 — $\mathbf{W_q}$, $\mathbf{W_k}$, $\mathbf{W_v}$, $\mathbf{Q}$, $\mathbf{K}$, $\mathbf{V}$, $\mathbf{AvgAttention}$, 또는 잔차층 — 중에서 성별 편향에 가장 크게 영향을 주는 것은 무엇인가?
  • RQ4전체 미리훈련 데이터셋에서 성별 편향이 일관된가? 그리고 강화 또는 완화의 주기적 패턴을 보이는가?

주요 결과

  • 쿼리 ($\mathbf{W_q}$) 및 킷지 ($\mathbf{W_k}$) 행렬이 임베딩 레이어를 포함한 다른 구성 요소보다 훨씬 더 많은 성별 편향을 유발한다.
  • 편향 정도는 주기적으로 변화한다: $\mathbf{Q}$, $\mathbf{K}$, $\mathbf{V}$ 및 주의 레이어의 잔차부분은 성별 편향을 증폭시키지만, 평균 주의 맵 ($\mathbf{AvgAttention}$)은 이를 감소시킨다.
  • 편향 증폭 확률은 $\mathbf{W_q}$ 및 $\mathbf{W_k}$ 에서 가장 높으며, $\mathbf{W_v}$ 는 덜 편향된 헤드에 기여한다.
  • 성별 편향 값의 분포를 보면, $\mathbf{Q}$ 와 $\mathbf{K}$ 가 $\mathbf{W_v}$ 를 포함한 다른 구성 요소보다 더 큰 편향 크기를 가진다.
  • $\mathbf{W_q}$, $\mathbf{W_k}$ 및 최종 레이어 출력에서 편향된 주의 헤드의 비율이 크게 증가하여, 이 구성 요소들이 편향을 증폭시킨다는 것을 시사한다.
  • 전체 위키백과 미리훈련 데이터셋에서 성별 편향 결론의 일관성은 관측된 편향 패턴이 특정 입력의 산물이 아니라 강건하다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.