Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring Fairness with Biased Rulers: A Survey on Quantifying Biases in Pretrained Language Models

Pieter Delobelle, Ewoenam Kwaku Tokpo|arXiv (Cornell University)|2021. 12. 14.
Ethics and Social Impacts of AI인용 수 12
한 줄 요약

이 논문은 BERT와 같은 컨텍스트 기반 언어 모델을 위한 공정성 메트릭스를 조사하며, 이들의 하류 작업에서의 편향과의 호환성과 상관관계를 평가한다. 내재된 메트릭스는 템플릿, 시드 단어, 임베딩 선택에 매우 민감하여 일관되지 않은 결과를 초래함을 발견한다; 저자들은 하류 작업에서의 외재적 공정성 평가를 우선시하고, 임베딩 기반 메트릭스보다 임베딩 무관 메트릭스인 DisCo나 LPBS를 사용할 것을 권장한다.

ABSTRACT

An increasing awareness of biased patterns in natural language processing resources, like BERT, has motivated many metrics to quantify `bias' and `fairness'. But comparing the results of different metrics and the works that evaluate with such metrics remains difficult, if not outright impossible. We survey the existing literature on fairness metrics for pretrained language models and experimentally evaluate compatibility, including both biases in language models as in their downstream tasks. We do this by a mixture of traditional literature survey and correlation analysis, as well as by running empirical evaluations. We find that many metrics are not compatible and highly depend on (i) templates, (ii) attribute and target seeds and (iii) the choice of embeddings. These results indicate that fairness or bias evaluation remains challenging for contextualized language models, if not at least highly subjective. To improve future comparisons and fairness evaluations, we recommend avoiding embedding-based metrics and focusing on fairness evaluations in downstream tasks.

연구 동기 및 목표

  • 컨텍스트 기반 언어 모델(예: BERT)을 위한 기존 공정성 메트릭스를 조사하기 위해.
  • 이러한 메트릭스들이 다양한 설정(템플릿, 시드, 임베딩)에서 호환성과 일관성 측면에서 어떻게 작동하는지 평가하기 위해.
  • 내재된 공정성 메트릭스와 하류 작업에서의 외재적 편향 사이의 관계를 조사하기 위해.
  • NLP 시스템에서 신뢰할 수 있는 편향 평가를 위한 실질적인 권고를 제공하기 위해.
  • 현재 메트릭스의 한계를 부각하고, 실제 세계의 공정성에 대한 대체로 사용되는 내재 측정치에 대한 과도한 의존을 경계하기 위해.

제안 방법

  • 컨텍스트 기반 언어 모델을 위한 공정성 메트릭스에 대한 종합적인 문헌 조사를 수행하였다.
  • 다섯 가지 인기 있는 모델을 사용하여 실증 평가를 수행하였다: BERT-base-uncased, BERT-large-uncased, RoBERTa-base, DistilBERT-base-uncased, BERT-base-multilingual-uncased.
  • 내재된 공정성 메트릭스와 외재 기준인 BiasInBios 간의 상관관계 분석을 수행하여 일치도를 평가하였다.
  • 다양한 템플릿, 시드 단어 선택, 임베딩 표현 방식([CLS], 타겟 단어 임베딩 등)이 메트릭스 안정성에 미치는 영향을 평가하였다.
  • BiasInBios 데이터셋을 사용해 모델을 미세조정하고 평가함으로써 내재 및 외재 편향 측정치 간 비교를 가능하게 하였다.
  • 재현성과 재사용을 지원하기 위해 https://github.com/iPieter/biased-rulers 에서 코드와 메트릭스 패키지를 공개하였다.

실험 결과

연구 질문

  • RQ1BERT와 같은 컨텍스트 기반 언어 모델을 위한 공정성 측정치는 무엇이 있는가?
  • RQ2이러한 공정성 측정치는 영어를 초월해 어떻게 일반화되는가?
  • RQ3공정성 측정치, 사용하는 템플릿, 임베딩 선택 간의 관계는 무엇인가?
  • RQ4편향 평가에 가장 신뢰성 있고 호환성이 높은 공정성 메트릭스 조합은 무엇인가?

주요 결과

  • 많은 내재된 공정성 메트릭스는 템플릿 설계, 시드 단어 선택, 임베딩 표현 방식에 매우 민감하여 상호 호환성이 떨어진다.
  • [CLS] 임베딩 대비 타겟 단어 임베딩을 사용할 경우, 다양한 템플릿에서 더 안정적이고 강건한 메트릭스 결과를 얻을 수 있다.
  • 내재된 공정성 메트릭스와 외재된 공정성 측정치(BiasInBios 등) 간의 상관관계는 종종 약하거나 음수이며, 이는 내재 메트릭스와 하류 작업에서의 실제 편향 간의 일치도가 떨어짐을 시사한다.
  • CrowS-pairs와 같은 메트릭스는 템플릿 및 표현 방식의 차이로 인해 BiasInBios와 상관관계가 낮아지며, 이는 메트릭스의 불안정성을 강조한다.
  • Tan과 Celis(2019)가 제안한 WEAT 변형은 외재적 편향과 상대적으로 강한 상관관계를 보이며, 이는 내재 메트릭스 중에서 더 신뢰할 수 있음을 시사한다.
  • 본 연구는 임베딩 기반 내재 메트릭스가 상당한 변동성을 유발하므로, 임베딩 무관 대체 측정치인 DisCo나 LPBS를 사용하는 것이 바람직하며, 하류 작업에서의 외재적 공정성 평가가 의미 있는 공정성 평가를 위해 필수적임을 결론내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.