[논문 리뷰] On the Intrinsic and Extrinsic Fairness Evaluation Metrics for Contextualized Language Representations
이 논문은 독성, 감성, 스테레오 타입 편향을 포함한 다양한 편향 유형에 대해, 컨텍스트 기반 언어 모델에서 내재적(fairness metrics)과 외재적(fairness metrics)의 상관관계를 조사한다. 19개의 모델과 다수의 메트릭을 사용하여, 내재적 및 외재적 공정성 평가 간의 약한 상관관계를 발견하였으며, 이는 상游 공정성 향상이 하위 공정성 보장으로 이어지지 않음을 시사하며, 데이터셋 품질, 메트릭 일치성, 실험 설정이 실제 응용에서 편향 탐지에 결정적인 영향을 미친다는 것을 강조한다.
Multiple metrics have been introduced to measure fairness in various natural language processing tasks. These metrics can be roughly categorized into two categories: 1) \emph{extrinsic metrics} for evaluating fairness in downstream applications and 2) \emph{intrinsic metrics} for estimating fairness in upstream contextualized language representation models. In this paper, we conduct an extensive correlation study between intrinsic and extrinsic metrics across bias notions using 19 contextualized language models. We find that intrinsic and extrinsic metrics do not necessarily correlate in their original setting, even when correcting for metric misalignments, noise in evaluation datasets, and confounding factors such as experiment configuration for extrinsic metrics. %al
연구 동기 및 목표
- 내재적 공정성 메트릭(언어 모델을 직접 평가하는 메트릭)과 외재적 공정성 메트릭(하위 시스템 출력을 평가하는 메트릭) 간의 관계를 조사하는 것.
- 컨텍스트 기반 표현에서 내재적 및 외재적 공정성 메트릭 간 상관관계에 영향을 미치는 요인을 규명하는 것.
- 데이터셋 품질, 편향 개념 일치성, 실험 설정이 공정성 메트릭 신뢰성에 미치는 영향을 평가하는 것.
- 실제 응용에서 신뢰성 있고 공정한 NLP 시스템을 확보하기 위한 최선의 실천 방안을 제안하는 것.
제안 방법
- 독성, 감성, 스테레오 타입 편향 3종류의 편향에 대해, 19개의 사전 학습된 언어 모델(BERT, GPT-2 등)을 대상으로 내재적 및 외재적 메트릭을 사용한 대규모 상관관계 연구를 수행하였다.
- 단어 임베딩과 생성 템플릿의 편향을 평가하기 위해 CEAT(컨텍스트 기반 임베딩 연관 테스트)와 ILPS(증가된 로그 확률 스코어)와 같은 내재적 메트릭을 활용하였다.
- 하위 텍스트 생성 및 분류 작업에서의 공정성 평가를 위해 BOLD(편향 기반 언어 탐지), B-Sent, B-Tox, B-Stereo와 같은 외재적 메트릭을 적용하였다.
- 편향 개념 일치성, 보호 그룹 정의, 데이터셋 노이즈가 메트릭 상관관계에 미치는 영향을 평가하기 위해 아블레이션 연구를 수행하였다.
- 디코딩 온도 및 메트릭 계산에서 분류기의 강건성과 같은 실험 설정이 외재적 메트릭에 미치는 민감도를 평가하였다.
- 특히 종교 관련 스테레오 타입에 대한 BOLD 벤치마크에서 노이즈가 있거나 편향된 프롬프트를 감정, 태도, 독성 분류기를 사용해 걸러내었다.
실험 결과
연구 질문
- RQ1다양한 컨텍스트 기반 언어 모델과 편향 유형에서 내재적 및 외재적 공정성 메트릭 간의 상관관계는 어느 정도인가?
- RQ2예를 들어 독성과 감성 간의 편향 개념 불일치가 내재적 및 외재적 공정성 메트릭 간 상관관계에 어떤 영향을 미치는가?
- RQ3평가 데이터셋의 노이즈가 외재적 공정성 메트릭의 신뢰성과 내재적 메트릭과의 상관관계에 어떤 영향을 미치는가?
- RQ4디코딩 온도나 분류기 선택과 같은 실험 설정이 하위 작업에서의 공정성 측정에 어떤 영향을 미치는가?
- RQ5데이터셋 필터링과 메트릭 일치성이 내재적 및 외재적 공정성 평가 간 상관관계를 어느 정도 향상시킬 수 있는가?
주요 결과
- 내재적 및 외재적 공정성 메트릭은 조정된 메트릭 불일치와 데이터셋 노이즈를 고려한 후에도 19개의 모델 전반에서 약하거나 일관되지 않은 상관관계를 보였다.
- 인종 영역에서 B-Stereo 메트릭의 평가 데이터 원천을 일치시킨 결과, 내재적 및 외재적 메트릭 간 상관관계가 -0.18에서 0.02로 약간 향상되었다.
- BOLD 데이터셋에서 감정 및 독성 분류기를 사용해 노이즈가 있는 프롬프트를 필터링한 후, CEAT와 B-Sent 간 상관관계는 0.11로 상승하였고, StereoSet와 B-Stereo 간 상관관계는 0.10으로 상승하였다.
- GPT-2에서 디코딩 온도를 0.5에서 1.0으로 증가시킨 결과, 생성 출력의 부정적 감성 비율이 4.6%에서 15.6%로 증가하여 추론 설정에 민감함을 입증하였다.
- 500개의 BOLD 생성 텍스트에 단어 수준의 노이즈(교환/삭제)를 도입한 결과, 부정적 감성 비율은 13.6%에서 12.18%로 감소하였고, 부정적 태도 비율은 25.2%에서 22.86%로 감소하여, 노이즈가 분류기 기반 메트릭 스코어에 영향을 미친다는 것을 시사하였다.
- 본 연구는 공정성 메트릭이 모델 하이퍼파라미터, 평가 데이터셋 품질, 메트릭 계산에 사용된 보조 모델과 같은 혼동 요인에 민감하여, 프록시 기반 공정성 평가의 신뢰성을 떨어뜨린다는 것을 규명하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.