[논문 리뷰] Unmasking the Mask -- Evaluating Social Biases in Masked Language Models
이 논문은 마스크된 언어 모델(MLMs)을 위한 새로운 편향 평가 측도인 All Unmasked Likelihood(AUL)과 Attention 가중치를 적용한 AUL(AULA)을 제안한다. 이는 이전 방법의 한계를 극복하기 위해 마스크된 토큰 선택에 의한 편향을 피하고, 동시에 모든 마스크되지 않은 토큰을 예측함으로써 신뢰도를 향상시킨다. AUL과 AULA는 성별, 인종, 직업에 대한 스테레오타입과 같은 사회적 편향을 더 정확하게 탐지하며, StereoSet와 CrowS-Pairs 데이터셋에서 인간이 평가한 편향 수준과의 일치도가 높아 기존 측도보다 뛰어난 성능을 보인다.
Masked Language Models (MLMs) have shown superior performances in numerous downstream NLP tasks when used as text encoders. Unfortunately, MLMs also demonstrate significantly worrying levels of social biases. We show that the previously proposed evaluation metrics for quantifying the social biases in MLMs are problematic due to following reasons: (1) prediction accuracy of the masked tokens itself tend to be low in some MLMs, which raises questions regarding the reliability of the evaluation metrics that use the (pseudo) likelihood of the predicted tokens, and (2) the correlation between the prediction accuracy of the mask and the performance in downstream NLP tasks is not taken into consideration, and (3) high frequency words in the training data are masked more often, introducing noise due to this selection bias in the test cases. To overcome the above-mentioned disfluencies, we propose All Unmasked Likelihood (AUL), a bias evaluation measure that predicts all tokens in a test case given the MLM embedding of the unmasked input. We find that AUL accurately detects different types of biases in MLMs. We also propose AUL with attention weights (AULA) to evaluate tokens based on their importance in a sentence. However, unlike AUL and AULA, previously proposed bias evaluation measures for MLMs systematically overestimate the measured biases, and are heavily influenced by the unmasked tokens in the context.
연구 동기 및 목표
- 마스크된 토큰 예측 정확도가 낮고 맥락에 의해 유도된 편향을 忽略하는 데 기반한 기존 편향 평가 측도의 비신뢰성 문제를 해결한다.
- 자주 사용되는 단어가 마스크되는 빈도에 기인한 선택 편향으로 인해 토큰 빈도 분포가 왜곡되어 편향 측정이 왜곡되는 문제를 해결한다.
- 피팅 또는 맥락 기반 예측 동안 유도된 편향과는 별개로 모델의 내재된 편향을 분리하여 평가하는 방법을 개발한다.
- 어 attention 가중치를 통합하여 토큰 중요도를 반영함으로써 자동화된 편향 점수와 인간이 평가한 편향 수준 간의 일치도를 향상시킨다.
- 기존 평가 측도가 토큰 독립성에 대한 잘못된 가정과 낮은 예측 신뢰도에 기반해 편향을 체계적으로 과대평가한다는 점을 입증한다.
제안 방법
- 모든 마스크되지 않은 토큰을 동시에 예측하기 위해 전체 마스크되지 않은 입력 임베딩을 사용하는 All Unmasked Likelihood(AUL)을 제안한다. 이는 마스크화에 의한 왜곡을 피하기 위한 것이다.
- AUL에 Attention 가중치를 적용한 AUL with Attention weights(AULA)를 도입하여, 자기주의 어텐션 점수에 따라 토큰의 가능성도를 재가중함으로써 의미적으로 중요한 단어를 우선시하고 기능어에 의한 노이즈를 감소시킨다.
- 예측된 토큰의 가짜 가능성도를 편향 점수로 사용한다. 반스테레오타입 문장에서 가능성도가 낮을수록 더 높은 편향이 탐지된다는 의미이다.
- AUL과 AULA를 두 가지 벤치마크 데이터셋인 StereoSet(SS)과 CrowS-Pairs(CP)에 적용하여, SSS 및 CPS와 같은 기존 측도와의 성능을 비교한다.
- 이분류 작업(ROC-AUC)을 통해 편향 탐지 성능을 校정함으로써 MLM 기반 점수와 인간이 평가한 편향 레이블 간의 일치도를 평가한다.
- 문장 토큰을 무작위로 섞거나 관련 없는 단어로 교체함으로써 AUL이 언어적 일관성과 의미 있는 연관성에 얼마나 민감한지 테스트하기 위해 분석 실험을 수행한다.
실험 결과
연구 질문
- RQ1기존 MLM 편향 평가 측도는 마스크된 토큰 예측 정확도가 낮고 맥락이 모호한 상황에서 가짜 가능성도에 의존함으로써 어느 정도 실패하는가?
- RQ2높은 빈도의 단어가 선호되는 마스크 빈도 편향이 기존 편향 평가 측도의 신뢰성에 어떤 영향을 미치는가?
- RQ3모든 마스크되지 않은 토큰을 동시에 예측하는 방법이 노이즈를 줄이고 MLM 내 사회적 편향을 더 잘 탐지할 수 있는가?
- RQ4CrowS-Pairs와 StereoSet에서 AUL과 AULA는 기존 측도보다 인간이 평가한 편향 판단과 얼마나 잘 일치하는가?
- RQ5어떤 정도로 어텐션 메커니즘이 의미 있는 토큰을 적절히 가중시켜 편향 평가를 향상시키는가?
주요 결과
- AUL은 기존의 가짜 가능성도 기반 메트릭스 대비 StereoSet 데이터셋에서 95.71점의 정확도 하락을 보였으며, 이는 반스테레오타입 응답을 더 정확하게 탐지할 수 있음을 의미한다.
- AULA는 CrowS-Pairs에서 인간의 편향 평가와의 일치도가 가장 높았으며, ROC-AUC 곡선을 통해 특히 미묘한 편향을 탐지하는 데 뛰어난 성능을 보였다.
- 제안된 방법인 AUL은 문장의 구조와 의미에 민감했으며, 토큰을 무작위로 섞거나 관련 없는 단어로 교체했을 때 성능이著しく 떨어지는 것으로 확인되었다.
- CPS 및 SSS와 같은 기존 메트릭스는 마스크 빈도 편향과 독립성 가정에 기반해 편향을 체계적으로 과대평가했으며, 특히 고빈도 단어가 마스크된 경우 반스테레오타입 문장을 덜 편향 있다고 잘못 평가했다.
- BERT, RoBERTa, ALBERT를 포함한 모든 평가된 MLM은 우려할 만한 수준의 사회적 편향을 보였으며, 이는 내재된 편향이 특정 아키텍처에 국한되지 않고 널리 퍼져 있음을 확인한다.
- AUL과 AULA는 다양한 MLM과 편향 유형에 대해 강건성을 보였으며, 특히 복잡하고 맥락에 민감한 경우 AULA가 인간이 평가한 편향 결과와 가장 높은 상관관계를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.