[논문 리뷰] Debiasing isn't enough! -- On the Effectiveness of Debiasing MLMs and their Social Biases in Downstream Tasks
이 논문은 마스크된 언어 모델(MLM)에서 내재적 및 외재적 사회적 편향 평가 간의 괴리성을 조사하며, 이들 간에 약한 상관관계가 있음을 발견한다. 조정 후에도 MLM은 편향된 훈련 인스턴스와 레이블로 인해 피지테이닝 중에 다시 사회적 편향을 학습하게 되어, 내재적 측정치가 배포 결정에 있어 신뢰할 수 없게 만든다.
We study the relationship between task-agnostic intrinsic and task-specific extrinsic social bias evaluation measures for Masked Language Models (MLMs), and find that there exists only a weak correlation between these two types of evaluation measures. Moreover, we find that MLMs debiased using different methods still re-learn social biases during fine-tuning on downstream tasks. We identify the social biases in both training instances as well as their assigned labels as reasons for the discrepancy between intrinsic and extrinsic bias evaluation measurements. Overall, our findings highlight the limitations of existing MLM bias evaluation measures and raise concerns on the deployment of MLMs in downstream applications using those measures.
연구 동기 및 목표
- MLM에서 임무에 종속되지 않는 내재적 편향 평가와 임무에 종속적인 외재적 편향 평가 간의 관계를 조사하기 위해.
- 하류 작업에 대해 피지테이닝된 후에도 편향 제거된 MLM이 여전히 편향이 없는지 조사하기 위해.
- 내재적 및 외재적 편향 측정치 간의 격차의 근본 원인을 특정하기 위해.
- 내재적 편향 평가만으로도 모델의 배포 결정에 충분하다는 가정을 도전하기 위해.
- MLM를 사용하는 NLP 시스템에서 현재 편향 평가 관행의 한계를 부각하기 위해.
제안 방법
- 세 가지 내재적 편향 평가 측정치인 SSS, CPS, AULA를 사용하여 7개의 사전 훈련된 MLM과 그들의 편향 제거 버전을 평가하였다.
- 세 가지 다른 편향 제거 방법을 MLM에 적용하여 평가 유형 간의 효과성을 평가하였다.
- 하류 작업의 외재적 편향 행동을 평가하기 위해 BiasBios, STS-bias, NLI-bias 세 가지 데이터셋에 대해 피지테이닝을 수행하였다.
- 피지테이닝 이전 및 이후에 내재적 및 외재적 편향 점수 간의 켄달의 타우 상관 계수를 계산하였다.
- 피지테이닝 중에 편향 재인코딩이 발생하는 원인을 특정하기 위해 훈련 인스턴스와 레이블을 분석하였다.
- 관측된 평가 유형 간 상관관계의 신뢰성을 평가하기 위해 통계적 유의성 검정(p < 0.05)을 사용하였다.
실험 결과
연구 질문
- RQ1MLM에서 내재적 편향 평가 측정치와 외재적 편향 평가 측정치 사이에 강한 상관관계가 존재하는가?
- RQ2편향 제거된 MLM이 하류 작업에 대해 피지테이닝된 후에도 여전히 편향이 없는가?
- RQ3하류 작업의 피지테이닝 중에 편향 재인코딩이 발생하는 주요 원인은 무엇인가?
- RQ4내재적 편향 평가만으로도 MLM이 배포에 적합한지 판단하는 데 신뢰할 수 있는가?
- RQ5다양한 편향 제거 방법이 내재적 및 외재적 편향 평가 프레임워크에서 어떻게 성능을 발휘하는가?
주요 결과
- 모든 테스트된 MLM과 데이터셋에서 내재적 및 외재적 편향 평가 측정치 간에 약하고 일관되지 않은 상관관계가 존재한다.
- NLI-bias에서 피지테이닝 후 내재적 및 외재적 측정치 간 상관관계는 0.22에서 0.21로 감소했으며, 다른 작업들에 대해서도 낮은 수준을 유지하였다.
- 피지테이닝 후에 통계적으로 유의미한 유일한 상관관계는 STS-bias와 SSS 사이의 관계(τ = 0.38)였으며, 이는 피지테이닝 이전 값(0.53)보다 낮았다.
- 편향 제거된 MLM은 훈련 데이터의 인스턴스 관련 편향과 할당된 레이블의 레이블 관련 편향으로 인해 피지테이닝 중에 다시 사회적 편향을 학습하게 된다.
- 편향 제거 후에도 내재적 및 외재적 편향 평가 간 격차가 지속되며, 이는 내재적 측정치가 배포 평가에 충분하지 않음을 시사한다.
- 본 연구는 하류 작업에서 데이터 콘텐츠와 레이블 할당이 모두 편향 재인코딩에 기여하며, 고립된 내재적 평가의 신뢰성을 도전한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.