[논문 리뷰] An Analysis of Social Biases Present in BERT Variants Across Multiple Languages
이 논문은 영어, 그리스어, 페르시아어에서 단일 언어 BERT 모델의 성별, 민족, 종교적 편향을 측정하기 위해 템플릿 기반 문장 가짜우도 방법을 제안한다. 기존의 단어 확률 기반 방법이 형태학적으로 복잡한 언어에서 한계를 보이는 점을 보완한다. 연구 결과 편향은 매우 언어적·문화적 의존적이며, 비영어 모델이 사용자 생성 콘텐츠와의 강한 상관관계를 보이고, 예를 들어 성경적 표현이나 대체 표현과 같은 어휘적 표현에 민감함을 보이며, 영어 벤치마크의 직접 번역을 넘어서 문화적으로 통찰력을 반영한 탐색이 필요함을 시사한다.
Although large pre-trained language models have achieved great success in many NLP tasks, it has been shown that they reflect human biases from their pre-training corpora. This bias may lead to undesirable outcomes when these models are applied in real-world settings. In this paper, we investigate the bias present in monolingual BERT models across a diverse set of languages (English, Greek, and Persian). While recent research has mostly focused on gender-related biases, we analyze religious and ethnic biases as well and propose a template-based method to measure any kind of bias, based on sentence pseudo-likelihood, that can handle morphologically complex languages with gender-based adjective declensions. We analyze each monolingual model via this method and visualize cultural similarities and differences across different dimensions of bias. Ultimately, we conclude that current methods of probing for bias are highly language-dependent, necessitating cultural insights regarding the unique ways bias is expressed in each language and culture (e.g. through coded language, synecdoche, and other similar linguistic concepts). We also hypothesize that higher measured social biases in the non-English BERT models correlate with user-generated content in their training.
연구 동기 및 목표
- 다양한 언어에서 영어 외의 사회적 편향—성별, 민족, 종교—을 단일 언어 BERT 모델에서 조사하기.
- 성별 형용사 변화가 있는 형태학적으로 복잡한 언어에서 기존의 단어 확률 기반 탐색의 한계를 해결하기.
- 성별, 은유적 표현, 대체 표현 등의 언어적 뉘앙스를 고려한 문화적으로 통찰력을 반영한 템플릿 기반 방법을 개발하여 편향을 측정하기.
- 편향 탐색이 어휘 선택에 매우 민감하며, 특히 비영어 모델에서 취약함을 보여주기.
- 편향이 종종 암호어적 언어로 표현되므로 효과적인 편향 탐색을 설계하기 위해 문화적 전문 지식이 필수적임을 강조하기.
제안 방법
- 스테레오타입 어휘로 템플릿 문장을 완성할 확률을 측정하여 편향을 평가하는 문장 가짜우도 점수 방법을 제안한다.
- 성별 및 맥락에 민감한 템플릿을 사용하여 페르시아어 및 그리스어와 같은 언어에서 문법적으로 올바른 문장을 남성형과 여성형 모두 생성하며, 형태적 일치를 유지한다.
- 다양한 언어, 특히 유럽 문화권 외의 언어인 페르시아어를 포함한 단일 언어 BERT 모델에 대해 미세조정된 모델에 이 방법을 적용한다.
- 종교, 민족, 성별 스테레오타입을 다루는 표준화된 템플릿 세트를 사용하며, 어휘 선택에 민감도를 테스트하기 위해 변형된 표현(예: '미국인' 대비 '미국에서 온 사람')을 포함한다.
- 부정 템플릿을 통합하여 모델의 논리 일관성 이해도를 테스트하며, 비영어 모델에서의 부정 처리 능력 부족을 드러낸다.
- 언어 간 편향 분포를 시각화하여 학습된 연관성에서의 문화적 유사성과 차이를 비교한다.
실험 결과
연구 질문
- RQ1비영어 언어 모델(그리스어, 페르시아어)은 영어 모델과 비교해 사회적 편향을 어떻게 반영하는가?
- RQ2성별 형용사 변화가 있는 형태학적으로 복잡한 언어에서 기존의 편향 탐색 방법은 어느 정도 실패하는가?
- RQ3직접적인 민족어 대비 대체 표현(예: '미국인' 대비 '미국에서 온 사람')과 같은 다양한 어휘 표현 방식이 언어 모델에서 측정된 편향에 어떤 영향을 미치는가?
- RQ4모델의 부정 이해도가 편향 측정에 어떤 영향을 미치며, 특히 비영어 모델에서 어떻게 나타나는가?
- RQ5문화적 및 역사적 맥락은 사용자 생성 콘텐츠를 기반으로 훈련된 언어 모델이 학습하는 편향에 어느 정도 영향을 미치는가?
주요 결과
- 페르시아어 BERT 모델은 '미국인'에 대해 '미국에서 온 사람'보다 훨씬 높은 편향 점수를 보였으며, 이는 이란 미디어에서 '미국인'이라는 표현이 미국 정부를 상징하는 성경적 표현으로 사용됨을 시사한다.
- 그리스어 BERT 모델은 직접적인 민족어 '이스라엘인들'보다 '이스라엘에서 온 사람'이라는 표현에 더 강한 편향 연관성을 보였으며, 이는 문화적으로 대체 표현을 선호함을 시사한다.
- 비영어 모델, 특히 페르시아어 BERT는 부정 처리 능력이 떨어져 원본 및 부정 템플릿 모두에서 '남성'에 대해 높은 확률을 부여하여 논리적 일관성 결여를 보였다.
- 템플릿의 어휘 선택에 따라 편향 분포가 크게 달라지며, 인간의 직관적 판단과는 상관없이 어휘 선택에 매우 민감한 편향 탐색의 취약성을 드러냈다.
- 연구 결과 비영어 모델에서 측정된 사회적 편향 수준이 높을수록 훈련 데이터에 사용자 생성 콘텐츠의 비율이 높다는 상관관계를 발견했다.
- 성경적 표현, 은유어 등 문화적·언어적 뉘앙스는 영어 편향 벤치마크의 직접 번역으로는 포착되지 않으며, 이는 문화적으로 기반을 둔 탐색 설계가 필수적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.