[논문 리뷰] How to Measure Gender Bias in Machine Translation: Optimal Translators, Multiple Reference Points
이 논문은 헝가리의 직업 통계와 사회적 성별 직업 인식을 기준으로 Google 번역 출력을 비교하여 기계 번역에서의 성별 편향을 측정하기 위해 다중 기준 프레임워크를 제안한다. 번역 결과는 여성의 성별이 비례적으로 잘못 지정되는 등 심각한 성별 편향을 보이며, 객관적인 통계나 형용사보다는 성별 인식이 번역에 더 큰 영향을 미친다.
In this paper, as a case study, we present a systematic study of gender bias in machine translation with Google Translate. We translated sentences containing names of occupations from Hungarian, a language with gender-neutral pronouns, into English. Our aim was to present a fair measure for bias by comparing the translations to an optimal non-biased translator. When assessing bias, we used the following reference points: (1) the distribution of men and women among occupations in both the source and the target language countries, as well as (2) the results of a Hungarian survey that examined if certain jobs are generally perceived as feminine or masculine. We also studied how expanding sentences with adjectives referring to occupations effect the gender of the translated pronouns. As a result, we found bias against both genders, but biased results against women are much more frequent. Translations are closer to our perception of occupations than to objective occupational statistics. Finally, occupations have a greater effect on translation than adjectives.
연구 동기 및 목표
- 단일 기준 기반의 기준을 넘어서 성별 편향을 측정하기 위한 공정하고 체계적인 방법을 개발하기 위해.
- 비편향 번역의 기준이 되는 데 합의가 부족한 문제를 다중 기준을 도입하여 해결하기 위해.
- 사회적 성별 직업 인식과 객관적인 직업 통계가 번역 결과에 어떤 영향을 미치는지 평가하기 위해.
- 형용사가 번역 문장에서 대명사의 성별에 어떤 영향을 미치는지 조사하기 위해.
제안 방법
- 연구는 헝가리어에서 영어로의 번역을 Google 번역을 통해 수행하며, 헝가리어의 성중립적 대명사 특성을 활용해 모델의 편향을 분리한다.
- ‘최적의 번역기’는 실제 직업 분포와 헝가리 응답자로부터 확득한 설문 기반의 성별 인식을 모두 활용해 편향이 없는 기준으로 정의된다.
- 다양한 기준점을 사용한다: (1) 헝가리 및 미국의 직업에서의 성별 분포, (2) 직업의 남성성/여성성에 대한 사회적 인식 설문 데이터.
- 모델의 출력을 이러한 기준점과 비교하여 편차를 정량화하며, 기준점의 평균을 공정성 기준으로 간주한다.
- 문장을 성별 형용사로 확장하여 번역에서 대명사 할당에 미치는 영향을 테스트한다.
- 통계적 비교를 통해 번역 결과가 사회적 인식과 객관적 자료 중 어느 쪽에 더 가까이 있는지 평가한다.
실험 결과
연구 질문
- RQ1성중립적 원천 언어를 성별이 명시된 목표 언어로 번역할 때 기계 번역이 비편향 기준에서 얼마나 벗어나는가?
- RQ2객관적인 직업 통계에 비해 사회적 성별 직업 인식이 번역 결과에 얼마나 큰 영향을 미치는가?
- RQ3직업을 묘사하는 형용사가 번역 문장에서 대명사의 성별에 어떤 영향을 미치는가?
- RQ4통계적 분포와 사회적 인식 중 어느 기준점이 번역 결과와 더 밀접한가?
- RQ5번역의 편향이 특정 성별, 특히 여성에 대해 체계적으로 불리한가?
주요 결과
- 번역 결과는 심각한 성별 편향을 보이며, 여성에 대한 편향은 남성에 대한 편향보다 훨씬 빈번하게 발생한다.
- 모델의 출력은 객관적인 직업 통계보다 사회적 성별 직업 인식에 더 가까이 맞춰져 있다.
- 직업 데이터상 성별 비율이 균형을 이루더라도, 번역 결과는 자주 직업명에 남성 대명사를 할당한다.
- 형용사가 직업을 묘사할 경우 대명사의 성별에 영향을 미치지만, 직업명 자체의 영향에 비해 더 약한 영향을 미친다.
- 이 연구는 기계 번역에서의 성별 편향이 무작위가 아니라 남성 연관 역할을 체계적으로 선호한다는 점을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.