Skip to main content
QUICK REVIEW

[논문 리뷰] Extending Challenge Sets to Uncover Gender Bias in Machine Translation: Impact of Stereotypical Verbs and Adjectives

Jonas Troles, Ute Schmid|ArXiv.org|2021. 07. 24.
Hate Speech and Cyberbullying Detection참고 문헌 13인용 수 6
한 줄 요약

이 논문은 WinoMT 챌린지 세트를 확장하여, 성별 고정관념을 지닌 형용사와 동사를 포함한 70,000개 이상의 영어-독어 번역 문장으로 구성된 대규모 평가 세트인 WiBeMT를 제안한다. 이는 신경 기계 번역(NMT)에서 성별 편향을 드러내기 위한 것이다. 연구 결과, 형용사가 번역에서 성별 편향에 크게 영향을 미치며, 모든 세 가지 상용 MT 시스템(DeepL, Microsoft, Google 번역)이 왜곡된 출력을 보였지만, DeepL가 가장 낮은 편향을 보였다. 발견된 바에 따르면, 성별에 치중된 형용사는 일부 경우에서 성별 차별을 오히려 줄일 수 있지만, 동시에 새로운 형태의 편향을 유도할 수도 있다.

ABSTRACT

Human gender bias is reflected in language and text production. Because state-of-the-art machine translation (MT) systems are trained on large corpora of text, mostly generated by humans, gender bias can also be found in MT. For instance when occupations are translated from a language like English, which mostly uses gender neutral words, to a language like German, which mostly uses a feminine and a masculine version for an occupation, a decision must be made by the MT System. Recent research showed that MT systems are biased towards stereotypical translation of occupations. In 2019 the first, and so far only, challenge set, explicitly designed to measure the extent of gender bias in MT systems has been published. In this set measurement of gender bias is solely based on the translation of occupations. In this paper we present an extension of this challenge set, called WiBeMT, with gender-biased adjectives and adds sentences with gender-biased verbs. The resulting challenge set consists of over 70, 000 sentences and has been translated with three commercial MT systems: DeepL Translator, Microsoft Translator, and Google Translate. Results show a gender bias for all three MT systems. This gender bias is to a great extent significantly influenced by adjectives and to a lesser extent by verbs.

연구 동기 및 목표

  • 기존 성별 편향 평가가 직업 용어에 국한되어 있는 데 대비, 이를 보완하기 위해.
  • 성별 고정관념을 지닌 형용사와 동사가 신경 기계 번역 시스템의 번역 결과에 어떻게 영향을 미치는지 조사하기 위해.
  • 직업 외의 더 넓은 언어적 요소를 반영한 더 크고 다양한 챌린지 세트(WiBeMT)를 개발하기 위해.
  • 확장된 데이터셋을 사용하여 세 가지 상용 NMT 시스템—DeepL, Microsoft 번역, Google 번역—의 성별 편향을 평가하기 위해.
  • 성별에 치중된 형용사와 동사가 번역 출력에서 편향을 증폭시키거나 완화시키는지 평가하기 위해.

제안 방법

  • 워드 임베딩과 성별 특정 단어 목록 간의 코사인 유사도를 활용하여, 성별 고정관념을 지닌 형용사와 동사를 식별하여 WinoBias 데이터셋을 확장하였다.
  • 직업어와 고정관념적 형용사 및 동사를 조합하여, 일치하는 성별 쌍과 일치하지 않는 성별 쌍을 생성하였다.
  • 총 70,686개의 문장을 생성하였으며, 성별을 나타내는 대명사, 형용사, 동사를 체계적으로 변화시켜 번역의 성별 편향을 테스트하였다.
  • 모든 문장을 세 가지 상용 NMT 시스템인 DeepL, Microsoft 번역, Google 번역를 사용해 번역하였다.
  • %TCG(성별 대명사에 대한 번역 정확도)와 같은 지표를 사용해 성별 편향을 평가하였으며, 남성, 여성, 중성 조건 간 정확도를 비교하였다.
  • 형용사와 동사가 직업명 어색의 번역 결과와 전체 시스템의 편향에 미치는 영향을 분석하였다.

실험 결과

연구 질문

  • RQ1성별 고정관념을 지닌 형용사는 독일어-영어 번역에서 기계 번역 출력의 성별 편향에 어떻게 영향을 미치는가?
  • RQ2성별에 치중된 동사는 신경 기계 번역 시스템에서 얼마나 편향된 번역을 유도하는가?
  • RQ3성별에 치중된 형용사를 포함함으로써 남성과 여성 대명사 참조 간 번역 정확도의 격차는 감소하는가, 증가하는가?
  • RQ4성별 고정관념을 지닌 형용사와 동사를 처리할 때, 상용 NMT 시스템들(DeepL, Microsoft 번역, Google 번역) 간 성별 편향에서의 차이는 어떠한가?
  • RQ5성별에 치중된 형용사를 추가함으로써, 새로운 편향을 유도함에도 불구하고 전체 성별 편향을 오히려 감소시킬 수 있는가?

주요 결과

  • 형용사는 NMT 시스템의 성별 편향에 크게 영향을 미치며, 여성형 및 남성형 형용사 모두 번역 결과를 여성 성별 쪽으로 기울이지만, 여성형 형용사가 더 강한 영향을 미친다.
  • DeepL 번역기는 세 시스템 중에서 가장 낮은 성별 편향을 보이며, 남성과 여성 대명사 참조 문장 간 %TCG의 격차가 가장 작다.
  • Google 번역기는 전체적으로 남성 번역을 더 선호하는 경향이 있으며, 특히 동사 기반 문장에서는 Microsoft 번역보다 성능이 열 劣하다.
  • 전반적인 편향에도 불구하고, 성별에 치중된 형용사를 추가함으로써 여성 대명사 참조 문장의 번역 정확도가 향상되어 성별 정확도 격차가 줄어든다.
  • 성별에 치중된 동사가 번역 편향에 미치는 영향은 형용사보다 작으며, DeepL과 Microsoft 번역에서만 유의미한 영향을 미치며, Google 번역에서는 그렇지 않다.
  • 연구는 역설적인 효과를 드러내는데, 형용사가 여성 성별 번역 가능성을 높이지만, 동시에 여성 참조의 정확도를 향상시켜 전체적으로 시스템 출력의 성별 차별을 줄이는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.