Skip to main content
QUICK REVIEW

[논문 리뷰] Counterfactual Data Augmentation for Mitigating Gender Stereotypes in Languages with Rich Morphology

Ran Zmigrod, Sebastian J. Mielke|arXiv (Cornell University)|2019. 06. 11.
Natural Language Processing Techniques참고 문헌 23인용 수 10
한 줄 요약

이 논문은 스페인어와 hebrew와 같은 형태적 풍부한 언어에서 어법적 정확성을 유지하면서 성별 스테레오타입을 완화하는 마르코프 무작위 필드 기반의 반사적 데이터 증강 방법을 제안한다. 동적 명사의 문법적 성을 변경할 때 형태-구문적 일치 규칙을 추론하고 적용함으로써, 스페인어와 히브리어에서 각각 90% 및 87%의 형태 수준 정확도를 달성하며, 어법적 정확성을 희생하지 않고 평균적으로 성별 스테레오타입을 2.5배 감소시킨다.

ABSTRACT

Gender stereotypes are manifest in most of the world's languages and are consequently propagated or amplified by NLP systems. Although research has focused on mitigating gender stereotypes in English, the approaches that are commonly employed produce ungrammatical sentences in morphologically rich languages. We present a novel approach for converting between masculine-inflected and feminine-inflected sentences in such languages. For Spanish and Hebrew, our approach achieves F1 scores of 82% and 73% at the level of tags and accuracies of 90% and 87% at the level of forms. By evaluating our approach using four different languages, we show that, on average, it reduces gender stereotyping by a factor of 2.5 without any sacrifice to grammaticality.

연구 동기 및 목표

  • 형태적 풍부한 언어에서 성별 일치가 있는 코퍼스를 기반으로 훈련된 NLP 시스템에서의 성별 스테레오타입 문제를 해결하기 위해.
  • 이러한 언어에서 어법적으로 잘못된 문장을 생성하는 단순한 성별 교체 방법의 한계를 극복하기 위해.
  • 유생물 명사의 문법적 성을 변경할 때 전체 문장을 자동으로 재형태화하는 방법을 개발하기 위해.
  • 반사적 데이터 증강 과정에서 어법적 정확성을 유지하면서 의미적 및 문법적 일관성을 확보하기 위해.
  • 다양한 언어에서 내재적 및 외재적 평가를 통해 정확성과 편향 감소를 동시에 입증하기 위해.

제안 방법

  • 이 방법은 문법적 성을 변경할 때 필요로 하는 형태-구문 태그 변화를 추론하기 위해 선택적 신경망 파rameterization을 갖춘 마르코프 무작위 필드(MRF)를 사용한다.
  • 입력 문장으로부터 어형, 품사, 형태적 태그 등의 언어적 특징을 추출하고, 구조적 예측 모델을 적용하여 관련된 모든 단어가 어떻게 재형태화되어야 하는지 결정한다.
  • 문장 내 단어 간의 의존 관계를 모델링하여 형태적 일치를 강제함으로써, 성별에 따라 달라지는 관형사, 형용사, 동사가 일관되게 업데이트되도록 보장한다.
  • 모델은 네 단계의 파이프라인을 거쳐 훈련 및 평가된다: (1) 특징 추출, (2) 대상 명사 및 그 성별 고정, (3) 필요한 태그 변화 추론, (4) 새로운 형태로 어형 재형태화.
  • 이 방법은 어법적으로 타당하고 의미적으로 일관된 성별 전환 문장 쌍을 생성함으로써 반사적 데이터 증강에 적용된다.
  • 외재적 평가는 신경망 언어 모델을 사용하여 성별 스테레오타입 감소 정도를 측정하며, 어법적 정확성은 테스트 문구의 로그우도 점수로 평가된다.

실험 결과

연구 질문

  • RQ1구조적 예측 모델이 형태적 풍부한 언어에서 문법적 성 전환을 위해 필요한 형태-구문 태그 변화를 효과적으로 추론할 수 있는가?
  • RQ2제안된 방법이 어법적으로 잘못된 문장을 유발하지 않고 신경망 언어 모델의 성별 스테레오타입을 감소시키는가?
  • RQ3어법적 정확성과 편향 감소 측면에서 MRF 기반 접근법이 단순한 단어 교체 기반 베이스라인보다 어떻게 성능을 냈는가?
  • RQ4스페인어, 히브리어, 이タ리아어, 프랑스어와 같은 형태적 풍부한 언어에서 이 방법이 얼마나 일반화 가능한가?
  • RQ5형태 수준 재형태화에서 높은 정확도를 유지하면서도 성별 편향 감소를 크게 이룰 수 있는가?

주요 결과

  • 스페인어에서는 태그 수준에서 F1 스코어 82%, 형태 수준에서 정확도 90%를 기록하였고, 히브리어에서는 F1 스코어 73%, 정확도 87%를 달성하였다.
  • 평균적으로 네 언어에서 신경망 언어 모델의 성별 스테레오타입을 2.5배 감소시켰으며, 이는 이탈리아어의 경우 1.2에서 스페인어의 경우 5.0까지 다양했다.
  • 단순 교체 대비 어법적 정확성이 유지되거나 향상되었으며, 히브리어를 제외한 모든 언어에서 MRF 접근법이 더 높은 어법적 정확도 점수를 기록했다.
  • 스페인어에서는 로그우도 기반 편향 측정치에서 성별 스테레오타입이 스왑 기반의 6.2에서 MRF 기반의 2.0으로 감소했고, 어법적 정확도 점수는 스왑 기반의 0.25 대비 4.05를 유지했다.
  • 내재적 및 외재적 평가에서 모두 단순 교체보다 성능이 뛰어나, 형태적 풍부한 언어에서 어법적 정확성과 편향 완화가 상호 배타적이지 않음을 입증했다.
  • 이 방법은 형태적 풍부한 언어에서 어법적 정확성을 유지하면서 성별 전환 데이터 증강을 구조적이고 문법 인지적인 방법으로 처음으로 다룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.