Skip to main content
QUICK REVIEW

[논문 리뷰] GeBioToolkit: Automatic Extraction of Gender-Balanced Multilingual Corpus of Wikipedia Biographies

Marta R. Costa‐jussà, Pau Li Lin|arXiv (Cornell University)|2019. 12. 10.
Natural Language Processing Techniques참고 문헌 26인용 수 14
한 줄 요약

GeBioToolkit는 문단 수준의 맥락을 유지하면서 위키백과 생애사전에서 문장 수준으로 성별 균형 잡힌 多국어 병렬 코퍼스를 자동으로 추출할 수 있는 사용자 정의 가능한 도구이다. 문장 수준의 병렬성에 대해 87.5%의 정확도를 달성했으며, 영어, 스페인어, 칼라트니아어로 2,000개의 수정된, 성별 균형 잡힌 직업 태그가 부여된 문장을 포함한 GeBioCorpus-v2를 제공함으로써 기계 번역 평가를 위한 첫 번째 실제 텍스트 기반 성별 균형 테스트 세트가 되었다.

ABSTRACT

We introduce GeBioToolkit, a tool for extracting multilingual parallel corpora at sentence level, with document and gender information from Wikipedia biographies. Despite thegender inequalitiespresent in Wikipedia, the toolkit has been designed to extract corpus balanced in gender. While our toolkit is customizable to any number of languages (and different domains), in this work we present a corpus of 2,000 sentences in English, Spanish and Catalan, which has been post-edited by native speakers to become a high-quality dataset for machinetranslation evaluation. While GeBioCorpus aims at being one of the first non-synthetic gender-balanced test datasets, GeBioToolkit aims at paving the path to standardize procedures to produce gender-balanced datasets

연구 동기 및 목표

  • 기계 번역 평가를 위한 성별 균형 잡힌 다국어 테스트 세트의 부족을 해결하기 위해.
  • 성별 및 문서 수준 메타데이터를 포함한 다국어 위키백과 생애사전에서 병렬 코퍼스를 추출할 수 있는 확장성 있고 사용자 정의 가능한 도구를 개발하기 위해.
  • 성별 특정 번역 성능 평가를 가능하게 하는 고품질 수정된 테스트 데이터셋(GeBioCorpus-v2)을 만들기 위해.
  • 최종 코퍼스에서 성별 균형을 유지하면서 전체 생애사전 문서를 유지함으로써 문서 수준의 평가를 지원하기 위해.
  • 위키백과를 자료로 사용하여 성별 균형 잡힌 NLP 데이터셋을 구축하는 표준 절차를 정립하기 위해.

제안 방법

  • 다국어 위키백과 버전 간 문장 수준의 병렬 문장을 추출하기 위해 LASER 임베딩을 활용한다.
  • 위키백과의 다국어 구조를 이용해 동일한 개인의 생애사전을 여러 언어로 정렬함으로써 문서 수준의 일관성을 유지한다.
  • 각 기사에서 가장 자주 등장하는 대명사를 기반으로 성별 분류를 적용하여 성별을 태그화하며, 정확도를 확보하기 위해 수정 작업을 수행한다.
  • 문장 길이와 유사도를 기반으로 필터링 파이프라인을 구현하여 고품질 병렬 문장을 유지한다.
  • 모국어 사용자들이 2,000개의 문장을 수동으로 수정하여 비병렬 또는 일관성 없는 번역을 교정한다.
  • 위키백과의 직업 목록을 기반으로 각 문서에 성별, 언어, 위키백과 기사 ID, 그리고 직업 카테고리 태그를 부여한다.

실험 결과

연구 질문

  • RQ1자동화된 도구가 문서 수준의 맥락을 유지하면서 위키백과 생애사전에서 성별 균형 잡힌 다국어 병렬 코퍼스를 추출할 수 있는가?
  • RQ2다국어 코퍼스에서 자동으로 추출된 다국어 문장 수준 병렬성의 정확도는 얼마인가?
  • RQ3수동 수정 작업이 기계 번역 평가를 위한 자동으로 추출된 병렬 문장의 품질을 향상시키는 데 얼마나 효과적인가?
  • RQ4성별 균형 잡힌 다국어 테스트 세트가 신경 기계 번역에서 성별 특정 번역 성능 평가를 향상시킬 수 있는가?
  • RQ5GeBioToolkit는 성별 균형을 유지하면서 다양한 언어 조합과 도메인에 대해 얼마나 사용자 정의 가능한가?

주요 결과

  • GeBioToolkit는 무작위로 선택된 50개 문장 트리플렛에 대한 인간 평가를 통해 다국어 병렬 문장을 추출하는 데 87.5%의 정확도를 달성했다.
  • 인간 평가에서의 평가자 간 일치도는 상당 수준에 도달했으며(Fleiss’ kappa = 0.67), 평가자 간 일관성이 높다는 것을 나타낸다.
  • 수정된 GeBioCorpus-v2에는 영어, 스페인어, 칼라트니아어로 2,000개의 고품질, 성별 균형 잡힌, 직업 태그가 부여된 문장이 포함되어 있다.
  • 이 코퍼스는 다양한 언어 가문과 형태 유형을 포함하여 거리가 먼(영어–스페인어, 영어–칼라트니아어) 및 밀접하게 관련된(스페인어–칼라트니아어) 언어 조합에 대한 평가를 가능하게 한다.
  • 직업 카테고리 분포는 법집행(C5), 종교(C8), 스포츠(C9)와 같은 분야에서 성별 불균형을 드러내며, 성별 균형 잡힌 데이터셋이 필요함을 시사한다.
  • GeBioCorpus-v2는 기계 번역을 위한 첫 번째 실제 텍스트 기반 성별 균형 잡힌 다국어 테스트 세트이며, 성별 특정 번역 성능 평가를 위해 특별히 설계되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.