Skip to main content
QUICK REVIEW

[論文レビュー] GeBioToolkit: Automatic Extraction of Gender-Balanced Multilingual Corpus of Wikipedia Biographies

Marta R. Costa‐jussà, Pau Li Lin|arXiv (Cornell University)|Dec 10, 2019
Natural Language Processing Techniques参考文献 26被引用数 14
ひとこと要約

GeBioToolkitは、文単位で性別バランスが取られ、多言語対訳コーパスを自動抽出できるカスタマイズ可能なツールであり、文書レベルの文脈を保持する。文単位の対訳性において87.5%の正確性を達成し、GeBioCorpus-v2—英語、スペイン語、カタルーニャ語で2,000文の校正済みで性別バランスが取られ、職業タグが付与された文—を提供する。これは機械翻訳評価のための最初の本物のテキストで、性別バランスが取られたテストセットである。

ABSTRACT

We introduce GeBioToolkit, a tool for extracting multilingual parallel corpora at sentence level, with document and gender information from Wikipedia biographies. Despite thegender inequalitiespresent in Wikipedia, the toolkit has been designed to extract corpus balanced in gender. While our toolkit is customizable to any number of languages (and different domains), in this work we present a corpus of 2,000 sentences in English, Spanish and Catalan, which has been post-edited by native speakers to become a high-quality dataset for machinetranslation evaluation. While GeBioCorpus aims at being one of the first non-synthetic gender-balanced test datasets, GeBioToolkit aims at paving the path to standardize procedures to produce gender-balanced datasets

研究の動機と目的

  • 機械翻訳評価のための性別バランスが取られ、多言語対訳のテストセットが不足しているという問題に対処すること。
  • 性別および文書レベルのメタデータを含む、多言語Wikipedia伝記から対訳コーパスを抽出するためのスケーラブルでカスタマイズ可能なツールを開発すること。
  • 性別に偏りのない高品質な校正済みテストデータセット(GeBioCorpus-v2)を作成し、性別に特化した翻訳性能の評価を可能にすること。
  • 最終的なコーパスにおける性別バランスを確保しながら、完全な伝記文書を保持することで、文書レベルの評価を可能にすること。
  • Wikipediaをデータソースとして用いることにより、性別バランスが取られたNLPデータセットを構築するための標準化手順を確立すること。

提案手法

  • LASER埋め込みを活用して、複数のWikipedia言語版間で文単位の対訳文を抽出する。
  • Wikipediaの多言語構造を活用して、同じ人物の伝記を複数言語で対応付けることで、文書レベルの整合性を保持する。
  • 各記事における最も頻出する代名詞を用いて性別分類を実施し、正確性を確保するための校正を実施する。
  • 文の長さと類似度に基づくフィルタリングパイプラインを実装し、高品質な対訳文を保持する。
  • ネイティブスピーカーによる手作業の校正を2,000文の文に実施し、非対訳または一貫性のない翻訳を是正する。
  • Wikipediaの職業リストに基づき、各文書に性別、言語、Wikipedia記事ID、職業カテゴリをタグ付ける。

実験結果

リサーチクエスチョン

  • RQ1自動化されたツールは、文書レベルの文脈を保持しつつ、Wikipediaの伝記から性別バランスが取られた多言語対訳コーパスを抽出できるか?
  • RQ2多言語コーパスにおける自動抽出された多言語文単位の対訳性の正確度はどの程度か?
  • RQ3手作業による校正は、機械翻訳評価のための自動抽出対訳文の品質を向上させるのにどの程度効果的か?
  • RQ4性別バランスが取られた多言語テストセットは、ニューラル機械翻訳における性別に特化した翻訳性能の評価を向上させることができるか?
  • RQ5GeBioToolkitは、性別バランスを維持しながら、異なる言語対や分野にカスタマイズ可能か、その範囲はどの程度か?

主な発見

  • GeBioToolkitは、ランダムに抽出した50組の文のペアについて人間による評価を実施した結果、87.5%の正確性を達成した。
  • 人間による評価におけるアノテーター間一致性は、実質的な水準に達しており(Fleissのカッパ = 0.67)、評価者間の一貫性が信頼できることが示された。
  • 校正済みのGeBioCorpus-v2には、2,000件の高品質で性別バランスが取られ、職業タグが付与された文が含まれており、英語、スペイン語、カタルーニャ語で構成されている。
  • コーパスは多様な言語系統と屈曲型態をカバーしており、遠く離れた言語対(英語–スペイン語、英語–カタルーニャ語)および密接に関連する言語対(スペイン語–カタルーニャ語)における評価が可能である。
  • 職業カテゴリの分布から、警察(C5)、宗教(C8)、スポーツ(C9)などの分野で性別的偏りが顕在しており、性別バランスが取られたデータセットの必要性が浮き彫りになった。
  • GeBioCorpus-v2は、性別に特化した翻訳性能の評価を目的として、最初の本物のテキストで、性別バランスが取られた多言語テストセットである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。