[论文解读] GeBioToolkit: Automatic Extraction of Gender-Balanced Multilingual Corpus of Wikipedia Biographies
GeBioToolkit 是一种可定制工具,可自动从维基百科人物传记中以句子级别提取性别平衡、多语言的平行语料,并保留文档级别的上下文。其在句子级别平行性上的准确率达到 87.5%,并生成了 GeBioCorpus-v2——包含 2,000 个经过后期编辑、性别平衡、职业标签化的英语、西班牙语和加泰罗尼亚语句子,使其成为首个真实文本、性别平衡的机器翻译评估测试集。
We introduce GeBioToolkit, a tool for extracting multilingual parallel corpora at sentence level, with document and gender information from Wikipedia biographies. Despite thegender inequalitiespresent in Wikipedia, the toolkit has been designed to extract corpus balanced in gender. While our toolkit is customizable to any number of languages (and different domains), in this work we present a corpus of 2,000 sentences in English, Spanish and Catalan, which has been post-edited by native speakers to become a high-quality dataset for machinetranslation evaluation. While GeBioCorpus aims at being one of the first non-synthetic gender-balanced test datasets, GeBioToolkit aims at paving the path to standardize procedures to produce gender-balanced datasets
研究动机与目标
- 解决机器翻译评估中缺乏性别平衡、多语言测试集的问题。
- 开发一种可扩展、可定制的工具,用于从多语言维基百科人物传记中提取带性别和文档级别元数据的平行语料。
- 创建一个高质量、经后期编辑的测试数据集(GeBioCorpus-v2),以支持对性别特定翻译性能的评估。
- 通过在保留完整传记文档的同时确保最终语料中的性别平衡,支持文档级别的评估。
- 使用维基百科作为数据源,建立构建性别平衡自然语言处理数据集的标准化流程。
提出的方法
- 利用 LASER 嵌入技术从多个维基百科语言版本中提取句子级别的平行句子。
- 利用维基百科的多语言结构,将同一人物的传记在不同语言间对齐,以保持文档级别的连贯性。
- 通过每篇文档中最常见的代词进行性别分类,以标注性别,并通过后期编辑确保准确性。
- 基于句子长度和相似性实施过滤管道,以保留高质量的平行句子。
- 由母语者对 2,000 个句子进行人工后期编辑,以修正非平行或不一致的翻译。
- 根据维基百科的职业列表,为每个文档添加性别、语言、维基百科文章 ID 和职业类别标签。
实验结果
研究问题
- RQ1能否通过自动化工具从维基百科人物传记中提取性别平衡、多语言的平行语料,同时保留文档级别的上下文?
- RQ2在多语言语料中,自动提取的多语言句子级别平行性的准确率如何?
- RQ3人工后期编辑在提升自动提取的平行句子质量方面,对机器翻译评估有多大的有效性?
- RQ4性别平衡的多语言测试集能否改善神经机器翻译中对性别特定翻译性能的评估?
- RQ5GeBioToolkit 在保持性别平衡的前提下,能够多大程度上针对不同的语言对和领域进行定制?
主要发现
- GeBioToolkit 在提取多语言平行句子方面达到 87.5% 的准确率,该结果通过在 50 组随机句子对上进行人工评估得到验证。
- 人工评估的评分者间一致性达到显著水平(Fleiss’ kappa = 0.67),表明评估者之间具有一致的可靠性。
- 经后期编辑的 GeBioCorpus-v2 包含 2,000 个高质量、性别平衡、职业标签化的句子,涵盖英语、西班牙语和加泰罗尼亚语。
- 该语料库覆盖了多样的语言家族和词形类型,支持对远距离(英语–西班牙语、英语–加泰罗尼亚语)和密切相关(西班牙语–加泰罗尼亚语)语言对的评估。
- 职业类别的分布揭示了在法律执法(C5)、宗教(C8)和体育(C9)等主题中存在性别失衡,凸显了构建性别平衡数据集的必要性。
- GeBioCorpus-v2 是首个真实文本、性别平衡、多语言的机器翻译测试集,专为评估性别特定翻译性能而设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。