[论文解读] Mind the GAP: A Balanced Corpus of Gendered Ambiguous Pronouns
本文介绍了GAP,一个从维基百科中提取的大型、性别平衡的共指消解语料库,包含8,908个模糊代词-名词对,旨在缓解性别偏见并提升自然语言处理中的共指消解性能。作者表明,当前最先进模型在GAP上的F1分数仅为66.9%,凸显了在解决具有现实世界复杂性的模糊代词时,需结合句法结构与神经网络模型以克服持续存在的挑战。
Coreference resolution is an important task for natural language understanding, and the resolution of ambiguous pronouns a longstanding challenge. Nonetheless, existing corpora do not capture ambiguous pronouns in sufficient volume or diversity to accurately indicate the practical utility of models. Furthermore, we find gender bias in existing corpora and systems favoring masculine entities. To address this, we present and release GAP, a gender-balanced labeled corpus of 8,908 ambiguous pronoun-name pairs sampled to provide diverse coverage of challenges posed by real-world text. We explore a range of baselines which demonstrate the complexity of the challenge, the best achieving just 66.9% F1. We show that syntactic structure and continuous neural models provide promising, complementary cues for approaching the challenge.
研究动机与目标
- 通过创建一个平衡且多样的模糊代词语料库,解决共指消解数据集和系统中的性别偏见问题。
- 提供一个大规模、自然发生的语料库,以反映在现实世界中解决模糊代词的挑战。
- 在具有挑战性且平衡的基准上评估最先进共指模型的性能,以揭示当前方法的局限性。
- 通过奖励那些公平处理性别化指代、不偏袒男性实体的系统,推动公平建模。
- 识别关键的语言和结构线索(如句法结构和世界知识),以提升模糊代词的消解性能。
提出的方法
- 作者开发了一种可扩展、语言无关的方法,基于句法和话语模式从维基百科文本中提取模糊代词-名词对。
- 人工标注了8,908个样本的共指标签,通过包含同等数量的男性和女性先行词来确保性别平衡。
- 该语料库包含四种句法模式:InitialPro、MedialPro、FinalPro,以及一种涉及话题性或复杂句法的变体。
- 在GAP上评估了基线模型,包括四种最先进共指系统以及使用句法和神经特征的简单基线。
- 作者以系统共识与人工标注的黄金标签的一致性作为难度的代理指标,将样本分为Green(简单)、Yellow(中等)和Red(困难)三类。
- 对75个“Red”样本进行了细粒度错误分析,以识别重复出现的挑战,如叙事角色、复杂句法和领域特定知识。
实验结果
研究问题
- RQ1现有共指数据集中的性别不平衡在多大程度上影响模型在现实应用中的性能与公平性?
- RQ2最先进共指模型在多样化句法和话语语境下的自然模糊代词上泛化能力如何?
- RQ3在复杂情况下,哪些语言和结构线索(如句法模式或世界知识)最能预测准确的代词消解?
- RQ4基于Transformer的神经网络模型与传统句法特征在解决模糊代词时如何互补?
- RQ5哪些类型的推理(如叙事角色、话题性、领域知识)最显著地增加了真实文本中共指消解的难度?
主要发现
- 表现最佳的基线模型在GAP数据集上的F1分数仅为66.9%,表明共指消解仍有巨大改进空间。
- 仅有29.7%的样本被全部四种最先进系统正确解析,凸显了该数据集的难度以及当前模型的局限性。
- 句法结构与连续神经模型(如Transformer)提供了互补线索,表明结合两者可提升模糊代词的消解性能。
- 该语料库揭示了在处理涉及叙事角色、复杂句法、话题性及领域特定知识的代词时存在系统性挑战,尤其在“Red”样本中,无一系统与黄金标签一致。
- 作者观察到现有数据集和系统中存在一致的性别偏见,男性实体更受青睐;GAP的平衡设计通过奖励跨性别的公平解析来缓解此问题。
- 对75个“Red”样本的细粒度分析表明,多种推理类型的重叠以及对全局话语理解的需求,是模糊代词消解困难的关键因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。