[论文解读] A Benchmark of Rule-Based and Neural Coreference Resolution in Dutch Novels and News
本文在荷兰语新闻/维基百科(SoNaR-1)和文学小说(RiddleCoref)数据集上对基于规则的共指消解系统(dutchcoref)和神经端到端系统(e2e-Dutch)进行了基准测试。神经模型在新闻文本上的表现优于基于规则的系统,而基于规则的系统在文学文本上表现更优,凸显了领域依赖的性能差异,以及注释质量与文档长度对荷兰语共指消解的影响。
We evaluate a rule-based (Lee et al., 2013) and neural (Lee et al., 2018) coreference system on Dutch datasets of two domains: literary novels and news/Wikipedia text. The results provide insight into the relative strengths of data-driven and knowledge-driven systems, as well as the influence of domain, document length, and annotation schemes. The neural system performs best on news/Wikipedia text, while the rule-based system performs best on literature. The neural system shows weaknesses with limited training data and long documents, while the rule-based system is affected by annotation differences. The code and models used in this paper are available at https://github.com/andreasvc/crac2020
研究动机与目标
- 评估并比较基于规则和神经共指消解系统在荷兰语文本两个不同领域(新闻/维基百科与文学小说)中的表现。
- 研究领域差异、文档长度和注释方案对基于规则与神经共指消解系统在荷兰语中性能的影响。
- 分析训练数据量和提及识别质量对共指消解结果的影响。
- 评估注释错误与单例处理对系统评估指标的影响。
- 为未来基于现有及新引入语料库的荷兰语共指消解研究提供基准。
提出的方法
- 采用基于BERT的荷兰语标记表示,对端到端神经共指消解系统 e2e-Dutch(Lee et al., 2018)进行适配。
- 将基于规则的系统 dutchcoref(van Cranenburgh, 2019)——源自斯坦福共指系统——应用于两个数据集。
- 在两个语料库上评估系统:SoNaR-1(新闻/维基百科,581篇文档,约100万词)和 RiddleCoref(文学小说,23篇文档,平均长度更长)。
- 在不同条件下进行实验:使用黄金提及与预测提及、包含/排除单例、以及不同大小的训练数据。
- 对两个系统进行错误分析,重点关注注释不一致、提及边界错误以及缺失的回指链接。
- 使用标准的共指消解评估指标(MUC、B3、CEAF),并在不同领域与设置间比较结果。
实验结果
研究问题
- RQ1基于规则与神经共指消解系统在荷兰语新闻/维基百科与文学小说文本上的表现如何?
- RQ2文档长度与语料规模对荷兰语中神经与基于规则的共指消解系统性能有何影响?
- RQ3SoNaR-1语料中的注释不一致性如何影响系统评估与性能比较?
- RQ4提及识别质量在多大程度上影响下游共指消解性能?
- RQ5单例处理与提及边界错误如何影响系统得分与排名?
主要发现
- 当使用黄金提及时,神经模型(e2e-Dutch)在SoNaR-1上达到80.61%的F1,显著优于基于规则的系统(70.90% F1),表明其在新闻/维基百科文本上的强大性能。
- 当使用黄金提及时,基于规则的系统(dutchcoref)在RiddleCoref上达到75.84%的F1,优于神经模型(72.01% F1),表明其在文学小说中的表现更优。
- 神经模型在RiddleCoref语料的长文档中表现出性能下降,表明其在处理长距离共指链方面存在局限。
- 基于规则的系统对注释差异更敏感,尤其在SoNaR-1中,缺失链接与不一致的边界导致得分降低。
- 从评估中排除单例对得分产生显著且出人意料的影响——尤其在SoNaR-1中——表明注释质量与评估设置对结果影响极大。
- 错误分析揭示了SoNaR-1中系统性的注释问题,如未链接的完全字符串匹配(例如 'Amsterdam'、'Hilversum')和缺失提及(例如 'Japix'),这些可能对性能差距有重要贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。