[论文解读] PreCo: A Large-scale Dataset in Preschool Vocabulary for Coreference Resolution
该论文提出了 PreCo,一个大规模、聚焦于学龄前词汇的共指消解数据集,其训练集与测试集之间的重叠度极高(OOV 为 0.8%,远低于 OntoNotes 的 2.1%),包含 1240 万个词,并对单个提及(singleton mentions)进行了标注。该数据集使得更高效的错误分析成为可能,并量化了提及检测的影响,揭示出共指消解的主要瓶颈仍在于提及聚类,而非提及检测。当前最先进模型在 PreCo 上的 F1 得分为 81.5,而人类表现达到 87.9。
We introduce PreCo, a large-scale English dataset for coreference resolution. The dataset is designed to embody the core challenges in coreference, such as entity representation, by alleviating the challenge of low overlap between training and test sets and enabling separated analysis of mention detection and mention clustering. To strengthen the training-test overlap, we collect a large corpus of about 38K documents and 12.4M words which are mostly from the vocabulary of English-speaking preschoolers. Experiments show that with higher training-test overlap, error analysis on PreCo is more efficient than the one on OntoNotes, a popular existing dataset. Furthermore, we annotate singleton mentions making it possible for the first time to quantify the influence that a mention detector makes on coreference resolution performance. The dataset is freely available at https://preschool-lab.github.io/PreCo/.
研究动机与目标
- 为解决现有共指消解数据集的局限性,特别是训练-测试重叠度低以及缺乏单个提及标注的问题。
- 通过提高训练集与测试集之间的重叠度,提升共指消解错误分析的效率与准确性。
- 通过单个提及标注,首次实现对提及检测影响共指消解性能的定量评估。
- 提供一个可扩展、高重叠度的数据集,更好地将共指消解的核心挑战与数据分布偏移分离。
- 通过公开发布一个大规模、公共可用的数据集,推动进一步研究,支持更可靠的模型评估与基准测试。
提出的方法
- 作者从中文中、高中学生英语阅读理解测试中收集了 38,000 份文档,这些文档受限于学龄前词汇水平,确保了训练集与测试集之间具有高度的词汇重叠。
- 该数据集包含 1240 万个词,约为 OntoNotes 的十倍大,且具有极低的未登录词(OOV)率(0.8%),显著减少了数据分布偏移。
- 明确标注了单个提及(即不与任何其他提及共指的提及),从而支持对提及检测性能的独立评估。
- 作者在 PreCo 上评估了当前最先进共指模型(如 E2E-Coref、EE2E-Coref),并对比了在不同提及检测条件下(包括使用理想提及检测器)的性能表现。
- 采用 OOV 率和 LFW(低频词)率作为指标,量化训练-测试重叠度及其对模型性能的影响。
- 通过比较不同训练-开发集重叠程度子集上的模型表现,开展错误分析,验证了重叠度与性能之间的相关性。
实验结果
研究问题
- RQ1高训练-测试重叠度在多大程度上提升了共指消解错误分析的效率与准确性?
- RQ2提及检测在当前最先进模型与人类表现之间的整体性能差距中,贡献了多大程度?
- RQ3单个提及标注的引入如何改善提及检测系统评估与训练?
- RQ4提及检测与提及聚类在整体共指消解性能差距中,各自贡献了多大?
- RQ5与 OntoNotes 相比,PreCo 的高重叠度与大规模特性在支持可靠模型评估与基准测试方面有何优势?
主要发现
- PreCo 的 OOV 率为 0.8%,约为 OntoNotes 的 2.1% 的三分之一,显著提升了训练-测试重叠度,使错误分析更加可靠。
- 最先进模型 EE2E-Coref 在 PreCo 上的 F1 得分为 81.5,而人类表现达到 87.9,表明共指消解仍是具有挑战性的任务。
- 当使用理想提及检测器时,模型在 PreCo 上的 F1 得分从 77.3 提升至 81.6,表明提及检测是性能差距的贡献因素之一,但并非主要瓶颈。
- 剩余 18.4 F1 分的差距(从 81.6 到完美的 100)可归因于提及聚类,而非提及检测,说明聚类是主要挑战。
- PreCo 的 LFW 率为 12.3%,显著低于 OntoNotes 的 34.8%;且与 OntoNotes 大小相近的 PreCo 子集,其 LFW 率为 33.0%,证实 PreCo 有效降低了低频现象带来的噪声。
- 研究结果证实,训练-开发集重叠度与共指消解性能之间存在强烈正相关,验证了高重叠度可提升模型评估效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。