[论文解读] An Annotated Dataset of Coreference in English Literature
本文介绍了 LitBank,这是一个来自100部英语文学作品的共指注释数据集,共包含210,532个词元,具有长篇幅文档(平均2,105个词)和复杂的共指现象。实验表明,在领域内文学数据上进行训练可使F值比在OntoNotes上训练提高6个百分点,且性能与PreCo相当,尽管数据量少两个数量级。
We present in this work a new dataset of coreference annotations for works of literature in English, covering 29,103 mentions in 210,532 tokens from 100 works of fiction. This dataset differs from previous coreference datasets in containing documents whose average length (2,105.3 words) is four times longer than other benchmark datasets (463.7 for OntoNotes), and contains examples of difficult coreference problems common in literature. This dataset allows for an evaluation of cross-domain performance for the task of coreference resolution, and analysis into the characteristics of long-distance within-document coreference.
研究动机与目标
- 为英语文学领域中缺乏稳健的共指注释资源这一问题提供解决方案,该领域中的共指行为与标准基准存在显著差异。
- 支持在长篇文学文本上评估共指消解系统,此类文本具有独特的挑战,如长距离回指和叙事认识论。
- 分析文学中的共指模式,包括实体爆发性、先行语距离分布以及提及类型的行为特征。
- 评估在文学语境下,使用领域内与领域外训练数据对神经共指模型效果的影响。
- 通过提供可靠的共指注释,支持计算文学研究,以实现对人物和实体的分析。
提出的方法
- 对LitBank中的100部文学作品进行共指关系注释,涵盖ACE类别:人物、地点、组织、设施、地缘政治实体和车辆。
- 使用带有BERT上下文嵌入的分层BiLSTM-CRF模型,从原始文本中预测提及边界,在提及检测任务上达到89.1的F值。
- 在LitBank、OntoNotes和PreCo的标注数据上训练神经共指消解系统,以比较跨领域性能。
- 采用十折交叉验证,在预测提及的现实条件下评估提及识别和共指消解性能。
- 测量先行语距离分布和实体活跃度模式,以表征文学中长距离语篇现象。
- 使用标准共指评估指标(B3、MUC、CEAF φ4)及其平均F值来评估模型性能。
实验结果
研究问题
- RQ1在领域内文学数据(如LitBank)上训练与在领域外基准(如OntoNotes)上训练相比,共指消解性能如何变化?
- RQ2长篇文学文本中,先行语距离和实体活跃度跨度的分布特征是什么?
- RQ3不同提及类型(如代词、专有名词)在先行语接近度和消解难度方面表现如何?
- RQ4尽管存在领域差异,大规模领域外数据集(如PreCo)能否有效泛化到文学共指任务?
- RQ5提及边界预测的准确性在多大程度上影响文学文本中下游共指消解性能?
主要发现
- 在领域内文学数据(LitBank)上训练可获得68.1的F值,比在OntoNotes上训练(62.9)高出6个百分点,证明了领域特定数据的价值。
- 尽管PreCo的数据量大两个数量级,其在LitBank上的性能(67.6 F值)与LitBank相当,表明大规模领域外数据具有强大的泛化能力。
- 代词在95%的情况下与九个以内的提及建立关联,表明文学语篇中具有高度的局部连贯性。
- 文学文本中的实体表现出双峰活跃度模式——或在极短跨度内活跃,或在极长跨度内持续活跃,表明其具有爆发性和长期持久性。
- 使用BERT增强的BiLSTM-CRF进行提及识别可达到89.1的F值,且在预测实体类别或词性时性能仅轻微下降。
- 该数据集揭示,文学长篇中包含复杂的共指模式,包括身份和知识的认知与形而上学转变,对标准共指系统构成挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。