Skip to main content
QUICK REVIEW

[论文解读] The Project Dialogism Novel Corpus: A Dataset for Quotation Attribution in Literary Texts

Krishnapriya Vishnubhotla, Adam Hammond|arXiv (Cornell University)|Apr 12, 2022
Topic Modeling被引用 6
一句话总结

项目对话体小说语料库(PDNC)是一个大规模、人工标注的语料库,包含来自22部英文文学小说的35,978条引文,标注了说话者、受话者、引文类型、指代表达及人物提及。它是迄今最大的同类语料库,可实现对引文归属与回指消解模型的全面评估,揭示出回指消解仍是说话者识别中的主要瓶颈。

ABSTRACT

We present the Project Dialogism Novel Corpus, or PDNC, an annotated dataset of quotations for English literary texts. PDNC contains annotations for 35,978 quotations across 22 full-length novels, and is by an order of magnitude the largest corpus of its kind. Each quotation is annotated for the speaker, addressees, type of quotation, referring expression, and character mentions within the quotation text. The annotated attributes allow for a comprehensive evaluation of models of quotation attribution and coreference for literary texts.

研究动机与目标

  • 为解决文学文本中引文归属缺乏大规模、高质量数据集的问题。
  • 通过提供涵盖代词、头衔及间接引语等独特现象的详细指南,标准化文学引文的标注实践。
  • 在新的大规模基准上评估最先进模型与基线模型,以识别说话者归属中的持续性挑战。
  • 分析引文归属中的失败模式,特别是回指消解在误属中的作用。
  • 支持未来在人物层面分析、叙事结构及跨作者风格趋势研究方面的工作。

提出的方法

  • 对22部完整长度小说中的35,978条引文进行人工标注,标注内容包括说话者、受话者、引文类型、指代表达及人物提及。
  • 制定全面的标注指南,以标准化对文学特有现象(如头衔,例如Mr.、Mrs.)、家庭称谓及回指代词等的标注。
  • 在PDNC数据集上评估两种最先进引文归属系统及一种半监督基线模型。
  • 应用启发式过滤器(如三元语法、依存句法分析、段落末尾提及)以分析归属模式与错误来源。
  • 在归属流程中使用BookNLP的回指消解模型,以隔离故障点。
  • 对不同类型引文(包括显式、隐式及回指性引文)的模型性能进行定量分析。

实验结果

研究问题

  • RQ1不同类型的引文(如显式、隐式及回指性引文)中,引文归属模型的性能如何变化?
  • RQ2回指消解错误在文学文本中说话者误属中的贡献程度如何?
  • RQ3基于句法与上下文特征的启发式过滤器能否提升归属准确率,其失败点在哪里?
  • RQ4与端到端神经网络模型相比,基于风格特征的分类基线模型在此任务中的表现如何?
  • RQ5说话者归属中最常见的失败模式是什么,它们与人物提及的歧义性及代词消解有何关联?

主要发现

  • 两种最先进引文归属模型在PDNC数据集上的平均准确率分别为0.62和0.63,表明仍有显著提升空间。
  • 回指消解被确定为错误的主要来源,尤其在回指性与隐式引文中,准确率仍低于50%。
  • 即使在显式引文中,三元语法或依存句法分析过滤器也未能完全捕捉指代表达,表明即使存在命名提及,复杂指代表达仍持续存在。
  • 段落末尾提及过滤器影响极小,表明在文学文本中该规则极少被触发。
  • 一种简单的半监督基线模型取得了具有竞争力的性能,凸显其作为低资源场景下强替代方案的实用性。
  • 风格特征分类模型在隐式与显式引文上的表现优于基于流水线的模型,表明直接预测说话者可能比基于提及的聚类更稳健。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。