Skip to main content
QUICK REVIEW

[论文解读] The Shmoop Corpus: A Dataset of Stories with Loosely Aligned Summaries

Atef Chaudhury, Makarand Tapaswi|arXiv (Cornell University)|Dec 30, 2019
Topic Modeling参考文献 12被引用 4
一句话总结

Shmoop语料库引入了一个新型数据集,包含7,234个故事章节及其与之时间顺序对齐的多段落摘要,来自Shmoop平台,可提升机器阅读理解能力。通过利用时间顺序对齐作为监督信号,作者在Cloze式问题回答和生成式摘要任务中均取得显著性能提升,表明结构化的时序监督能增强模型在长篇叙事理解任务中的表现。

ABSTRACT

Understanding stories is a challenging reading comprehension problem for machines as it requires reading a large volume of text and following long-range dependencies. In this paper, we introduce the Shmoop Corpus: a dataset of 231 stories that are paired with detailed multi-paragraph summaries for each individual chapter (7,234 chapters), where the summary is chronologically aligned with respect to the story chapter. From the corpus, we construct a set of common NLP tasks, including Cloze-form question answering and a simplified form of abstractive summarization, as benchmarks for reading comprehension on stories. We then show that the chronological alignment provides a strong supervisory signal that learning-based methods can exploit leading to significant improvements on these tasks. We believe that the unique structure of this corpus provides an important foothold towards making machine story comprehension more approachable.

研究动机与目标

  • 为解决机器故事理解的挑战,该挑战需要对长篇复杂叙事中的长距离依赖关系进行建模。
  • 提供一种比现有数据集(如NarrativeQA)更结构化且可扩展的替代方案,后者依赖稀疏的问答对和弱监督。
  • 创建一个具有细粒度章节级摘要的基准数据集,其形式类似于人类学习辅助工具,从而为NLP模型提供更优的训练信号。
  • 评估故事与摘要段落之间的时间顺序对齐是否可作为强监督信号,以提升下游阅读理解任务的性能。
  • 证明利用时间结构可提升在Cloze问答和简化生成式摘要任务中的性能表现。

提出的方法

  • 通过从Shmoop网站和Project Gutenberg收集成对的故事章节与Shmoop摘要,并进行人工解析和章节分割,构建了该语料库。
  • 对语料库中5%的样本(360个章节)进行了人工对齐,以验证时间顺序的一致性,使用项目符号(摘要)和换行符(故事)作为段落分割依据。
  • 作者提出了一种联合学习框架,通过改进的CCCP算法同时优化模型参数和对齐矩阵,利用动态规划实现最优对齐的高效计算。
  • 训练过程中采用对比采样策略,以近似所有可能对齐中的最大值;而在验证阶段,则直接计算最优对齐。
  • 该方法利用时间结构计算对齐,即使在对话密集或叙述密集的段落中,也能保持时间顺序,支持一对一、一对多及多对一的映射关系。
  • 该框架在两项任务上进行了评估:Cloze形式的问题回答和多项选择式生成摘要,性能通过标准NLP指标进行衡量。

实验结果

研究问题

  • RQ1故事与摘要段落之间的时间顺序对齐能否作为训练机器理解模型的强监督信号?
  • RQ2与整体故事级别的粗粒度摘要相比,使用细粒度的章节级摘要在提升阅读理解基准性能方面有何差异?
  • RQ3在叙事文本中建模长距离依赖关系,对Cloze式问题回答和生成式摘要任务的性能提升程度如何?
  • RQ4一种在学习对齐的同时优化模型参数的联合优化框架,是否能优于无显式对齐监督的端到端训练方法?
  • RQ5时间结构对诸如对话密集场景或叙述密集段落等变化的鲁棒性如何?

主要发现

  • Shmoop语料库包含231个故事(145部小说、62部戏剧、24篇短篇小说),共7,234对章节-摘要,实现了短篇与长篇叙事数据的平衡。
  • 仅1.2%的人工对齐摘要段落偏离了时间顺序,表明数据结构具有高度的时间一致性。
  • 时间顺序对齐在Cloze式问题回答和生成式摘要任务中均带来了显著的性能提升,证明其作为监督信号的有效性。
  • 基于动态规划的对齐计算联合学习框架,在建模跨章节的长距离依赖方面优于基线方法,表现更优。
  • 该数据集支持多样的对齐模式,包括一对多(如对话场景)和多对一(如密集叙述段落),显示出对不同叙事结构的适应能力。
  • 结果表明,结构化且时间对齐的摘要可显著提升模型在复杂长篇叙事上的泛化能力与理解能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。