Skip to main content
QUICK REVIEW

[论文解读] Simple and Effective Curriculum Pointer-Generator Networks for Reading Comprehension over Long Narratives

Yi Tay, Shuohang Wang|arXiv (Cornell University)|May 26, 2019
Topic Modeling参考文献 35被引用 16
一句话总结

本文提出一种基于课程学习的Pointer-Generator网络,并引入内省对齐层(Introspective Alignment Layer, IAL),用于长篇叙事文本的阅读理解。通过在多样化、逐步增加难度的故事视图上进行训练——涵盖可回答性与文档长度的变化——模型提升了鲁棒性与泛化能力,在NarrativeQA数据集上实现了最先进性能,BLEU-4相对提升51%,Rouge-L相对提升17%。

ABSTRACT

This paper tackles the problem of reading comprehension over long narratives where documents easily span over thousands of tokens. We propose a curriculum learning (CL) based Pointer-Generator framework for reading/sampling over large documents, enabling diverse training of the neural model based on the notion of alternating contextual difficulty. This can be interpreted as a form of domain randomization and/or generative pretraining during training. To this end, the usage of the Pointer-Generator softens the requirement of having the answer within the context, enabling us to construct diverse training samples for learning. Additionally, we propose a new Introspective Alignment Layer (IAL), which reasons over decomposed alignments using block-based self-attention. We evaluate our proposed method on the NarrativeQA reading comprehension benchmark, achieving state-of-the-art performance, improving existing baselines by $51\%$ relative improvement on BLEU-4 and $17\%$ relative improvement on Rouge-L. Extensive ablations confirm the effectiveness of our proposed IAL and CL components.

研究动机与目标

  • 为解决长篇叙事文本阅读理解中的挑战,即文档包含数千个标记,且需要超越简单跨度预测的复杂推理能力。
  • 通过在训练中模拟多样化的检索场景,提升开放域问答中模型的鲁棒性,以逼近真实推理环境。
  • 克服标准Pointer网络对答案必须显式存在于上下文中的限制,通过引入生成组件实现。
  • 通过一种新颖的基于块的自注意力机制,对分解后的注意力图进行推理,增强问题与上下文之间的对齐建模。

提出的方法

  • 该模型采用课程学习方案,引入两个难度维度:(1) 答案是否存在于上下文中(可回答性),(2) 检索文档的大小(连贯性与可理解性)。
  • 采用Pointer-Generator架构,学习从上下文中复制标记或生成新词,从而降低对答案在上下文中精确存在的依赖。
  • 内省对齐层(IAL)应用基于块的局部自注意力机制,对分解后的注意力表示进行处理,实现更细粒度、更具局部感知能力的问题与上下文匹配。
  • 训练过程根据这些难度启发式规则在简单与困难样本之间交替进行,促进渐进式学习并提升泛化能力。
  • 该框架在NarrativeQA基准上端到端进行训练,损失通过生成答案的交叉熵进行优化。
  • 使用标准指标(如BLEU-4和Rouge-L)进行评估,消融实验验证了课程学习与IAL的贡献。

实验结果

研究问题

  • RQ1基于可回答性与文档长度的课程学习是否能提升长篇阅读理解中的模型泛化能力?
  • RQ2采用课程训练方案的Pointer-Generator架构是否在长篇叙事问答任务中优于标准跨度预测模型?
  • RQ3与原始自注意力机制相比,内省对齐层(IAL)在长上下文设置下如何提升基于注意力的推理能力?
  • RQ4在检索增强型问答中,训练期间多样化数据采样在多大程度上缓解了训练与推理之间分布偏移的问题?
  • RQ5在答案未显式存在于上下文中的情况下,基于课程学习与生成能力的模型是否仍具备泛化能力?

主要发现

  • 所提出的IAL-CPG模型在NarrativeQA基准上达到最先进性能,相比先前最先进模型,BLEU-4相对提升51%。
  • 模型在Rouge-L上实现17%的相对提升,表明在长篇叙事文本生成方面具有更优的生成质量。
  • 消融实验确认,课程学习方案与内省对齐层(IAL)均对性能提升有显著贡献。
  • 与强基准跨度预测模型BiDAF相比,该模型在BLEU-4得分上高出十倍,凸显生成方法相对于抽取式方法的优势。
  • 发现NarrativeQA的评估方案存在缺陷,模型可生成语义正确但因词汇不匹配而得分为零的答案。
  • 强化学习在该设置下未能有效提升答案质量,实验报告结果为负面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。