Skip to main content
QUICK REVIEW

[论文解读] Evidence Sentence Extraction for Machine Reading Comprehension

Hai Wang, Dian Yu|arXiv (Cornell University)|Feb 23, 2019
Topic Modeling参考文献 57被引用 8
一句话总结

本文提出了首个用于多项选择机器阅读理解(MRC)的证据句子抽取方法,采用远程监督生成噪声标签,并利用深度概率逻辑框架对标签进行去噪。通过仅将抽取的证据句子输入神经阅读器,该方法在MultiRC、RACE和DREAM数据集上的表现与使用完整文档的模型相当或更优,推动了可解释性MRC的发展。

ABSTRACT

Remarkable success has been achieved in the last few years on some limited machine reading comprehension (MRC) tasks. However, it is still difficult to interpret the predictions of existing MRC models. In this paper, we focus on extracting evidence sentences that can explain or support the answers of multiple-choice MRC tasks, where the majority of answer options cannot be directly extracted from reference documents. Due to the lack of ground truth evidence sentence labels in most cases, we apply distant supervision to generate imperfect labels and then use them to train an evidence sentence extractor. To denoise the noisy labels, we apply a recently proposed deep probabilistic logic learning framework to incorporate both sentence-level and cross-sentence linguistic indicators for indirect supervision. We feed the extracted evidence sentences into existing MRC models and evaluate the end-to-end performance on three challenging multiple-choice MRC datasets: MultiRC, RACE, and DREAM, achieving comparable or better performance than the same models that take as input the full reference document. To the best of our knowledge, this is the first work extracting evidence sentences for multiple-choice MRC.

研究动机与目标

  • 为了解决现有多项选择MRC模型缺乏可解释性的问题,这些模型无法为预测提供文本依据。
  • 从参考文档中抽取支持或蕴含正确答案选项的证据句子,以用于多项选择MRC任务。
  • 通过应用远程监督来生成噪声的银标准标签,以应对缺乏真实证据标签的问题。
  • 利用深度概率逻辑学习框架,结合语言学指标(如句子相邻性与跨句关系)对不完美标签进行去噪。
  • 通过仅使用抽取的证据句子作为输入,评估神经阅读器在端到端MRC任务上的性能,以此间接衡量抽取证据的质量。

提出的方法

  • 通过问题、正确答案选项与参考文档中句子之间的词汇重叠匹配,应用远程监督生成噪声证据句子标签。
  • 设计句子级别与跨句的语言学指标(例如,相邻句子常具有相同标签)作为间接监督信号。
  • 采用深度概率逻辑学习框架,联合建模这些语言学指标,并在训练过程中对噪声标签进行优化。
  • 使用去噪后的标签训练证据句子抽取器,以预测哪些句子支持(问题,正确答案)对。
  • 通过仅将抽取的证据句子作为输入输入到现有神经MRC模型中,替代完整文档,来评估抽取证据句子的质量。
  • 将MultiRC、RACE和DREAM数据集上的端到端MRC性能作为抽取证据质量的间接代理指标。

实验结果

研究问题

  • RQ1证据句子抽取能否通过为预测提供文本依据,提升多项选择MRC模型的可解释性?
  • RQ2当缺乏真实证据标签时,远程监督在生成弱监督信号方面效果如何?
  • RQ3诸如句子相邻性与语篇连贯性等语言学指标,能否提升证据抽取中噪声标签的质量?
  • RQ4仅使用抽取的证据句子作为输入,其MRC性能是否与使用完整文档相比具有竞争力或更优?
  • RQ5自动抽取的证据句子与人工标注的真实证据之间的接近程度如何?

主要发现

  • 所提方法在MultiRC、RACE和DREAM数据集上的端到端性能与使用完整参考文档的模型相当或更优。
  • 该模型优于仅依赖词汇匹配或注意力机制的基线模型,证明了引入语言知识的价值。
  • 使用深度概率逻辑进行去噪显著提升了标签质量,这一点由下游MRC性能的提升得到验证。
  • 尽管结果表现强劲,但自动抽取的证据句子与人工标注的真实证据之间仍存在显著差距,表明仍有改进空间。
  • 该方法是首个系统性地为多项选择MRC抽取证据句子的工作,为可解释性MRC建立了新的基线。
  • 实验表明,即使仅使用证据句子,神经阅读器也能实现优异性能,验证了该抽取流程的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。