Skip to main content
QUICK REVIEW

[论文解读] Building Large Machine Reading-Comprehension Datasets using Paragraph Vectors

Radu Soricut, Nan Ding|arXiv (Cornell University)|Dec 13, 2016
Topic Modeling参考文献 18被引用 4
一句话总结

本文提出了一种基于段落向量的方法,可从新闻语料库中自动构建大规模机器阅读理解(MRC)数据集,生成约200万个样本。同时提出了一种结合循环神经网络(RNN)与前馈神经网络的混合神经网络模型,在该数据集上取得了83.2%的准确率,较估计的人类性能上限91%低8.8个百分点,为未来改进留出空间。

ABSTRACT

We present a dual contribution to the task of machine reading-comprehension: a technique for creating large-sized machine-comprehension (MC) datasets using paragraph-vector models; and a novel, hybrid neural-network architecture that combines the representation power of recurrent neural networks with the discriminative power of fully-connected multi-layered networks. We use the MC-dataset generation technique to build a dataset of around 2 million examples, for which we empirically determine the high-ceiling of human performance (around 91% accuracy), as well as the performance of a variety of computer models. Among all the models we have experimented with, our hybrid neural-network architecture achieves the highest performance (83.2% accuracy). The remaining gap to the human-performance ceiling provides enough room for future model improvements.

研究动机与目标

  • 开发一种可扩展的、自动化的从广泛可用的新闻文本中构建大规模机器阅读理解数据集的方法。
  • 估计在该类数据集上的人类性能上限,以衡量模型改进的剩余空间。
  • 设计一种结合循环神经网络(RNN)与全连接网络优势的神经网络架构,以提升MRC性能。
  • 发布一个大规模、公开可用的MRC数据集,以支持未来研究与模型对比。

提出的方法

  • MC-Create算法利用段落向量模型对文本段落进行嵌入,并基于语义相似性与实体级别的扰动生成问题-答案对。
  • 通过将段落中的关键实体替换为匿名占位符来生成问题,确保答案完全基于段落内容。
  • 利用英语Gigaword语料库作为标题-文章对的来源,用于构建数据集。
  • 提出一种混合神经网络架构,结合双向LSTM进行上下文编码,以及多层前馈神经网络进行答案预测。
  • 在自动构建的数据集上端到端训练模型,使用交叉熵损失函数,并对多选选项进行Softmax分类。
  • 通过开发集的标注估计人类性能,确定91%的准确率为性能上限。

实验结果

研究问题

  • RQ1基于段落向量的方法能否有效用于从原始新闻文本中生成大规模、高质量的机器阅读理解数据集?
  • RQ2在该类自动构建的数据集上,人类性能的上限是多少?
  • RQ3结合RNN与前馈神经网络的混合神经架构能否在大规模MRC任务上超越标准模型?
  • RQ4当前最先进模型与新数据集上的人类性能上限之间,还存在多大的改进空间?

主要发现

  • 所提出的基于段落向量的数据集生成方法成功构建了约200万条机器阅读理解样本的数据集。
  • 在五选一多选设置下,人类在该数据集上的性能估计为91%的准确率,表明模型性能具有较高的上限。
  • 混合神经网络模型在该数据集上取得了迄今报告的最高准确率83.2%,证明了结合RNN与全连接网络架构的有效性。
  • 人类性能上限(91%)与最佳模型性能(83.2%)之间的差距表明,未来仍有显著的改进空间。
  • 由于当前最先进模型与人类性能接近,CNN/DailyMail数据集已不再适合作为基准,新数据集成为未来研究更具可行性的目标。
  • 作者已将该数据集公开发布,以支持研究可复现性,并推动机器理解技术的进一步发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。