Skip to main content
QUICK REVIEW

[论文解读] Harvesting Paragraph-Level Question-Answer Pairs from Wikipedia

Xinya Du, Claire Cardie|arXiv (Cornell University)|May 15, 2018
Natural Language Processing Techniques被引用 18
一句话总结

本文提出 CorefNQG,一种通过新颖门控机制整合共指知识的神经问题生成模型,以增强段落级问答对生成。该模型在 SQuAD 数据集上优于强基线模型,从 Wikipedia 生成超过 126 万个高质量问答对,并公开用于研究用途。

ABSTRACT

We study the task of generating from Wikipedia articles question-answer pairs that cover content beyond a single sentence. We propose a neural network approach that incorporates coreference knowledge via a novel gating mechanism. Compared to models that only take into account sentence-level information (Heilman and Smith, 2010; Du et al., 2017; Zhou et al., 2017), we find that the linguistic knowledge introduced by the coreference representation aids question generation significantly, producing models that outperform the current state-of-the-art. We apply our system (composed of an answer span extraction system and the passage-level QG system) to the 10,000 top-ranking Wikipedia articles and create a corpus of over one million question-answer pairs. We also provide a qualitative analysis for this large-scale generated corpus from Wikipedia.

研究动机与目标

  • 解决现有神经问题生成模型仅依赖单句上下文的局限性,该局限性无法捕捉跨句子的共指依赖关系。
  • 通过在较长文本段落中整合共指簇的语言学知识,改进阅读理解的问题生成。
  • 大规模自动从非结构化 Wikipedia 文章中提取高质量、多样化且上下文丰富的问答对。
  • 创建一个大规模、公开可用的 QA 语料库,适用于训练和评估机器阅读理解系统。

提出的方法

  • 所提出的 CorefNQG 模型使用门控注意力机制,将共指簇的连续表示——指代同一实体的提及项集群——整合到上下文编码过程中。
  • 共指簇以密集向量嵌入表示,用于门控对先前上下文的注意力,使模型能够选择性地聚焦于相关先行词。
  • 该模型在 SQuAD 数据集上使用编码器-解码器架构端到端训练,采用指针-生成网络进行答案跨度预测和问题生成。
  • 该系统由两个组件构成:答案跨度提取模块和段落级问题生成模块,两者联合训练以提升问答对质量。
  • CorefNQG 与仅使用单句上下文或完整先前上下文的基线模型进行比较,证明了有针对性的共指感知编码的优势。
  • 该框架被应用于排名前 10,000 的 Wikipedia 文章,生成超过 126 万个问答对的语料库。

实验结果

研究问题

  • RQ1共指感知的神经建模是否能超越单句上下文,在段落级问题生成中实现改进?
  • RQ2与仅使用局部或完整上下文的模型相比,整合共指簇表示如何影响生成问题的质量和多样性?
  • RQ3从 Wikipedia 生成的语料库在语言学和事实特征上与人类标注的 QA 数据集(如 SQuAD)的匹配程度如何?
  • RQ4在 Wikipedia 合成数据上训练的神经问题生成系统,能否生成支持下游阅读理解模型有效训练的语料库?

主要发现

  • CorefNQG 在 SQuAD 数据集的所有自动评估指标(精确匹配和 F1)上显著优于单句基线和完整上下文基线模型。
  • 在需要共指消解的问题上,CorefNQG 与基线模型之间的性能差距尤其显著,表明该方法在处理跨句子依赖关系方面具有有效性。
  • 在所有评估指标上,包括语法正确性和与答案的相关性,CorefNQG 的人工评估得分均显著优于基线模型。
  • 生成的语料库包含 1,259,691 个问答对,问题类型的分布与 SQuAD 非常接近,但 'What is' 和 'What was' 类问题的比例更高。
  • 在生成语料库上微调的最先进阅读理解模型(DocReader)在开发集上达到 82.33% 的精确匹配和 88.20% 的 F1,表明该语料库适用于训练,但略难于 SQuAD。
  • 在原始 SQuAD 开发集上,基于合成语料库训练的模型泛化能力较差(精确匹配为 45.2%),表明生成数据的自然度或复杂度低于众包数据,凸显了规模与质量之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。