[论文解读] Harvesting Paragraph-Level Question-Answer Pairs from Wikipedia
本文提出 CorefNQG,一种通过新颖门控机制整合共指知识的神经问题生成模型,以增强段落级问答对生成。该模型在 SQuAD 数据集上优于强基线模型,从 Wikipedia 生成超过 126 万个高质量问答对,并公开用于研究用途。
We study the task of generating from Wikipedia articles question-answer pairs that cover content beyond a single sentence. We propose a neural network approach that incorporates coreference knowledge via a novel gating mechanism. Compared to models that only take into account sentence-level information (Heilman and Smith, 2010; Du et al., 2017; Zhou et al., 2017), we find that the linguistic knowledge introduced by the coreference representation aids question generation significantly, producing models that outperform the current state-of-the-art. We apply our system (composed of an answer span extraction system and the passage-level QG system) to the 10,000 top-ranking Wikipedia articles and create a corpus of over one million question-answer pairs. We also provide a qualitative analysis for this large-scale generated corpus from Wikipedia.
研究动机与目标
- 解决现有神经问题生成模型仅依赖单句上下文的局限性,该局限性无法捕捉跨句子的共指依赖关系。
- 通过在较长文本段落中整合共指簇的语言学知识,改进阅读理解的问题生成。
- 大规模自动从非结构化 Wikipedia 文章中提取高质量、多样化且上下文丰富的问答对。
- 创建一个大规模、公开可用的 QA 语料库,适用于训练和评估机器阅读理解系统。
提出的方法
- 所提出的 CorefNQG 模型使用门控注意力机制,将共指簇的连续表示——指代同一实体的提及项集群——整合到上下文编码过程中。
- 共指簇以密集向量嵌入表示,用于门控对先前上下文的注意力,使模型能够选择性地聚焦于相关先行词。
- 该模型在 SQuAD 数据集上使用编码器-解码器架构端到端训练,采用指针-生成网络进行答案跨度预测和问题生成。
- 该系统由两个组件构成:答案跨度提取模块和段落级问题生成模块,两者联合训练以提升问答对质量。
- CorefNQG 与仅使用单句上下文或完整先前上下文的基线模型进行比较,证明了有针对性的共指感知编码的优势。
- 该框架被应用于排名前 10,000 的 Wikipedia 文章,生成超过 126 万个问答对的语料库。
实验结果
研究问题
- RQ1共指感知的神经建模是否能超越单句上下文,在段落级问题生成中实现改进?
- RQ2与仅使用局部或完整上下文的模型相比,整合共指簇表示如何影响生成问题的质量和多样性?
- RQ3从 Wikipedia 生成的语料库在语言学和事实特征上与人类标注的 QA 数据集(如 SQuAD)的匹配程度如何?
- RQ4在 Wikipedia 合成数据上训练的神经问题生成系统,能否生成支持下游阅读理解模型有效训练的语料库?
主要发现
- CorefNQG 在 SQuAD 数据集的所有自动评估指标(精确匹配和 F1)上显著优于单句基线和完整上下文基线模型。
- 在需要共指消解的问题上,CorefNQG 与基线模型之间的性能差距尤其显著,表明该方法在处理跨句子依赖关系方面具有有效性。
- 在所有评估指标上,包括语法正确性和与答案的相关性,CorefNQG 的人工评估得分均显著优于基线模型。
- 生成的语料库包含 1,259,691 个问答对,问题类型的分布与 SQuAD 非常接近,但 'What is' 和 'What was' 类问题的比例更高。
- 在生成语料库上微调的最先进阅读理解模型(DocReader)在开发集上达到 82.33% 的精确匹配和 88.20% 的 F1,表明该语料库适用于训练,但略难于 SQuAD。
- 在原始 SQuAD 开发集上,基于合成语料库训练的模型泛化能力较差(精确匹配为 45.2%),表明生成数据的自然度或复杂度低于众包数据,凸显了规模与质量之间的权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。