Skip to main content
QUICK REVIEW

[论文解读] Analysis of Wikipedia-based Corpora for Question Answering

Tomasz Jurczyk, Amit Ajit Deshmane|arXiv (Cornell University)|Jan 6, 2018
Topic Modeling参考文献 2被引用 6
一句话总结

本文对四个基于维基百科的问答语料库——WikiQA、SelQA、SQuAD 和 InfoboxQA——进行了全面的内在与外在分析,比较了其问题类型、答案类别以及上下文相似性。提出了一种基于索引的方法,用于创建用于答案检索与触发的银标准数据集,结果表明:在特定语料库上训练的模型优于联合训练,尤其在 WikiQA 和 InfoboxQA 中针对短小、类似查询的问题表现更优。

ABSTRACT

This paper gives comprehensive analyses of corpora based on Wikipedia for several tasks in question answering. Four recent corpora are collected,WikiQA, SelQA, SQuAD, and InfoQA, and first analyzed intrinsically by contextual similarities, question types, and answer categories. These corpora are then analyzed extrinsically by three question answering tasks, answer retrieval, selection, and triggering. An indexing-based method for the creation of a silver-standard dataset for answer retrieval using the entire Wikipedia is also presented. Our analysis shows the uniqueness of these corpora and suggests a better use of them for statistical question answering learning.

研究动机与目标

  • 理解四个主要基于维基百科的问答语料库在问题类型、答案类别和上下文相似性方面的内在差异。
  • 通过外在基准测试评估将这些语料库合并用于统计问答学习的有效性。
  • 开发并发布一个基于完整维基百科索引的银标准数据集,用于答案检索与触发。
  • 根据问题类型(短查询 vs. 长自然语言问题)为研究人员提供选择最优训练语料库的指导。
  • 识别跨语料库训练的局限性,并推荐基于语料库特定的模型训练策略。

提出的方法

  • 使用上下文相似性、问题长度、答案类别分布以及词汇重叠(Ωq、Ωa、Ωf)等指标,对四个语料库进行内在分析。
  • 通过索引整个维基百科并使用 Lucene 为每个问题检索前 k 个段落,构建用于答案检索的银标准数据集。
  • 使用二元语法卷积神经网络模型,在交叉验证设置下评估所有语料库的答案选择、检索与触发性能。
  • 利用答案检索结果构建答案触发数据集,其中检索到的段落中不保证包含答案上下文。
  • 在单一语料库和合并语料库上训练并评估模型,以评估模型在不同数据集间的可迁移性与性能下降情况。
  • 在所有问答任务中使用宏平均 F1、MAP 和 MRR 作为评估指标。

实验结果

研究问题

  • RQ1四个基于维基百科的语料库在问题类型、答案类别和上下文相似性方面有何不同?
  • RQ2将不同语料库合并用于训练问答模型有何影响,尤其是在不同问题风格之间?
  • RQ3基于索引的方法在创建用于答案检索与触发的银标准数据集方面有多有效?
  • RQ4为何在合并语料库上进行训练会导致 WikiQA 和 InfoboxQA 等某些数据集上的性能下降?
  • RQ5针对不同问题类型,哪种语料库特定的训练策略能取得最佳性能?

主要发现

  • WikiQA 在所有任务中表现最差,当在其自身数据上训练时 MAP 仅为 65.54%,原因在于其短小、类似查询的问题缺乏足够的词汇线索,导致 Lucene 检索效果差。
  • SQuAD 在自身数据上训练时取得最高 MAP(88.84%)和 MRR(89.69%),表明其在长自然语言问题上表现优异。
  • 在合并数据(W+S+Q)上训练可提升 SelQA 的性能(MAP 83.19%),但会损害 WikiQA 的性能,表明语料库特定特征限制了可迁移性。
  • 由于问题更短、关键词更少,WikiQA 的答案检索准确率显著低于 SelQA(34%)和 SQuAD(35%),在 k=5 时仅为 12.47%。
  • 由于检索性能差,WikiQA 的答案触发性能最低(F1 30.85%),而基于 SelQA 训练的模型在各数据集间泛化能力最佳。
  • InfoboxQA 在自身数据上训练时表现最佳(触发任务 F1 79.44%),与其他语料库合并后仅带来微小或无增益,表明其具有高度特异性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。