Skip to main content
QUICK REVIEW

[论文解读] SearchQA: A New Q&A Dataset Augmented with Context from a Search Engine

Matthew Dunn, Levent Sagun|arXiv (Cornell University)|Apr 18, 2017
Topic Modeling被引用 11
一句话总结

本文介绍了 SearchQA,这是一个大规模的问答数据集,包含 140,461 个问题-答案对,并通过来自 Google 的真实搜索引擎片段进行增强,模拟了端到端问答系统的实际流程。该数据集揭示了人类与机器模型之间的显著性能差距,证明其作为基准数据集在推进使用真实、嘈杂检索上下文的开放域问答系统方面的价值。

ABSTRACT

We publicly release a new large-scale dataset, called SearchQA, for machine comprehension, or question-answering. Unlike recently released datasets, such as DeepMind CNN/DailyMail and SQuAD, the proposed SearchQA was constructed to reflect a full pipeline of general question-answering. That is, we start not from an existing article and generate a question-answer pair, but start from an existing question-answer pair, crawled from J! Archive, and augment it with text snippets retrieved by Google. Following this approach, we built SearchQA, which consists of more than 140k question-answer pairs with each pair having 49.6 snippets on average. Each question-answer-context tuple of the SearchQA comes with additional meta-data such as the snippet's URL, which we believe will be valuable resources for future research. We conduct human evaluation as well as test two baseline methods, one simple word selection and the other deep learning based, on the SearchQA. We show that there is a meaningful gap between the human and machine performances. This suggests that the proposed dataset could well serve as a benchmark for question-answering.

研究动机与目标

  • 创建一个反映现实世界问答完整流程的数据集,包括从搜索引擎检索信息。
  • 解决现有数据集使用人工构造的、完全相关上下文的局限性,引入真实世界的噪声和模糊性。
  • 提供一个带有丰富元数据(包括 URL 和片段级来源信息)的基准数据集,以支持可复现的研究。
  • 通过人类和机器基线评估数据集的难度,揭示出有意义的性能差距。
  • 公开发布数据集和代码,以加速开放域机器理解研究。

提出的方法

  • 通过使用 Jeopardy! 数据存档中的问题作为查询,从 Google 检索搜索片段来构建数据集。
  • 每个问题-答案对平均附加 49.6 个片段,以模拟现实世界中的检索噪声和无关性。
  • 经过大量清洗,移除可直接回答的片段(例如,包含 'Jeopardy!' 或确切问题的片段),并确保答案在上下文中存在。
  • 仅保留答案长度为三个词或以下的问题,以保持与标准问答评估的一致性。
  • 在数据集上微调注意力求和阅读器(ASR)模型,并采用修改后的 n-gram 版本以处理多词答案。
  • 使用简单的 TF-IDF Max 基线来评估在嘈杂上下文中词汇匹配的有效性。

实验结果

研究问题

  • RQ1在 SearchQA 上训练的问答系统能否泛化到真实世界中存在噪声的检索上下文?
  • RQ2人类在真实、搜索增强的问答任务上的表现与最先进神经模型相比如何?
  • RQ3与合成或人工筛选的上下文相比,真实搜索片段的引入在多大程度上增加了问答任务的难度?
  • RQ4注意力求和阅读器(ASR)模型在具有高噪声和模糊性的数据集上是否表现出较强性能?
  • RQ5简单的词汇方法(如 TF-IDF Max)是否能在该数据集上超越神经模型?

主要发现

  • SearchQA 数据集包含 140,461 个问题-答案对,每个问题平均对应 49.6 个片段,片段来自真实的 Google 搜索结果。
  • 人类在该数据集上的表现显著低于预期,可能由于片段存在噪声、不完整以及任务疲劳。
  • TF-IDF Max 基线在测试集上的 top-1 准确率为 12.7%,表明在嘈杂上下文中效果有限。
  • 注意力求和阅读器(ASR)模型在测试集上的 top-1 准确率为 41.3%,显示出有意义但依然显著的与人类表现的差距。
  • n-gram 版本 ASR 模型的 F1 得分为 22.8,表明在嘈杂上下文中处理多词答案仍具挑战性。
  • 人类与机器之间的性能差距表明,SearchQA 是一个具有挑战性且真实的基准,可用于推进开放域问答系统的发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。