Skip to main content
QUICK REVIEW

[论文解读] TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension

Mandar Joshi, Eunsol Choi|arXiv (Cornell University)|May 9, 2017
Topic Modeling被引用 5
一句话总结

TriviaQA 是一个大规模、远距离监督的阅读理解数据集,包含超过 650,000 个问题-答案-证据三元组,其中问题由 trivia 爱好者独立于证据文档生成。该数据集引入了复杂且具有组合性的题目,具有高度的词汇和句法多样性,需要多句推理;当前最先进模型的性能仅为 40%,而人类性能达到 80%,凸显其对未来研究的挑战性。

ABSTRACT

We present TriviaQA, a challenging reading comprehension dataset containing over 650K question-answer-evidence triples. TriviaQA includes 95K question-answer pairs authored by trivia enthusiasts and independently gathered evidence documents, six per question on average, that provide high quality distant supervision for answering the questions. We show that, in comparison to other recently introduced large-scale datasets, TriviaQA (1) has relatively complex, compositional questions, (2) has considerable syntactic and lexical variability between questions and corresponding answer-evidence sentences, and (3) requires more cross sentence reasoning to find answers. We also present two baseline algorithms: a feature-based classifier and a state-of-the-art neural network, that performs well on SQuAD reading comprehension. Neither approach comes close to human performance (23% and 40% vs. 80%), suggesting that TriviaQA is a challenging testbed that is worth significant future study. Data and code available at -- http://nlp.cs.washington.edu/triviaqa/

研究动机与目标

  • 创建一个大规模、自然发生的阅读理解数据集,以反映真实世界问答中的复杂性。
  • 将问题生成与证据收集解耦,以减少偏差并提高泛化能力。
  • 设计一个基准测试,用于评估多句推理、句法和词汇多样性以及组合性问题理解能力。
  • 提供一个具有挑战性的测试平台,用于评估超越 SQuAD 等现有数据集的阅读理解模型。
  • 支持未来在开放域问答、知识库集成以及文本与结构化数据联合建模方面的研究。

提出的方法

  • 从爱好者处收集 95,000 个自由形式的、以 trivia 为主题的题目,且与任何证据源无关。
  • 从维基百科和网络搜索结果中为每个问题收集六份支持性证据文档,确保信息来源多样且冗余。
  • 通过将问题与相关证据文档对齐的方式实现远距离监督,无需人工标注对齐关系。
  • 设计数据集时包含需要跨多句话进行推理的问题,且问题与证据之间具有高度的词汇和句法差异。
  • 实现两个基线模型:一个基于特征的分类器和一个当前最先进神经网络模型(BiDAF)以供比较。
  • 使用精确匹配和 F1 分数评估模型在答案跨度抽取上的表现,并与人类性能进行比较。

实验结果

研究问题

  • RQ1TriviaQA 在问题复杂性和推理需求方面与 SQuAD 和 MS MARCO 等现有数据集相比如何?
  • RQ2问题与证据句之间的词汇和句法差异在多大程度上对阅读理解模型构成挑战?
  • RQ3当前最先进神经网络模型能否泛化到 TriviaQA 的复杂多句推理任务中?
  • RQ4当前模型与人类在该数据集上的性能差距有多大?
  • RQ5考虑到复杂性的提升,模型在 TriviaQA 上的表现与在 SQuAD 上的表现相比如何?

主要发现

  • TriviaQA 包含超过 650,000 个问题-答案-证据三元组,问题由独立于证据文档的作者生成,从而减少了标注偏差。
  • 该数据集中的问题需要多句推理的比例显著高于 SQuAD——高出三倍,使推理模型面临更大挑战。
  • 大量问题在问题与支持答案的句子之间表现出显著的词汇和句法差异。
  • 表现最佳的基线模型(BiDAF)在 TriviaQA 上的 F1 分数仅为 40%,而其在 SQuAD 上的 F1 分数为 68%,表明存在巨大性能差距。
  • 人类在 TriviaQA 上的 F1 分数达到 79.7%,显示出当前模型与人类水平理解之间存在超过 35 个百分点的显著差距。
  • 结果证实,TriviaQA 是一个具有挑战性的基准,要求在推理、泛化和理解能力方面实现显著突破,超越当前技术水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。