Skip to main content
QUICK REVIEW

[论文解读] A Qualitative Comparison of CoQA, SQuAD 2.0 and QuAC

Mark Yatskar|arXiv (Cornell University)|Sep 27, 2018
Topic Modeling参考文献 31被引用 9
一句话总结

本文对三个问答数据集——CoQA、SQuAD 2.0 和 QuAC——进行了定性比较,重点关注不可回答问题、多轮对话特性以及生成式答案。提出了一种统一的抽取式模型 BiDAF++,通过引入自注意力机制和 ELMo 嵌入,其在 CoQA 上取得了最先进性能,并在微调后实现了中等程度的跨数据集迁移效果,尽管直接迁移能力较弱。

ABSTRACT

We compare three new datasets for question answering: SQuAD 2.0, QuAC, and CoQA, along several of their new features: (1) unanswerable questions, (2) multi-turn interactions, and (3) abstractive answers. We show that the datasets provide complementary coverage of the first two aspects, but weak coverage of the third. Because of the datasets' structural similarity, a single extractive model can be easily adapted to any of the datasets and we show improved baseline results on both SQuAD 2.0 and CoQA. Despite the similarity, models trained on one dataset are ineffective on another dataset, but we find moderate performance improvement through pretraining. To encourage cross-evaluation, we release code for conversion between datasets at https://github.com/my89/co-squac .

研究动机与目标

  • 分析并比较 CoQA、SQuAD 2.0 和 QuAC 在不可回答问题覆盖、多轮对话交互以及生成式答案生成方面的差异。
  • 评估尽管结构相似,问答模型在三个数据集之间的可迁移性。
  • 基于 BiDAF++ 模型(引入自注意力机制和 ELMo 上下文词嵌入)建立强大的抽取式基线,以提升 CoQA 上的性能,并支持跨数据集评估。
  • 发布数据集转换工具,以促进跨基准评估与模型泛化能力。

提出的方法

  • 在所有三个数据集上应用统一的抽取式模型 BiDAF++,并引入自注意力机制和 ELMo 上下文词嵌入。
  • 通过将不可回答问题分类为“是/否”或“不可回答”来修改模型以处理不可回答问题,并通过在上下文上直接标记先前答案片段来管理对话上下文。
  • 在每个数据集上独立训练模型,并通过其他数据集的预训练权重进行微调,以评估迁移性能。
  • 采用双上下文设置进行对话建模,将先前的问答对进行编码并通过自注意力机制进行关注。
  • 针对“是/否”问题实现基于理由跨度的输出策略,返回“是”或“否”而非抽取式跨度。
  • 在 https://github.com/my89/co-squac 发布转换工具,以支持跨数据集评估与模型可移植性。

实验结果

研究问题

  • RQ1CoQA、SQuAD 2.0 和 QuAC 在不可回答问题的覆盖上存在哪些差异,特别是从虚假前提、信息缺失或实体混乱等根本原因来看?
  • RQ2这三种数据集中对话特征(如话题转换、澄清性问题和话题回归行为)的差异程度如何?
  • RQ3在某一数据集上训练的模型在另一数据集上的泛化能力如何?预训练在提升跨数据集性能方面起到何种作用?
  • RQ4QuAC 和 CoQA 上抽取式性能的上限是多少?通过生成式答案优化能实现多大程度的性能提升?
  • RQ5是否可以仅通过极少的架构修改,将单一抽取式模型架构有效适配到所有三个数据集上?

主要发现

  • SQuAD 2.0 覆盖了多种不可回答问题类型,包括虚假前提(21.3%)和信息缺失(16.1%),而 QuAC 更侧重于信息缺失(71.2%),CoQA 的不可回答问题覆盖极少(1000 个问题中仅 5 个)。
  • 与 CoQA 相比,QuAC 的话题转换频率更高(35.4%),句子覆盖度更低(28.4%),而 CoQA 更强调深入追问(72.0%)和更高的句子覆盖度(63.3%)。
  • BiDAF++ 在 CoQA 上的 F1 得分为 70.5,相比之前的抽取式基线提升 14.2 F1,相比生成式基线提升 2.7 F1。
  • 从 SQuAD 2.0 或 CoQA 微调的模型在目标数据集上平均提升 2.1 F1,表明尽管直接迁移能力差,但存在中等程度的迁移潜力。
  • QuAC 的抽取式性能上限为 100 F1,CoQA 为 97.8 F1,表明大多数生成式答案仅涉及少量重述或指代关系,与抽取式跨度高度重叠。
  • 尽管结构相似,未经微调的模型在不同数据集上表现均较差,凸显了预训练或领域特定适应的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。