Skip to main content
QUICK REVIEW

[论文解读] AmbigQA: Answering Ambiguous Open-domain Questions

Sewon Min, Julian Michael|arXiv (Cornell University)|Apr 22, 2020
Topic Modeling参考文献 27被引用 16
一句话总结

本文提出了AmbigQA,一项新的开放域问答任务,要求模型识别模糊问题的所有合理答案,并为每个答案生成消歧后的重写问题。基于从NQ-open中提取的14,042个模糊问题的AmbigNQ数据集,作者发现超过50%的问题具有模糊性,并提出了利用NQ-open的弱监督来改进多答案生成与消歧的基线模型,在多答案预测任务上实现了出色的零样本性能。

ABSTRACT

Ambiguity is inherent to open-domain question answering; especially when exploring new topics, it can be difficult to ask questions that have a single, unambiguous answer. In this paper, we introduce AmbigQA, a new open-domain question answering task which involves finding every plausible answer, and then rewriting the question for each one to resolve the ambiguity. To study this task, we construct AmbigNQ, a dataset covering 14,042 questions from NQ-open, an existing open-domain QA benchmark. We find that over half of the questions in NQ-open are ambiguous, with diverse sources of ambiguity such as event and entity references. We also present strong baseline models for AmbigQA which we show benefit from weakly supervised learning that incorporates NQ-open, strongly suggesting our new task and data will support significant future research effort. Our data and baselines are available at https://nlp.cs.washington.edu/ambigqa.

研究动机与目标

  • 为解决开放域问答中问题常具有多种合理解释的模糊性挑战。
  • 开发一项新任务AmbigQA,要求模型识别所有有效答案,并为每个答案生成消歧后的问题变体。
  • 构建一个高质量的AmbigNQ数据集,包含从NQ-open中提取的14,042个模糊问题,涵盖多样化的模糊类型,并具有较高的标注者间一致性(89.0 F1)。
  • 利用来自NQ-open的弱监督,建立用于多答案生成与消歧的强基线模型。
  • 评估基于在单答案NQ-open数据上预训练的模型,在无直接多答案示例监督下,实现零样本多答案预测的可行性。

提出的方法

  • 通过从NQ-open中收集14,042个模糊问题构建AmbigNQ,由人工标注者通过维基百科检索与阅读识别所有合理答案。
  • 设计多阶段模型流水线:(1) 用于基于集合的答案生成的序列到序列模型,(2) 用于为每个答案重写问题的消歧模型,(3) 一种改进的民主共训练方法,以利用来自NQ-open的部分监督。
  • 采用阈值策略从微调过的NQ-open模型中提取多个答案,实现零样本多答案预测。
  • 应用消融研究与定性分析,评估各组件对答案召回率与消歧质量的影响。
  • 使用来自NQ-open的弱监督训练模型,以在无需为所有答案提供完整标注的情况下提升AmbigNQ上的性能。
  • 使用NQ-open上的精确匹配(EM)和AmbigNQ多答案预测任务上的F1值评估模型性能。

实验结果

研究问题

  • RQ1在现有基准如NQ-open中,开放域问题的实际模糊比例是多少?其主要模糊来源是什么?
  • RQ2在未直接接触多答案示例的情况下,仅在单答案QA数据上训练的模型能否泛化到模糊问题的多合理答案预测?
  • RQ3弱监督学习方法在提升模糊问题的多答案生成与消歧问题重写方面的有效性如何?
  • RQ4多答案生成中的主要失败模式是什么,特别是在答案召回与答案选择方面?
  • RQ5问题的模糊性在多大程度上导致标准基准(如NQ-open)低估了模型的实际性能?

主要发现

  • NQ-open中超过50%的问题具有模糊性,其来源多样,包括实体指代、事件指代、答案类型及时间依赖性。
  • AmbigNQ数据集包含14,042个标注问题,平均每题有2.1个不同答案,且标注者间一致性高(89.0 F1)。
  • 通过弱监督从NQ-open微调的基线模型在多答案预测任务上表现出色的零样本性能,其中SpanSeqGen在AmbigNQ多答案F1上达到42.2。
  • 答案召回仍是主要挑战:在20个部分正确的预测中,有15个仅生成了一个答案,常遗漏其他合理选项。
  • 对非模糊问题的性能较高(20题中正确13题),表明标准基准如NQ-open可能因未标记模糊性而低估了模型的真实性能。
  • 结果表明,提升答案召回率与消歧质量是AmbigQA未来研究的关键挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。