[论文解读] QAMPARI: An Open-domain Question Answering Benchmark for Questions with Many Answers from Multiple Paragraphs
QAMPARI 引入了一个具有挑战性的开放域问答基准,用于需要从多个维基百科段落中提取多个答案的问题,通过从 Wikidata 和维基百科表格半自动生成,并经人工验证。尽管使用了最先进模型,最佳 F1 得分仅为 32.8,凸显了在多答案、多段落问题上检索与答案生成方面仍存在重大挑战。
Existing benchmarks for open-domain question answering (ODQA) typically focus on questions whose answers can be extracted from a single paragraph. By contrast, many natural questions, such as "What players were drafted by the Brooklyn Nets?" have a list of answers. Answering such questions requires retrieving and reading from many passages, in a large corpus. We introduce QAMPARI, an ODQA benchmark, where question answers are lists of entities, spread across many paragraphs. We created QAMPARI by (a) generating questions with multiple answers from Wikipedia's knowledge graph and tables, (b) automatically pairing answers with supporting evidence in Wikipedia paragraphs, and (c) manually paraphrasing questions and validating each answer. We train ODQA models from the retrieve-and-read family and find that QAMPARI is challenging in terms of both passage retrieval and answer generation, reaching an F1 score of 32.8 at best. Our results highlight the need for developing ODQA models that handle a broad range of question types, including single and multi-answer questions.
研究动机与目标
- 解决开放域问答(ODQA)中缺乏要求从多个段落中提取多个答案的基准的问题。
- 创建一个真实、可扩展的多答案问题基准,反映超越单答案、单段落任务的真实世界复杂性。
- 评估 ODQA 模型在多样化问题类型(包括复合问题和交集问题)下的泛化能力和鲁棒性。
- 识别当前检索-阅读流水线在处理长且分散的答案集时的关键瓶颈。
- 倡导在单答案(如 NQ)和多答案(如 QAMPARI)基准上进行联合评估,以提升模型泛化能力。
提出的方法
- 通过预定义模板(例如,'与 [实体] 有关的 [关系] 是什么?')从 Wikidata 关系和维基百科表格中生成多答案问题,并转换为自然语言。
- 使用实体链接和段落检索技术,自动将每个答案与支持性维基百科段落配对。
- 通过众包方式将问题改写为自然语言并验证答案正确性,确保语言多样性与事实准确性。
- 构建复合问题和交集问题(例如,'克林特·伊斯特伍德执导并制作了哪些电影?')以增加复杂度。
- 采用两阶段评估设置:首先使用 BM25 和 DPR 评估检索性能;其次使用类似 RAG 和 FiD 的阅读器评估答案生成性能。
- 通过提供黄金支持段落进行“最优分析”(oracle analysis),以分离检索与阅读阶段的性能表现。
实验结果
研究问题
- RQ1当前的检索-阅读 ODQA 模型在需要从多个段落中提取多个答案的问题上表现如何?
- RQ2当答案分布在超过 50 个段落时,模型性能下降的程度如何?与单答案基准相比有何差异?
- RQ3在多答案 ODQA 中,检索质量与答案生成能力的相对贡献分别是什么?
- RQ4在 NQ 和 QAMPARI 上进行多任务训练,是否能提升模型在多答案问题上的表现,相比仅在 QAMPARI 上训练?
- RQ5在这一多答案、多段落基准上,封闭书模型的性能与检索-阅读模型相比如何?
主要发现
- QAMPARI 上表现最佳的模型 F1 得分为 32.8,表明在多答案问题的检索与答案生成方面仍存在显著挑战。
- 仅有 31.2% 的测试样本获得了超过 80% 的正确答案,凸显了在分散段落中捕捉所有相关答案的困难。
- PIG-DPR 的召回率优于 FiD-DPR(高于 FiD-BM25),表明独立处理各段落能提升多答案问题的检索覆盖度。
- 最优分析显示,当提供黄金支持段落时性能显著提升,表明检索是主要瓶颈。
- 封闭书模型表现极差(F1 = 2.6),凸显了在无外部检索支持下,记忆或泛化多样化、多事实问题的挑战。
- 在 NQ 和 QAMPARI 上进行多任务训练,相比仅在 QAMPARI 上训练,能提升 QAMPARI 上的性能,证实了多样化监督的益处。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。