[论文解读] Generation-Augmented Retrieval for Open-domain Question Answering
生成增强检索(GAR)通过语言模型生成的上下文来扩展查询,在结合稀疏 BM25 时提升开放领域检索性能和端到端问答效果,并且与像 DPR 这样的密集检索方法互补。
We propose Generation-Augmented Retrieval (GAR) for answering open-domain questions, which augments a query through text generation of heuristically discovered relevant contexts without external resources as supervision. We demonstrate that the generated contexts substantially enrich the semantics of the queries and GAR with sparse representations (BM25) achieves comparable or better performance than state-of-the-art dense retrieval methods such as DPR. We show that generating diverse contexts for a query is beneficial as fusing their results consistently yields better retrieval accuracy. Moreover, as sparse and dense representations are often complementary, GAR can be easily combined with DPR to achieve even better performance. GAR achieves state-of-the-art performance on Natural Questions and TriviaQA datasets under the extractive QA setup when equipped with an extractive reader, and consistently outperforms other retrieval methods when the same generative reader is used.
研究动机与目标
- 在不需要外部监督的情况下,通过使用生成的上下文来丰富查询,推动提升 OpenQA 检索器的性能。
- 提出 GAR 以生成多种生成目标(答案、包含答案的句子,以及段落标题)来增强查询。
- 在 Natural Questions 和 TriviaQA 数据集上,使用稀疏 BM25 以及阅读器评估 GAR。
- 展示多样化的生成目标能够提升检索,且 GAR 可以与密集检索器结合以获得进一步提升。
提出的方法
- 通过使用预训练语言模型(BART-large)为三个目标生成上下文来增强问题:答案、包含答案的句子、以及段落的标题。
- 将生成的上下文附加到原始问题,形成生成增强查询。
- 检索使用 BM25(稀疏)进行,来自多个增强查询的结果进行等权融合或通过简单的融合方法进行。
- 使用一个抽取式阅读器(类似 DPR)和一个生成式阅读器(基于 BART 的序列到序列)来评估端到端问答性能。
- 在 Natural Questions 和 TriviaQA 上以 top-k 检索准确率和 Exact Match(EM)作为问答评估指标进行评估。
- 证明使用稀疏表示的 Gar 能与 DPR 等密集方法相媲美甚至超过它们,且 Gar+ 可以在单独方法之上取得更好结果。
实验结果
研究问题
- RQ1生成增强检索是否在段落检索准确性方面优于 BM25 及单独的 DPR?
- RQ2不同的生成目标(答案、句子、标题)如何促进检索,融合是否有益?
- RQ3GAR 能否与密集检索器互补以进一步提升端到端的 QA 性能?
- RQ4在 NQ 和 TriviaQA 的抽取式与生成式阅读设置下,GAR 的端到端 QA 性能如何?
主要发现
- 在 NQ 和 TriviaQA 的许多 k 值下,使用 BM25 的 GAR 的检索性能与密集方法相比,达到相当或更好的水平。
- 使用多种生成目标并进行融合在多个数据集上带来稳健的收益。
- Gar+(GAR 与 DPR 融合)在检索上持续优于任一方法单独使用,在端到端的抽取式 OpenQA 中达到最先进的结果。
- 端到端抽取式 QA:EM=41.8(Gar+ 时为43.8)在 NQ 上,Trivia 为62.7;生成式 QA:EM=38.1(Gar+ 时为45.3)在 NQ,Trivia 62.2。
- GAR 展示出较高效率,生成增强查询带来适度的开销,但相较于基线仍带来显著的检索提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。