[论文解读] Generator-Retriever-Generator Approach for Open-Domain Question Answering
该论文提出了一种新型开放域问答框架——生成器-检索器-生成器(GRG),该框架首先利用大语言模型(LLM)根据问题生成上下文相关的文档,同时通过密集向量检索器从外部获取文档。随后,第二个LLM将生成的文档与检索到的文档进行融合,生成最终答案,在TriviaQA、Natural Questions(NQ)和WebQ数据集上实现了最先进性能,F1分数相比之前方法最高提升5.2分。
Open-domain question answering (QA) tasks usually require the retrieval of relevant information from a large corpus to generate accurate answers. We propose a novel approach called Generator-Retriever-Generator (GRG) that combines document retrieval techniques with a large language model (LLM), by first prompting the model to generate contextual documents based on a given question. In parallel, a dual-encoder network retrieves documents that are relevant to the question from an external corpus. The generated and retrieved documents are then passed to the second LLM, which generates the final answer. By combining document retrieval and LLM generation, our approach addresses the challenges of open-domain QA, such as generating informative and contextually relevant answers. GRG outperforms the state-of-the-art generate-then-read and retrieve-then-read pipelines (GENREAD and RFiD) improving their performance by at least by +5.2, +4.2, and +1.6 on TriviaQA, NQ, and WebQ datasets, respectively. We provide code, datasets, and checkpoints at https://github.com/abdoelsayed2016/GRG.
研究动机与目标
- 为解决现有开放域问答流水线的局限性,如噪声文档片段和问题与文档之间交互浅显的问题。
- 通过整合LLM生成的上下文与密集段落检索,提升答案的相关性与信息量。
- 通过生成上下文相关的文档,减少对固定且可能无关的文档片段的依赖。
- 通过联合处理生成与检索的文档,增强模型捕捉复杂问题-文档依赖关系的能力。
- 为未来研究提供可复现的开源解决方案,包含代码、数据集和模型检查点。
提出的方法
- GRG框架采用两阶段流程:首先,使用指令微调的大语言模型(如InstructGPT)基于输入问题生成合成的、上下文丰富的文档。
- 同时,基于双编码器的密集段落检索器(如DPR)利用语义相似度从外部语料库中检索相关文档。
- 将生成的文档与检索到的文档拼接后输入第二个LLM,通过统一的推理过程生成最终答案。
- 引入向量索引检索器作为高效的基于向量的检索机制,以提升知识覆盖范围与答案可能性。
- 采用端到端训练方法,重点关注答案质量与多样性之间的平衡,尤其针对模糊或多事实问题。
- 在TriviaQA、NQ和WebQ上进行评估,并通过消融实验分析各组件的贡献。

实验结果
研究问题
- RQ1将LLM生成的上下文与外部文档检索相结合,能否提升开放域问答中的答案准确率?
- RQ2生成文档与检索文档之间的交互如何影响答案的相关性与信息量?
- RQ3GRG框架在F1分数与精确匹配分数上是否优于现有的先生成后阅读与先检索后阅读的流水线?
- RQ4文档生成质量与检索精度对最终答案生成的影响如何?
- RQ5与基线模型相比,GRG在处理模糊或多重事实问题时表现如何?
主要发现
- GRG在TriviaQA上达到最先进性能,相比最佳基线(RFiD)F1分数至少提升+5.2分。
- 在Natural Questions(NQ)数据集上,GRG相比最强先驱方法F1分数提升+4.2分。
- 在WebQ上,GRG相比当前最先进方法F1分数提升+1.6分,表明在多样化基准上均实现稳定提升。
- 对于模糊问题,模型能生成多个正确答案,例如在迈克尔·杰克逊自传问题中同时识别出'Moonwalk'与'Moonwalk (disambiguation)',体现更强的知识覆盖能力。
- 消融实验证实,文档生成与检索均对性能有显著贡献,联合使用效果最佳。
- 该框架在处理细微问题时表现出鲁棒性,正确识别出杰米·李·柯蒂斯的星座为天蝎座,与标准答案一致。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。