[论文解读] Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative Approach
该论文提出 ReSP,一种新颖的迭代检索增强生成(RAG)框架,用于多跳问答任务。该框架采用双功能摘要模型,对全局问题和当前子问题的信息进行压缩。通过保持全局证据记忆和局部路径记忆,ReSP 减少了上下文过载,并消除了过度规划和重复规划的问题,在 HotpotQA 上实现了 4.1 的 F1 分数提升,在 2WikiMultihopQA 上实现了 5.9 的 F1 分数提升,达到当前最优性能。
Multi-hop question answering is a challenging task with distinct industrial relevance, and Retrieval-Augmented Generation (RAG) methods based on large language models (LLMs) have become a popular approach to tackle this task. Owing to the potential inability to retrieve all necessary information in a single iteration, a series of iterative RAG methods has been recently developed, showing significant performance improvements. However, existing methods still face two critical challenges: context overload resulting from multiple rounds of retrieval, and over-planning and repetitive planning due to the lack of a recorded retrieval trajectory. In this paper, we propose a novel iterative RAG method called ReSP, equipped with a dual-function summarizer. This summarizer compresses information from retrieved documents, targeting both the overarching question and the current sub-question concurrently. Experimental results on the multi-hop question-answering datasets HotpotQA and 2WikiMultihopQA demonstrate that our method significantly outperforms the state-of-the-art, and exhibits excellent robustness concerning context length.
研究动机与目标
- 解决因多轮检索中累积检索文档而导致的迭代 RAG 中的上下文过载问题。
- 通过记录结构化的检索轨迹,克服迭代多跳问答中的过度规划和重复规划问题。
- 通过将检索信息压缩为简洁、功能性的摘要,提升对上下文长度的鲁棒性。
- 通过将聚焦查询的摘要集成到迭代 RAG 流程中,提升多跳问答中的推理效率与准确性。
- 开发一种在长上下文长度下仍能保持高性能的方法,优于现有最先进方法。
提出的方法
- 在迭代 RAG 框架中集成基于大语言模型的双功能摘要模型,每轮检索生成两种摘要。
- 维护一个全局证据记忆,用于总结从检索文档中提取的、与整体问题相关支持事实。
- 维护一个局部路径记忆,用于总结与当前子问题相关的信息,以支持逐步推理。
- 在每轮迭代中,将全局与局部记忆的组合结果作为模型决策的上下文,以判断是否已收集足够信息。
- 通过阻止模型生成已检索过的子问题,强制执行停止条件,从而避免重复规划。
- 迭代地优化问题并检索新文档,直至组合记忆足以支持自信的答案生成。
实验结果
研究问题
- RQ1双功能摘要模型是否能减少在多跳问答任务中迭代 RAG 的上下文过载?
- RQ2保持记录的检索轨迹是否能改善决策并减少过度规划与重复规划?
- RQ3与现有 RAG 方法相比,ReSP 在上下文长度鲁棒性方面提升了多少?
- RQ4聚焦查询的摘要集成是否能带来多跳问答基准上的最先进性能?
- RQ5ReSP 在不同模型规模和检索设置(如每轮检索文档数量不同)下的表现如何?
主要发现
- 在 HotpotQA 基准上,ReSP 相较于之前的最先进方法,F1 分数绝对提升了 4.1。
- 在 2WikiMultihopQA 基准上,ReSP 相较于最强基线,F1 分数提升了 5.9 分,展现出强大的泛化能力。
- ReSP 在不同上下文长度下均保持一致的性能表现,即使每轮检索 15 份文档,其性能仍稳定,而标准 RAG 和 IRCoT 方法则显著下降。
- 该方法有效防止了过度规划:在案例研究中,ReSP 在第一轮检索后即正确停止,因识别出已有足够证据,而 IRCoT 则继续无意义地推进。
- ReSP 通过追踪并排除已检索过的子问题,避免了重复规划,如在某案例中,IRCoT 反复查询 'Rachelle Amy Beinart' 却无结果。
- 双摘要机制使模型能够维持稳定、简洁的上下文,减少噪声,提升多跳场景下的推理可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。