Skip to main content
QUICK REVIEW

[论文解读] Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative Approach

Zhouyu Jiang, Mengshu Sun|arXiv (Cornell University)|Jul 18, 2024
Topic Modeling被引用 4
一句话总结

该论文提出 ReSP,一种新颖的迭代检索增强生成(RAG)框架,用于多跳问答任务。该框架采用双功能摘要模型,对全局问题和当前子问题的信息进行压缩。通过保持全局证据记忆和局部路径记忆,ReSP 减少了上下文过载,并消除了过度规划和重复规划的问题,在 HotpotQA 上实现了 4.1 的 F1 分数提升,在 2WikiMultihopQA 上实现了 5.9 的 F1 分数提升,达到当前最优性能。

ABSTRACT

Multi-hop question answering is a challenging task with distinct industrial relevance, and Retrieval-Augmented Generation (RAG) methods based on large language models (LLMs) have become a popular approach to tackle this task. Owing to the potential inability to retrieve all necessary information in a single iteration, a series of iterative RAG methods has been recently developed, showing significant performance improvements. However, existing methods still face two critical challenges: context overload resulting from multiple rounds of retrieval, and over-planning and repetitive planning due to the lack of a recorded retrieval trajectory. In this paper, we propose a novel iterative RAG method called ReSP, equipped with a dual-function summarizer. This summarizer compresses information from retrieved documents, targeting both the overarching question and the current sub-question concurrently. Experimental results on the multi-hop question-answering datasets HotpotQA and 2WikiMultihopQA demonstrate that our method significantly outperforms the state-of-the-art, and exhibits excellent robustness concerning context length.

研究动机与目标

  • 解决因多轮检索中累积检索文档而导致的迭代 RAG 中的上下文过载问题。
  • 通过记录结构化的检索轨迹,克服迭代多跳问答中的过度规划和重复规划问题。
  • 通过将检索信息压缩为简洁、功能性的摘要,提升对上下文长度的鲁棒性。
  • 通过将聚焦查询的摘要集成到迭代 RAG 流程中,提升多跳问答中的推理效率与准确性。
  • 开发一种在长上下文长度下仍能保持高性能的方法,优于现有最先进方法。

提出的方法

  • 在迭代 RAG 框架中集成基于大语言模型的双功能摘要模型,每轮检索生成两种摘要。
  • 维护一个全局证据记忆,用于总结从检索文档中提取的、与整体问题相关支持事实。
  • 维护一个局部路径记忆,用于总结与当前子问题相关的信息,以支持逐步推理。
  • 在每轮迭代中,将全局与局部记忆的组合结果作为模型决策的上下文,以判断是否已收集足够信息。
  • 通过阻止模型生成已检索过的子问题,强制执行停止条件,从而避免重复规划。
  • 迭代地优化问题并检索新文档,直至组合记忆足以支持自信的答案生成。

实验结果

研究问题

  • RQ1双功能摘要模型是否能减少在多跳问答任务中迭代 RAG 的上下文过载?
  • RQ2保持记录的检索轨迹是否能改善决策并减少过度规划与重复规划?
  • RQ3与现有 RAG 方法相比,ReSP 在上下文长度鲁棒性方面提升了多少?
  • RQ4聚焦查询的摘要集成是否能带来多跳问答基准上的最先进性能?
  • RQ5ReSP 在不同模型规模和检索设置(如每轮检索文档数量不同)下的表现如何?

主要发现

  • 在 HotpotQA 基准上,ReSP 相较于之前的最先进方法,F1 分数绝对提升了 4.1。
  • 在 2WikiMultihopQA 基准上,ReSP 相较于最强基线,F1 分数提升了 5.9 分,展现出强大的泛化能力。
  • ReSP 在不同上下文长度下均保持一致的性能表现,即使每轮检索 15 份文档,其性能仍稳定,而标准 RAG 和 IRCoT 方法则显著下降。
  • 该方法有效防止了过度规划:在案例研究中,ReSP 在第一轮检索后即正确停止,因识别出已有足够证据,而 IRCoT 则继续无意义地推进。
  • ReSP 通过追踪并排除已检索过的子问题,避免了重复规划,如在某案例中,IRCoT 反复查询 'Rachelle Amy Beinart' 却无结果。
  • 双摘要机制使模型能够维持稳定、简洁的上下文,减少噪声,提升多跳场景下的推理可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。