Skip to main content
QUICK REVIEW

[논문 리뷰] Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative Approach

Zhouyu Jiang, Mengshu Sun|arXiv (Cornell University)|2024. 07. 18.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 다단계 질문 해결을 위한 새로운 반복적 검색 보강 생성(RAG) 프레임워크인 ReSP를 제안한다. 이 프레임워크는 전반적인 질문과 현재의 부분 질문 양쪽에 대해 정보를 압축하는 이중 기능 요약기 기반으로 작동한다. 전역 증거와 국소 경로 메모리를 유지함으로써 ReSP는 컨텍스트 과부하를 줄이고 과다 계획 수립 및 반복적 계획 수립을 제거하며, HotpotQA에서 4.1 F1 향상, 2WikiMultihopQA에서 5.9 F1 향상으로 최신 기준 성능을 달성한다.

ABSTRACT

Multi-hop question answering is a challenging task with distinct industrial relevance, and Retrieval-Augmented Generation (RAG) methods based on large language models (LLMs) have become a popular approach to tackle this task. Owing to the potential inability to retrieve all necessary information in a single iteration, a series of iterative RAG methods has been recently developed, showing significant performance improvements. However, existing methods still face two critical challenges: context overload resulting from multiple rounds of retrieval, and over-planning and repetitive planning due to the lack of a recorded retrieval trajectory. In this paper, we propose a novel iterative RAG method called ReSP, equipped with a dual-function summarizer. This summarizer compresses information from retrieved documents, targeting both the overarching question and the current sub-question concurrently. Experimental results on the multi-hop question-answering datasets HotpotQA and 2WikiMultihopQA demonstrate that our method significantly outperforms the state-of-the-art, and exhibits excellent robustness concerning context length.

연구 동기 및 목표

  • 다단계 검색 라운드 동안 축적되는 검색된 문서로 인한 반복적 RAG에서의 컨텍스트 과부하 문제를 해결한다.
  • 기록된 구조적 검색 경로를 통해 반복적 다단계 QA에서 과다 계획 수립 및 반복적 계획 수립 문제를 해결한다.
  • 검색된 정보를 간결하고 기능적인 요약으로 압축함으로써 컨텍스트 길이에 대한 강건성을 향상시킨다.
  • 반복적 RAG 파이프라인에 질문 중심 요약을 통합하여 다단계 질문 해결의 추론 효율성과 정확도를 향상시킨다.
  • 기존 최신 기준 접근 방식을 능가하는 성능을 유지를 하되, 긴 컨텍스트 길이 조건에서도 높은 성능을 유지할 수 있는 방법을 개발한다.

제안 방법

  • 반복적 RAG 프레임워크에 이중 기능 LLM 기반 요약기를 통합하여 각 검색 라운드당 두 가지 유형의 요약을 생성한다.
  • 전반적인 질문과 관련된 지원 증거를 검색된 문서에서 요약하는 전역 증거 메모리를 유지한다.
  • 현재 부분 질문과 관련된 정보를 요약하는 국소 경로 메모리를 유지한다.
  • 각 반복 단계에서 모델의 의사결정에 사용할 수 있도록 전역 및 국소 메모리의 조합을 컨텍스트로 활용하여 충분한 정보가 확보되었는지 평가한다.
  • 이미 검색된 부분 질문을 다시 생성하지 않도록 제어하여 반복적 계획 수립을 방지함으로써 정지 기준을 강제한다.
  • 질문을 반복적으로 개선하고 새로운 문서를 검색하여, 병합된 메모리가 확신 있는 답변 생성을 지원할 때까지 진행한다.

실험 결과

연구 질문

  • RQ1이중 기능 요약기는 다단계 질문 해결을 위한 반복적 RAG에서 컨텍스트 과부하를 줄일 수 있는가?
  • RQ2기록된 검색 경로를 유지함으로써 의사결정 능력 향상과 과다 계획 수립 및 반복적 계획 수립 감소에 기여하는가?
  • RQ3기존 RAG 방법과 비교했을 때 ReSP는 컨텍스트 길이에 대한 강건성에서 어느 정도 향상되는가?
  • RQ4질문 중심 요약의 통합이 다단계 QA 벤치마크에서 최신 기준 성능을 달성하는 데 기여하는가?
  • RQ5ReSP는 다양한 모델 크기와 검색 설정(예: 라운드당 검색 문서 수의 변동)에서 어떻게 성능을 발휘하는가?

주요 결과

  • ReSP는 HotpotQA 벤치마크에서 이전 최신 기준 대비 4.1 점의 절대 F1 점수 향상을 달성했다.
  • 2WikiMultihopQA 벤치마크에서는 가장 강력한 베이스라인 대비 F1 점수를 5.9 포인트 향상시켜 뛰어난 일반화 능력을 입증했다.
  • 15개의 문서를 라운드당 검색할 경우를 포함한 다양한 컨텍스트 길이에서도 ReSP는 일관된 성능을 유지하지만, 표준 RAG와 IRCoT는 성능이 크게 떨어진다.
  • 과다 계획 수립을 효과적으로 방지한다: 사례 연구에서 ReSP는 첫 번째 검색 라운드 후 충분한 증거를 인식하여 정확히 멈추지만, IRCoT는 불필요하게 계속 진행한다.
  • 이미 검색된 부분 질문을 추적하고 제외함으로써 반복적 계획 수립을 방지한다: IRCoT는 결과가 없음에도 불구하고 반복적으로 'Rachelle Amy Beinart'를 질의하는 사례에서 이를 입증했다.
  • 이중 요약 메커니즘이 모델이 안정적이고 간결한 컨텍스트를 유지하도록 하여 노이즈를 줄이고 다단계 시나리오에서 추론의 신뢰성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.