Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing Retrieval-Augmented Large Language Models with Iterative Retrieval-Generation Synergy

Zhihong Shao, Yeyun Gong|arXiv (Cornell University)|2023. 05. 24.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 복잡한 추론 작업에서 성능을 향상시키기 위해 대규모 언어 모델에서 검색과 생성을 상호보완적으로 번갈아가며 수행하는 방법인 반복적 검색-생성(Iterative Retrieval-Generation, I ter -R et G en )을 제안한다. 모델이 생성한 응답을 활용해 반복적으로 검색 쿼리를 개선함으로써 관련성 모델링을 향상시키고, 더 적은 검색 및 생성 오버헤드로 최신의 검색 증강 방법을 초월하여 다단계 QA 벤치마크에서 최대 8.6%p의 정확도 향상을 달성한다.

ABSTRACT

Large language models are powerful text processors and reasoners, but are still subject to limitations including outdated knowledge and hallucinations, which necessitates connecting them to the world. Retrieval-augmented large language models have raised extensive attention for grounding model generation on external knowledge. However, retrievers struggle to capture relevance, especially for queries with complex information needs. Recent work has proposed to improve relevance modeling by having large language models actively involved in retrieval, i.e., to improve retrieval with generation. In this paper, we show that strong performance can be achieved by a method we call Iter-RetGen, which synergizes retrieval and generation in an iterative manner. A model output shows what might be needed to finish a task, and thus provides an informative context for retrieving more relevant knowledge which in turn helps generate a better output in the next iteration. Compared with recent work which interleaves retrieval with generation when producing an output, Iter-RetGen processes all retrieved knowledge as a whole and largely preserves the flexibility in generation without structural constraints. We evaluate Iter-RetGen on multi-hop question answering, fact verification, and commonsense reasoning, and show that it can flexibly leverage parametric knowledge and non-parametric knowledge, and is superior to or competitive with state-of-the-art retrieval-augmented baselines while causing fewer overheads of retrieval and generation. We can further improve performance via generation-augmented retrieval adaptation.

연구 동기 및 목표

  • 검색 증강 LLM에서 한 번의 검색에 한계가 존재하는 문제를 해결하기 위해, 특히 복잡한 정보 요구 사항에 대해.
  • 기존의 번갈아가는 검색-생성 워크플로우의 구조적 제약과 높은 오버헤드를 극복하기 위해.
  • 모델이 생성한 응답을 동적 쿼리 컨텍스트로 활용해 반복적 검색을 위한 관련성 모델링을 향상시키기 위해.
  • LLM 내의 파rametric 지식과 non-parametric 지식 간 효과적인 상호보완성을 가능하게 하기 위해.
  • 재-ranking 애너테이션의 높은 비용을 줄이기 위해, 생성 증강 검색을 통해 밀도 기반 검색기를 적응시키기 위해.

제안 방법

  • I ter -R et G en 는 반복 루프 내에서 검색 증강 생성과 생성 증강 검색을 번갈아 수행한다.
  • 초기 검색은 작업 입력을 쿼리로 사용하며, 이후 검색은 모델이 생성한 응답을 개선된 쿼리로 사용한다.
  • 각 반복에서 확보된 지식은 모두 집계되어 다음 생성 단계에서 함께 사용되며, 생성의 유연성을 유지한다.
  • 생성 구조를 수정하지 않고도 체인 오브 타ught 예시를 활용한 소수의 프롬프팅을 지원한다.
  • 생성 증강 검색 적응은 재-ranking 기반 지식(모델 출력을 사용)을 밀도 기반 검색기(작업 입력만 사용)에 정제한다.
  • 해당 방법은 명시적인 재-ranking 또는 검색 관련성 애너테이션 없이 소수의 프롬프팅 설정에서 평가된다.

실험 결과

연구 질문

  • RQ1반복적 검색과 생성 간의 상호보완성이 한 번의 검색을 초월해 복잡한 추론 작업에서 성능 향상에 기여할 수 있는가?
  • RQ2모델이 생성한 응답을 동적 검색 쿼리로 사용할 경우 더 관련성이 높은 지식을 검색할 수 있는가?
  • RQ3다단계 번갈아가는 접근 방식과 비교해 검색 및 생성 오버헤드를 줄일 수 있는가?
  • RQ4파rametric 지식과 non-parametric 지식을 모두 활용할 경우 성능은 어떻게 향상되는가?
  • RQ5생성 증강 검색 적응을 통해 반복 횟수를 줄일 수 있는가?

주요 결과

  • I ter -R et G en 는 여섯 개의 다단계 QA 데이터셋 중 네 개에서 최신의 검색 증강 방법보다 최대 8.6%p의 정확도 향상을 달성한다.
  • 남은 두 개의 데이터셋에서도 경쟁력 있는 성능을 보이며 다양한 추론 작업 전반에 걸쳐 광범위한 효과를 입증한다.
  • 반복 횟수가 많을수록 성능 향상이 이루어지며, 대부분의 설정에서 두 번의 반복이 가장 큰 성과를 내는 것으로 나타났다.
  • 생성 증강 검색 적응은 성능 향상을 추가로 이끌어내며 반복 횟수를 줄여 오버헤드를 감소시킨다.
  • 정확도 측정 지표인 엄밀한 일치율은 LLM 성능을 심하게 과소평가할 수 있으나, LLM 기반 평가에서는 더 신뢰할 수 있는 성능 향상이 관찰된다.
  • 비파라미터식 지식이 정답을 명시적으로 포함하지 않더라도 I ter -R et G en 는 Self-Ask를 항상 능가하며, 파라미터식 지식과 비파라미터식 지식의 효과적인 융합을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.