Skip to main content
QUICK REVIEW

[논문 리뷰] Generator-Retriever-Generator Approach for Open-Domain Question Answering

Abdelrahman Abdallah, Adam Jatowt|arXiv (Cornell University)|2023. 07. 21.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 질문에 기반해 맥락적으로 관련된 문서를 생성하고 동시에 밀도 벡터 검색기를 통해 외부 문서를 검색하는 새로운 오픈도메인 질의응답 프레임워크인 Generator-Retriever-Generator (GRG)를 제안한다. 첫 번째 LLM은 질문에 기반해 합성된 맥락이 풍부한 문서를 생성하고, 동시에 밀도 벡터 기반 검색기를 통해 외부 문서를 검색한다. 두 번째 LLM은 생성된 문서와 검색된 문서를 통합하여 최종 답변을 생성하며, TriviaQA, Natural Questions (NQ), WebQ에서 최신 기준 성능을 달성하여 이전 방법보다 최대 +5.2점의 F1 점수 향상을 보였다.

ABSTRACT

Open-domain question answering (QA) tasks usually require the retrieval of relevant information from a large corpus to generate accurate answers. We propose a novel approach called Generator-Retriever-Generator (GRG) that combines document retrieval techniques with a large language model (LLM), by first prompting the model to generate contextual documents based on a given question. In parallel, a dual-encoder network retrieves documents that are relevant to the question from an external corpus. The generated and retrieved documents are then passed to the second LLM, which generates the final answer. By combining document retrieval and LLM generation, our approach addresses the challenges of open-domain QA, such as generating informative and contextually relevant answers. GRG outperforms the state-of-the-art generate-then-read and retrieve-then-read pipelines (GENREAD and RFiD) improving their performance by at least by +5.2, +4.2, and +1.6 on TriviaQA, NQ, and WebQ datasets, respectively. We provide code, datasets, and checkpoints at https://github.com/abdoelsayed2016/GRG.

연구 동기 및 목표

  • 기존 오픈도메인 QA 파이프라인의 한계, 예를 들어 노이즈가 많은 문서 조각과 질문-문서 간 얕은 상호작용을 해결하기 위해.
  • LLM이 생성한 맥락과 밀도 있는 파assage 검색을 통합하여 답변의 관련성과 정보량을 향상시키기 위해.
  • 고정된, 잠재적으로 관련 없는 문서 조각에 대한 의존도를 줄이기 위해 맥락에 맞게 맞춤형으로 생성된 문서를 제공하기 위해.
  • 생성된 문서와 검색된 문서를 함께 처리하여 질문-문서 간 복잡한 관계를 더 잘 포착할 수 있도록 모델의 능력을 향상시키기 위해.
  • 미래 연구를 위해 코드, 데이터셋, 모델 체크포인트를 포함한 재현 가능한 오픈소스 솔루션을 제공하기 위해.

제안 방법

  • GRG 프레임워크는 두 단계 프로세스를 사용한다: 첫 번째 단계에서 지시 프롬프트 튜닝된 LLM(예: InstructGPT)이 입력 질문을 바탕으로 합성된 맥락이 풍부한 문서를 생성한다.
  • 동시에 이중 인코더 기반의 밀도 있는 파assage 검색기(예: DPR 기반)가 의미적 유사도를 기반으로 외부 코퍼스에서 관련 문서를 검색한다.
  • 생성된 문서와 검색된 문서를 연결하여 두 번째 LLM에 입력으로 제공하고, 통합된 추론 과정을 통해 최종 답변을 생성한다.
  • 벡터 인덱스 기반 검색기(Vector Index Retriever)는 지식 커버리지와 정답 가능성 향상을 위해 효율적인 벡터 기반 검색 메커니즘으로 도입되었다.
  • 모델은 정답의 품질과 다양성을 균형 있게 유지하는 데 중점을 두고 엔드 투 엔드로 훈련되었으며, 특히 다중 사실 또는 모호한 질문을 다룰 수 있도록 설계되었다.
  • 모델은 TriviaQA, NQ, WebQ에서 평가되었으며, 구성 요소 기여도를 분석하기 위한 아블레이션 스터디가 수행되었다.
Figure 1: Simplified diagram illustrating the idea behind the Generator-Retriever-Generator approach.
Figure 1: Simplified diagram illustrating the idea behind the Generator-Retriever-Generator approach.

실험 결과

연구 질문

  • RQ1LLM이 생성한 맥락과 외부 문서 검색을 조합하면 오픈도메인 QA에서 정답 정확도가 향상되는가?
  • RQ2생성된 문서와 검색된 문서 간의 상호작용은 답변의 관련성과 정보량에 어떤 영향을 미치는가?
  • RQ3F1 점수와 정확히 일치하는 점수 측면에서 GRG 프레임워크는 기존의 generate-then-read 및 retrieve-then-read 파이프라인을 초월하는가?
  • RQ4문서 생성 품질과 검색 정밀도는 최종 답변 생성에 어떤 영향을 미치는가?
  • RQ5기존 모델과 비교해 GRG는 모호하거나 다중 사실 질문을 얼마나 잘 다루는가?

주요 결과

  • GRG는 TriviaQA에서 최고의 베이스라인(RFiD)보다 최소 +5.2점의 F1 점수 향상을 기록하여 최신 기준 성능을 달성했다.
  • Natural Questions (NQ) 데이터셋에서 GRG는 가장 강력한 이전 방법보다 F1 점수를 +4.2점 향상시켰다.
  • WebQ에서 GRG는 현재 최신 기준보다 +1.6 F1 점수 향상을 기록하여 다양한 벤치마크에서 일관된 성능 향상을 보였다.
  • 모델은 모호한 질문에 대해 여러 개의 정답을 생성한다. 예를 들어 마이클 잭슨의 자서전에 대해 'Moonwalk'과 'Moonwalk (disambiguation)'를 모두 식별하여 지식 커버리지가 향상된 것을 반영한다.
  • 아블레이션 스터디 결과, 문서 생성과 검색 모두 성능 향상에 기여하며, 두 요소를 함께 사용할 경우 최고의 성능을 기록함을 확인했다.
  • 모델은 미묘한 질문에도 강건하게 대응하여 제이미 린 커티스의 성별(Scorpio)을 정확히 식별하여 골드 표준과 일치함을 보였다.
Figure 2: Architecture diagram illustrating the Generator-Retriever-Generator (GRG) approach, which combines document retrieval techniques and large language models to generate contextual documents and retrieve relevant information for answering questions.
Figure 2: Architecture diagram illustrating the Generator-Retriever-Generator (GRG) approach, which combines document retrieval techniques and large language models to generate contextual documents and retrieve relevant information for answering questions.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.