Skip to main content
QUICK REVIEW

[논문 리뷰] Query2doc: Query Expansion with Large Language Models

Liang Wang, Nan Yang|arXiv (Cornell University)|2023. 03. 14.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 few-shot prompting을 사용하여 가짜 문서를 생성하고, 이를 원본 쿼리에 연결함으로써 스퍼스(BM25 등) 및 디ensa 검색 시스템의 성능을 향상시키는 쿼리 확장 방법 Query2doc을 제안한다. 이 방법은 모델 미세조정 없이 MS-MARCO 및 TREC DL 데이터셋에서 BM25 성능을 3%에서 15%까지 향상시키며, DPR, SimLM, E5와 같은 최신 디ensa 검색기에도 개선 효과를 보인다.

ABSTRACT

This paper introduces a simple yet effective query expansion approach, denoted as query2doc, to improve both sparse and dense retrieval systems. The proposed method first generates pseudo-documents by few-shot prompting large language models (LLMs), and then expands the query with generated pseudo-documents. LLMs are trained on web-scale text corpora and are adept at knowledge memorization. The pseudo-documents from LLMs often contain highly relevant information that can aid in query disambiguation and guide the retrievers. Experimental results demonstrate that query2doc boosts the performance of BM25 by 3% to 15% on ad-hoc IR datasets, such as MS-MARCO and TREC DL, without any model fine-tuning. Furthermore, our method also benefits state-of-the-art dense retrievers in terms of both in-domain and out-of-domain results.

연구 동기 및 목표

  • 짧고 스퍼스한 쿼리에서 발생하는 어휘 갭과 모호성으로 인한 검색 성능 저하 문제를 해결하기 위해.
  • 대규모 언어 모델이 미세조정 없이도 효과적인 쿼리 확장 엔진으로 기능할 수 있는지 탐색하기 위해.
  • LLM이 생성한 가짜 문서를 맥락 증강 수단으로 사용하여 스퍼스 및 디ensa 검색 시스템을 동시에 향상시키기 위해.
  • 메타-분석 설정 및 외부 도메인 환경을 포함한 도메인 내 및 도메인 외 설정에서의 성능을 평가하고, 제로샷 일반화 능력을 점검하기 위해.
  • LLM 규모와 프롬프트 설계가 검색 성능 및 사실적 일관성에 미치는 영향을 분석하기 위해.

제안 방법

  • 주어진 쿼리 q로부터 k=4개의 인라인 예시를 사용한 few-shot prompting을 통해 가짜 문서 d′를 생성한다.
  • 스퍼스 검색을 위한 경우, 원본 쿼리 q를 n=5번 반복한 후 d′와 연결하여 term 가중치를 균형 잡는다. 이로써 확장된 쿼리 q+ = concat({q}×5, d′)를 형성한다.
  • 디ensa 검색을 위한 경우, 확장된 쿼리 q+는 q, [SEP], 및 d′를 연결하여 형성되며, 즉 q+ = concat(q, [SEP], d′)이다.
  • 이 방법은 모델 학습과 상호 독립적이며, 아키텍처나 손실 함수의 변경이 필요 없어 기존 검색 파이프라인에 즉시 통합할 수 있다.
  • 가짜 문서는 향상된 GPT-3 text-davinci-003 모델을 사용해 생성되며, 이 방법은 MS-MARCO, TREC DL 2019/2020, 그리고 제로샷 OOD 데이터셋에서 평가된다.
  • 이 방법은 두 가지 디ensa 검색 설정에서 평가된다: BM25 하드 네거티브 샘플을 사용해 BERT-base에서 학습하는 것과, 크로스-엔코더 재랭커로부터 지식 distillation을 수행하는 것.

실험 결과

연구 질문

  • RQ1대규모 언어 모델의 few-shot prompting이 높은 품질의 가짜 문서를 생성하여 검색 성능을 향상시킬 수 있는가?
  • RQ2LLM이 생성한 콘텐츠를 통한 쿼리 확장이 모델 미세조정 없이도 스퍼스 및 디ensa 검색 시스템의 성능을 크게 향상시킬 수 있는가?
  • RQ3Query2doc의 성능는 도메인 내 및 도메인 외 검색 설정에서 어떻게 변화하는가?
  • RQ4LLM 규모가 Query2doc의 효과성, 특히 사실적 정확성과 검색 성능 향상 측면에서 어떤 영향을 미치는가?
  • RQ5기존의 쿼리 및 문서 확장 기법과 비교했을 때, 이 방법은 효율성과 효과성 측면에서 어떻게 다른가?

주요 결과

  • Query2doc는 MS-MARCO 및 TREC DL 데이터셋에서 오프더셰프 BM25 성능을 3%에서 15%까지 향상시키며, TREC DL 트랙의 어려운 쿼리에서 더 큰 향상 효과를 보였다.
  • DPR, SimLM, E5와 같은 최신 디ensa 검색기의 성능도 향상되었지만, 강력한 크로스-엔코더 재랭커로부터 지식을 추출할 경우 성능 향상 폭이 감소했다.
  • 대부분의 데이터셋에서 제로샷 외부 도메인 설정에서 강력한 베이스라인보다 Query2doc가 더 뛰어난 성능을 보이며 뛰어난 일반화 능력을 입증했다.
  • 이 방법은 가장 능력 있는 LLM을 사용할 때 가장 효과적이며, 더 작은 모델은 베이스라인 대비 거의 개선되지 않았다.
  • 높은 성능에도 불구하고, LLM이 생성한 가짜 문서에는 잘못된 날짜나 세부 정보와 같은 사실 오류가 간혹 포함되어 있어 시스템 신뢰성에 악영향을 줄 수 있다.
  • Query2doc는 지연 시간이 크게 증가한다: LLM 추론이 쿼리당 2000ms 이상 소요되며, 확장된 쿼리 길이로 인해 인덱스 검색 속도도 느려진다. 이는 정확도와 효율성 사이의 상충 관계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.