Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models are Strong Zero-Shot Retriever

Tao Shen, Guodong Long|arXiv (Cornell University)|2023. 04. 27.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 영역 내 후보 답변을 포함한 쿼리 보강을 통해 검색 성능을 크게 향상시키는 제로샷 검색 방법인 LameR를 제안한다. 이는 미세조정된 검색기 없이도 성능을 향상시킨다. LLM 기반 쿼리 보강과 비모수적 BM25 검색기를 조합함으로써 LameR는 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 제로샷 및 피처샷 기반 베이스라인을 모두 능가한다.

ABSTRACT

In this work, we propose a simple method that applies a large language model (LLM) to large-scale retrieval in zero-shot scenarios. Our method, the Language language model as Retriever (LameR), is built upon no other neural models but an LLM, while breaking brute-force combinations of retrievers with LLMs and lifting the performance of zero-shot retrieval to be very competitive on benchmark datasets. Essentially, we propose to augment a query with its potential answers by prompting LLMs with a composition of the query and the query's in-domain candidates. The candidates, regardless of correct or wrong, are obtained by a vanilla retrieval procedure on the target collection. As a part of the prompts, they are likely to help LLM generate more precise answers by pattern imitation or candidate summarization. Even if all the candidates are wrong, the prompts at least make LLM aware of in-collection patterns and genres. Moreover, due to the low performance of a self-supervised retriever, the LLM-based query augmentation becomes less effective as the retriever bottlenecks the whole pipeline. Therefore, we propose to leverage a non-parametric lexicon-based method (e.g., BM25) as the retrieval module to capture query-document overlap in a literal fashion. As such, LameR makes the retrieval procedure transparent to the LLM, thus circumventing the performance bottleneck.

연구 동기 및 목표

  • 약한 자기지도 기반 검색기로 인해 발생하는 제로샷 검색의 성능 저하 문제를 해결하기 위해.
  • 영역 내 애너테이션된 쿼리-문서 쌍이 필요하지 않은 강력한 제로샷 검색을 가능하게 하기 위해.
  • 영역 내 후보 문서를 컨텍스트로 포함시켜 LLM 기반 쿼리 보강을 향상시키기 위해.
  • 비모수적 검색기인 BM25가 LLM 기반 쿼리 보강과 결합될 경우, 학습된 검색기보다 우수한 성능을 낼 수 있음을 보여주기 위해.
  • 모델 전용 임베딩 병목 현상을 피하는 투명한 종단 간 언어 모델 기반 검색 파이프라인을 구축하기 위해.

제안 방법

  • BM25를 통해 검색된 상위 후보 문장을 쿼리에 보강하여, 쿼리와 그 후보 답변을 포함한 프롬프트를 구성한다.
  • 패턴 모방과 요약 기법을 활용해 LLM이 쿼리 및 후보 컨텍스트를 바탕으로 개선되거나 새로운 답변을 생성하도록 한다.
  • LLM의 출력을 쿼리 보강으로 간주하고, 두 번째 단계 검색에서 원본 쿼리를 대체한다.
  • 성능 저하 요인을 피하기 위해, 자기지도 기반 검색기 대신 비모수적이고 어휘 기반의 검색기(BM25)를 사용한다.
  • 잠재 공간 불일치를 방지하기 위해, 보강된 쿼리와 문서 간의 직접적인 어휘 일치에 의존하여 투명성을 확보한다.
  • 종단 간 적용: BM25 검색 → LLM 기반 쿼리 보강 → 두 번째 단계 BM25 검색
Figure 1: nDCG@10 on DL19 for query augmentation w/ LLMs.
Figure 1: nDCG@10 on DL19 for query augmentation w/ LLMs.

실험 결과

연구 질문

  • RQ1LLM이 영역 내 후보 답변을 컨텍스트로 제공받을 경우, 제로샷 검색 성능을 크게 향상시킬 수 있는가?
  • RQ2LLM 기반 쿼리 보강과 함께 사용될 때, 자기지도 기반 검색기를 비모수적 BM25 검색기로 대체하면 전체 검색 파이프라인의 성능이 향상되는가?
  • RQ3효율성과 효과성 측면에서 LameR은 기존의 제로샷 및 피처샷 검색 방법과 비교해 어떻게 성과를 내는가?
  • RQ4영역 내 미세조정이나 레이블 데이터 없이도 LLM 기반 쿼리 보강이 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5LLM 기반 쿼리 보강의 효과성이 BM25 및 밀도 기반 검색기와 같은 다양한 검색 백본에서 일관되게 유지되는가?

주요 결과

  • LameR는 TREC DL19에서 69.1 nDCG@10, DL20에서 64.8 nDCG@10을 기록하여 모든 제로샷 경쟁자보다 뛰어나며, DL20에서 최고의 완전히 감독된 검색기(E5 base)를 초월한다.
  • SimLM 밀도 기반 검색기를 사용할 경우, LameR는 DL19에서 76.5 nDCG@10, DL20에서 75.8 nDCG@10을 기록하여 기준 검색기 대비 각각 +5.1 및 +6.1 향상되었다.
  • LameR는 BM25를 +18.5 nDCG@10(DL19) 및 +16.8 nDCG@10(DL20) 향상시키며, 희소한 샘플을 사용하는 HyDE 및 Q2D와 비교해도 뛰어난 성능을 보였다.
  • LameR는 BM25 및 Contriever, SimLM과 같은 밀도 기반 검색기 등 다양한 검색 백본에서 일관된 성능 향상을 보이며, 검색 모델 선택에 대해 강건함을 입증했다.
  • LameR는 밀도 기반 검색기와 함께 사용할 경우 HyDE보다 검색 지연 시간과 인덱스 크기를 줄였으며, 이는 BM25의 효율성 덕분이지만 더 높은 효과성을 달성했다.
  • 후보 품질에 대해 강건함을 보였다: 잘못된 후보가 포함되어도 LLM은 영역 내 패턴을 활용해 답변 품질과 관련성을 향상시켰다.
Figure 2: HyDE improving Dense and Term-based Retrieval.
Figure 2: HyDE improving Dense and Term-based Retrieval.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.