[논문 리뷰] Enhancing Conversational Search: Large Language Model-Aided Informative Query Rewriting
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 활용해 대화형 검색에서 정보성 있고 맥락이 풍부한 쿼리 재작성(rewrites)을 생성함으로써, 인간이 재작성한 쿼리보다 검색 성능을 향상시키는 방법을 제안한다. 명령형 튜닝된 LLM을 설계하여 명확성, 정보성, 중복 회피, 의미 충실도라는 네 가지 핵심 성질을 갖춘 잘 구성된 재작성 결과를 생성하고, LLM 편집기를 활용한 '재작성-수정' 워크플로우를 도입함으로써, 특히 희소 검색기에서 뛰어난 성능을 달성한다. 또한, 정제 기법을 통해 효율적인 추론을 가능하게 한다.
Query rewriting plays a vital role in enhancing conversational search by transforming context-dependent user queries into standalone forms. Existing approaches primarily leverage human-rewritten queries as labels to train query rewriting models. However, human rewrites may lack sufficient information for optimal retrieval performance. To overcome this limitation, we propose utilizing large language models (LLMs) as query rewriters, enabling the generation of informative query rewrites through well-designed instructions. We define four essential properties for well-formed rewrites and incorporate all of them into the instruction. In addition, we introduce the role of rewrite editors for LLMs when initial query rewrites are available, forming a "rewrite-then-edit" process. Furthermore, we propose distilling the rewriting capabilities of LLMs into smaller models to reduce rewriting latency. Our experimental evaluation on the QReCC dataset demonstrates that informative query rewrites can yield substantially improved retrieval performance compared to human rewrites, especially with sparse retrievers.
연구 동기 및 목표
- 대화형 검색에서 인간이 재작성한 쿼리의 한계를 해결하기 위해, 최적의 검색을 위한 충분한 맥락과 정보성이 결여된 쿼리의 문제를 해결한다.
- 훈련용 쿼리 재작성 모델을 위한 스케일러블하고 고품질의 대안으로 대규모 언어 모델(LLMs)을 탐색한다.
- 잘 구성된 쿼리 재작성에 필수적인 네 가지 성질—명확성, 정보성, 중복 회피, 의미 충실도—를 정의하고 이를 강제 적용한다.
- LLM이 동시에 재작성자이자 편집자로 기능하는 '재작성-수정' 프레임워크를 제안한다.
- LLM이 생성한 재작성 결과를 작은, 효율적인 모델로 정제하여 저지연 추론을 가능하게 하되 성능을 손상시키지 않는다.
제안 방법
- 명확성, 정보성, 중복 회피, 의미 충실도라는 네 가지 핵심 성질을 포함한 종합적인 지시 프롬프트를 설계하여, zero-shot LLM 쿼리 재작성에 활용한다.
- 고품질 재작성 결과를 유도하기 위해 예시 기반 few-shot 프롬프팅 전략을 구현한다.
- LLM이 초기 재작성 결과를 소형 모델이나 다른 LLM으로부터 받고 이를 개선하는 두 단계의 '재작성-수정' 프로세스를 도입한다.
- LLM이 생성한 재작성 결과를 지도 학습 레이블로 사용하여, 대규모 LLM의 재작성 능력을 더 작은, 빠른 모델로 정제한다.
- 검색 성능 향상을 평가하기 위해 QReCC 데이터셋에서 희소 및 밀도 기반 검색 모델을 모두 활용해 실험을 수행한다.

실험 결과
연구 질문
- RQ1LLM이 생성한 쿼리 재작성 결과가 인간이 재작성한 쿼리보다 검색 효과성에서 뛰어나게 되는가? 특히 희소 검색 환경에서 그렇다면?
- RQ2대화형 검색 맥락에서 잘 구성된 쿼리 재작성에 있어 어떤 특정 성질이 정보성과 관련이 있는가?
- RQ3'재작성-수정' 프레임워크가 직접 프롬프팅 대비 LLM이 생성한 재작성 결과의 품질 향상에 얼마나 효과적인가?
- RQ4LLM의 추론 및 재작성 능력을 성능을 유지하면서 얼마나 작은 모델로 정제할 수 있는가?
- RQ5지시형 튜닝된 LLM을 사용할 경우, 기존 인간이 재작성한 쿼리 대비 검색 성능 향상이 뚜렷하게 이루어지는가?
주요 결과
- LLM이 생성한 정보성 있는 쿼리 재작성 결과는 인간이 재작성한 쿼리보다 검색 효과성에서 뚜렷이 뛰어나며, 특히 희소 검색기에서 두드러진다.
- '재작성-수정' 접근 방식은 LLM이 초기 출력을 개선함으로써 더 정확하고 맥락에 부합하는 정보성 있는 쿼리를 생성할 수 있도록 한다.
- 네 가지 핵심 재작성 성질를 통합한 지시형 튜닝된 LLM을 사용할 경우, 인간이 재작성한 결과보다 더 정보성 있고 모호성이 적은 재작성 결과를 도출할 수 있다.
- LLM이 생성한 재작성 결과를 소형 모델로 정제함으로써 대부분의 성능 향상을 유지하면서도 추론 지연을 줄일 수 있다.
- QReCC 데이터셋에서 LLM 기반 재작성은 Recall@10 및 평균 역수 순위(Mean Reciprocal Rank, MRR)와 같은 검색 지표에서 상당한 향상을 이룬다. 특히 희소 검색 환경에서 두드러진다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.