[논문 리뷰] Large Language Models Know Your Contextual Search Intent: A Prompting Framework for Conversational Search
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 활용하여 다수의 질의 재작성과 가설적 응답을 생성하고, 이를 종합하여 사용자 의도의 강력한 표현을 도출하는 프롬프팅 프레임워크인 LLM4CS를 제안한다. 이 방법은 CAsT-19, CAsT-20, CAsT-21 벤치마크에서 기존 방법과 인간의 재작성 결과를 초월하는 최신 기술 성능을 달성하며, 의도 이해 및 검색 효율성에서 뛰어난 성능을 보인다.
Precisely understanding users' contextual search intent has been an important challenge for conversational search. As conversational search sessions are much more diverse and long-tailed, existing methods trained on limited data still show unsatisfactory effectiveness and robustness to handle real conversational search scenarios. Recently, large language models (LLMs) have demonstrated amazing capabilities for text generation and conversation understanding. In this work, we present a simple yet effective prompting framework, called LLM4CS, to leverage LLMs as a text-based search intent interpreter to help conversational search. Under this framework, we explore three prompting methods to generate multiple query rewrites and hypothetical responses, and propose to aggregate them into an integrated representation that can robustly represent the user's real contextual search intent. Extensive automatic evaluations and human evaluations on three widely used conversational search benchmarks, including CAsT-19, CAsT-20, and CAsT-21, demonstrate the remarkable performance of our simple LLM4CS framework compared with existing methods and even using human rewrites. Our findings provide important evidence to better understand and leverage LLMs for conversational search.
연구 동기 및 목표
- 장기 꼬리형이며 다양한 대화형 검색 세션에서 사용자의 맥락적 검색 의도를 정확히 포착하는 데 도전한다.
- 대규모 언어 모델(LLMs)의 제로샷 추론 및 생성 능력을 활용하여 대화형 검색에서의 데이터 부족 문제를 해결한다.
- 가설적 응답 생성과 앙상블 통합을 통합하여 대화형 질의 재작성(CQR)의 강건성과 효율성을 향상시킨다.
- LLM이 복잡한 다단계 검색 의도를 이해하는 데 있어 전통적 모델과 심지어 인간의 재작성 결과를 초월할 수 있음을 보여준다.
제안 방법
- 프레임워크는 동일한 대화 맥락에서 다수의 질의 재작성과 더 긴 가설적 응답을 생성하기 위해 세 가지 맞춤형 프롬프팅 방법을 사용한다.
- 학습 가능한 통합 메커니즘을 통해 생성된 재작성 및 응답을 통합된 의도 중심 표현으로 통합한다.
- LLM의 강력한 맥락 이해 능력을 활용하여 대화 질의에서 흔히 발생하는 공호성 및 생략 문제를 해결한다.
- 이중 단계 프로세스를 적용한다: (1) LLM을 통한 다양한 의도 표현 생성, (2) 앙상블 통합을 통한 잘못되거나 노이즈가 있는 해석의 필터링.
- 표준 대화형 검색 벤치마크(CAsT-19, CAsT-20, CAsT-21)를 사용하여 자동 평가 및 인간 평가를 통한 평가를 수행한다.
- 통합 전략은 동일한 사용자 의도에 대한 다수의 타당한 해석을 조합함으로써 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1LLM은 다단계 대화에서 사용자의 맥락적 검색 의도를 효과적으로 이해하고 재구성할 수 있는가?
- RQ2질의 재작성 외에도 가설적 응답을 생성하는 것이 단순한 재작성만으로는 성능 향상에 기여하는가?
- RQ3다수의 LLM 생성 결과를 앙상블 통합함으로써 대화형 검색의 강건성과 성능을 향상시킬 수 있는가?
- RQ4LLM4CS 프레임워크는 인간이 애너테이션한 재작성 결과와 기존의 CQR/CDR 모델에 비해 의도 정확도와 검색 효율성에서 어떻게 비교되는가?
주요 결과
- LLM4CS는 CAsT-19, CAsT-20, CAsT-21에서 최신 기술 성능을 달성하였으며, 검색 효율성에서 기존 방법과 인간 재작성 결과를 모두 초월하였다.
- 인간 평가 결과, LLM4CS 재작성은 CAsT-19, CAsT-20, CAsT-21에서 각각 85.5%, 89.4%, 84.8%의 비율로 사용자 의도를 정확히 전달한 반면, T5QR는 각각 75.1%, 62.0%, 58.6%의 비율이었다.
- LLM4CS 재작성에서 핵심어 오류 비율은 3% 미만이었으며, T5QR는 약 10%였다는 점에서 명사 및 참조 처리 능력이 뛰어나다는 것을 입증했다.
- 가설적 응답의 포함이 성능 향상에 크게 기여하여, 타당한 답변을 모델링함으로써 의도 이해가 향상됨을 시사한다.
- 다수의 생성 결과를 통합함으로써 잘못된 해석을 효과적으로 필터링하고 타당한 해석은 강화함으로써 강건성이 향상됨을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.