[논문 리뷰] Large Language Model based Long-tail Query Rewriting in Taobao Search
이 논문은 타오바오 검색에서 장꼬리(query) 재작성에 대규모 언어 모델(Large Language Models, LLMs)을 활용하는 세 단계 프레임워크인 \\_method를 제안한다. 이는 다중 지시 사전 훈련, 타오바오의 검색 시스템을 통한 오프라인 피드백, 그리고 대조 학습을 통한 목표 일치를 조합한다. 이 방법은 검색 품질을 크게 향상시키며, 특히 장꼬리 및 '결과 없음' 쿼리에 대해 GMV, #Trans, UV를 증가시킨다. 온라인 A/B 테스트에서 결과 없음 쿼리의 거래량이 18.66% 증가하였다.
In the realm of e-commerce search, the significance of semantic matching cannot be overstated, as it directly impacts both user experience and company revenue. Along this line, query rewriting, serving as an important technique to bridge the semantic gaps inherent in the semantic matching process, has attached wide attention from the industry and academia. However, existing query rewriting methods often struggle to effectively optimize long-tail queries and alleviate the phenomenon of "few-recall" caused by semantic gap. In this paper, we present BEQUE, a comprehensive framework that Bridges the sEmantic gap for long-tail QUEries. In detail, BEQUE comprises three stages: multi-instruction supervised fine tuning (SFT), offline feedback, and objective alignment. We first construct a rewriting dataset based on rejection sampling and auxiliary tasks mixing to fine-tune our large language model (LLM) in a supervised fashion. Subsequently, with the well-trained LLM, we employ beam search to generate multiple candidate rewrites, and feed them into Taobao offline system to obtain the partial order. Leveraging the partial order of rewrites, we introduce a contrastive learning method to highlight the distinctions between rewrites, and align the model with the Taobao online objectives. Offline experiments prove the effectiveness of our method in bridging semantic gap. Online A/B tests reveal that our method can significantly boost gross merchandise volume (GMV), number of transaction (#Trans) and unique visitor (UV) for long-tail queries. BEQUE has been deployed on Taobao, one of most popular online shopping platforms in China, since October 2023.
연구 동기 및 목표
- 장꼬리 쿼리가 자주 결과 없음('결과 없음' 쿼리)을 반환하는 전자상거래 검색에서의 의미적 갭을 해소하기 위해.
- 실제 온라인 목표인 GMV, 거래 건수, 히트레이트 등을 고려하여 LLM이 생성한 재작성 결과의 품질을 향상시키기 위해.
- 작은 모델에 의존하거나 작업에 특화된 훈련 없이 일반적인 LLM 프롬프팅에 의존하는 이전 방법의 한계를 극복하기 위해.
- 확장 가능하고 프로덕션 환경에 적합한 프레임워크를 개발하여, 실제 검색 시스템에서의 관련성과 제어 가능성을 유지하면서 검색 성능을 향상시키기 위해.
제안 방법
- 품질 분류, 제품 제목 예측, 사고 체인 등 보조 작업을 활용하고 기각 샘플링을 통해 고품질의 재작성 데이터셋을 구축하여, LLM의 다중 지시 사전 훈련(SFT)을 가능하게 한다.
- 사전 훈련된 LLM을 사용해 빔 서치를 적용하여 각 쿼리에 대해 다수의 후보 재작성 결과를 생성한다.
- 타오바오의 오프라인 시스템을 활용해 온라인 검색을 시뮬레이션하고, 관련성, 증가율, 히트레이트 지표 기반의 부분 순서 피드백을 수집한다.
- 대조 학습 기반의 목표 일치 모듈(PRO)을 적용하여 재작성 결과 간의 차이를 강조하고, 모델 출력을 타오바오의 온라인 최적화 목표와 일치시킨다.
- 오프라인 피드백과 목표 일치를 통합된 훈련 루프에 통합하여 모델의 일반화 능력과 검색 성능을 향상시킨다.
- 2023년 10월 이래로 타오바오 검색에서 최종 모델을 프로덕션에 배포하였으며, 온라인 A/B 테스트를 통해 실제 영향을 검증하였다.

실험 결과
연구 질문
- RQ1장꼬리 쿼리의 의미적 갭을 메우는 데 효과적으로 활용될 수 있는 대규모 언어 모델이 장꼬리 쿼리에 대해 고품질의 재작성 결과를 생성하도록 사전 훈련될 수 있는가?
- RQ2실제 전자상거래 검색 시스템의 오프라인 피드백을 어떻게 활용하여 LLM이 생성한 재작성 결과를 온라인 비즈니스 목표와 더 잘 일치시킬 수 있는가?
- RQ3실제 환경에서의 쿼리 재작성 모델 성능에 대해 관련성, 증가율, 히트레이트 등의 다양한 최적화 목표가 어떤 영향을 미치는가?
- RQ4다중 지시 훈련과 보조 작업 학습이 희귀한 장꼬리 쿼리를 이해하고 재작성하는 데 모델의 능력을 얼마나 향상시킬 수 있는가?
주요 결과
- 온라인 A/B 테스트 결과, \method는 전체 쿼리에서 GMV를 0.40%, #Trans를 0.34%, UV를 0.33% 증가시켜 전체 시스템 수준의 개선을 입증하였다.
- 재작성된 쿼리(전체 PV의 27%)에 대해서는 GMV가 2.96% 증가하고, #Trans는 1.36%, UV는 1.22% 증가하여 타겟 사용자 집단에서 뛰어난 성능을 보였다.
- '결과 없음' 쿼리에 대해선 #Trans가 18.66% 증가하고 UV가 6.25% 증가하여 가장 도전적인 의미 갭 사례를 해결하는 데 효과적임을 입증하였다.
- 증가율을 최적화 목표로 삼았을 때, 관련성의 약간의 감소를 감수하면서도 증가율과 히트레이트가 모두 크게 향상되어 강력한 트레이드오프 효율성을 보였다.
- 대조 학습 기반의 목표 일치 단계는 재작성 결과 간의 부분 순서를 효과적으로 포착하여, 기준 모델 대비 비즈니스 KPI 향상에 더 나은 최적화를 가능케 하였다.
- 기존 최고 성능 모델인 CLE-QR보다 모든 핵심 지표에서 뛰어난 성능을 보였으며, 특히 장꼬리 및 결과 없음 쿼리 상황에서 가장 큰 향상을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.