[論文レビュー] Large Language Model based Long-tail Query Rewriting in Taobao Search
本論文では、Taobao検索におけるロングテールクエリのリライトに大規模言語モデル(LLM)を活用する三段階フレームワーク\methodを提案する。多指示监督微調整、Taobaoのリtrievalシステムを用いたオフラインフィードバック、対照的学習を用いた目的整合性の向上を組み合わせたものである。本手法は検索品質を著しく向上させ、GMV、#Trans、UVを向上させ、特にロングテールおよび「何も結果がない」クエリにおいて顕著な効果を示した。オンラインA/Bテストでは、結果ゼロのクエリに対して取引量が18.66%増加した。
In the realm of e-commerce search, the significance of semantic matching cannot be overstated, as it directly impacts both user experience and company revenue. Along this line, query rewriting, serving as an important technique to bridge the semantic gaps inherent in the semantic matching process, has attached wide attention from the industry and academia. However, existing query rewriting methods often struggle to effectively optimize long-tail queries and alleviate the phenomenon of "few-recall" caused by semantic gap. In this paper, we present BEQUE, a comprehensive framework that Bridges the sEmantic gap for long-tail QUEries. In detail, BEQUE comprises three stages: multi-instruction supervised fine tuning (SFT), offline feedback, and objective alignment. We first construct a rewriting dataset based on rejection sampling and auxiliary tasks mixing to fine-tune our large language model (LLM) in a supervised fashion. Subsequently, with the well-trained LLM, we employ beam search to generate multiple candidate rewrites, and feed them into Taobao offline system to obtain the partial order. Leveraging the partial order of rewrites, we introduce a contrastive learning method to highlight the distinctions between rewrites, and align the model with the Taobao online objectives. Offline experiments prove the effectiveness of our method in bridging semantic gap. Online A/B tests reveal that our method can significantly boost gross merchandise volume (GMV), number of transaction (#Trans) and unique visitor (UV) for long-tail queries. BEQUE has been deployed on Taobao, one of most popular online shopping platforms in China, since October 2023.
研究の動機と目的
- eコマース検索における意味的ギャップ、特に結果が得られない(「何も結果がない」)クエリが多く発生するロングテールクエリの解消を目的とする。
- GMV、取引数、ヒットレートといった実世界のオンライン目的を考慮して、LLMが生成するリライトの質を向上させることを目的とする。
- タスク固有の微調整やフィードバック統合なしに、小規模モデルや一般的なLLMプロンプトに依存する従来手法の限界を克服することを目的とする。
- 検索性能を向上させつつ、現実の検索システムにおける関連性と制御可能性を維持する、スケーラブルでプロダクション環境対応のフレームワークを開発することを目的とする。
提案手法
- 品質分類、製品タイトル予測、思考の連鎖(chain-of-thought)といった補助タスクを用いて、リジェクションサンプリングを適用することで高品質なリライトデータセットを構築し、LLMの多指示监督微調整(SFT)を可能にする。
- 微調整済みLLMを用いてビームサーチを実行し、1クエリあたり複数の候補リライトを生成して下流の評価に備える。
- Taobaoのオフラインシステムを用いてオンライン検索をシミュレートし、関連性、インクリメント、ヒットレートの指標に基づく部分順序フィードバックを収集する。
- 対照的学習に基づく目的整合性モジュール(PRO)を適用し、リライト間の差異を強調し、モデル出力をTaobaoのオンライン最適化目標と整合させる。
- オフラインフィードバックと目的整合性を統合した一元的なトレーニングループを構築し、モデルの一般化性能と検索性能を向上させる。
- 2023年10月以降、最終モデルをTaobao検索にプロダクションデプロイし、オンラインA/Bテストにより実世界への影響を検証した。

実験結果
リサーチクエスチョン
- RQ1大規模言語モデルを、eコマース検索における意味的ギャップを埋めるロングテールクエリの高品質リライト生成に効果的に微調整できるか?
- RQ2実際のeコマースリtrievalシステムから得られるオフラインフィードバックを、LLMが生成するリライトとオンラインビジネス目標との整合性向上にどう活用できるか?
- RQ3関連性、インクリメント、ヒットレートといった異なる最適化目標が、実世界の設定におけるクエリリライトモデルのパフォーマンスに与える影響は何か?
- RQ4多指示微調整と補助タスク学習を組み合わせることで、レアでロングテールのクエリを理解しリライトする能力がどの程度向上するか?
主な発見
- オンラインA/Bテストでは、\methodが全クエリでGMVを0.40%、#Transを0.34%、UVを0.33%向上させ、システム全体にわたる改善を示した。
- リライトされたクエリ(全PVの27%)では、GMVが2.96%増加、#Transが1.36%増加、UVが1.22%増加し、ターゲット集団における優れたパフォーマンスを示した。
- 「何も結果がない」クエリでは、#Transが18.66%増加、UVが6.25%増加し、最も困難な意味的ギャップのケースに対しても効果的であることが実証された。
- インクリメント最適化を目的とした場合、関連性のわずかな低下を差し引いても、インクリメントとヒットレートの両方が著しく向上し、トレードオフの効率性が優れていることが示された。
- 対照的学習を用いた目的整合ステージは、リライト間の部分順序を効果的に捉え、ベースライン手法よりもビジネスKPIに向けた最適化をより良く行った。
- フレームワークは、先行するSOTAモデルCLE-QRをすべての主要指標で上回り、特にロングテールおよび結果ゼロのクエリの状況で最大の向上を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。