Skip to main content
QUICK REVIEW

[論文レビュー] Towards Personalized and Semantic Retrieval: An End-to-End Solution for E-commerce Search via Embedding Learning

Han Zhang, Songlin Wang|arXiv (Cornell University)|Jun 3, 2020
Recommender Systems and Techniques参考文献 30被引用数 4
ひとこと要約

本稿では、学習された埋め込みを用いて意味的および個人化された検索を向上させる、エコマース検索向けのエンドツーエンドのディープラーニングベースのシステムDPSRを提案する。マルチヘッドクエリエンコーディング、アテンションベースの損失関数、およびユーザー固有の特徴を組み込んだ2タワーニューラルネットワークを採用することで、特にロングテールクエリにおいて検索の関連性が向上し、オンラインA/Bテストではコンversion rateが1.29%向上、ロングテールクエリで10.03%の改善が達成された。低レイテンシーであるため、スケールした生産環境へのデプロイに適している。

ABSTRACT

Nowadays e-commerce search has become an integral part of many people's shopping routines. Two critical challenges stay in today's e-commerce search: how to retrieve items that are semantically relevant but not exact matching to query terms, and how to retrieve items that are more personalized to different users for the same search query. In this paper, we present a novel approach called DPSR, which stands for Deep Personalized and Semantic Retrieval, to tackle this problem. Explicitly, we share our design decisions on how to architect a retrieval system so as to serve industry-scale traffic efficiently and how to train a model so as to learn query and item semantics accurately. Based on offline evaluations and online A/B test with live traffics, we show that DPSR model outperforms existing models, and DPSR system can retrieve more personalized and semantically relevant items to significantly improve users' search experience by +1.29% conversion rate, especially for long tail queries by +10.03%. As a result, our DPSR system has been successfully deployed into JD.com's search production since 2019.

研究の動機と目的

  • 従来のインverted indexベースの候補検索が意味的類似性やパーソナライズを捉えきれないという限界を是正する。
  • リアルタイムかつ低レイテンシーなインフラを備えた、スケーラブルで生産環境対応のディープラーニングシステムを設計する。
  • キーワードベースのシステムがしばしば無視するロングテールクエリの検索パフォーマンスを向上させる。
  • 手動で作成されたルールに依存せずに、ユーザー固有の特徴(例:性別、購買力)を検索プロセスに統合する。
  • オフライン評価およびライブトラフィックを用いたオンラインA/Bテストを通じて、提案モデルの有効性を検証する。

提案手法

  • クエリとアイテムを共通のベクトル空間に埋め込むことで意味的マッチングを実現する2タワーニューラルネットワークアーキテクチャを提案する。
  • ユーザーの意図の多様な側面を捉えるためにマルチヘッドクエリタワーを採用し、表現学習を強化する。
  • トレーニング中にハードネガティブサンプルを優先するアテンションベースの損失関数を導入し、モデルの一般化性能を向上させる。
  • ポジティブとネガティブサンプルのバランスを取るためにカスタマイズされたネガティブサンプリング戦略を採用し、トレーニングの安定性と有効性を向上させる。
  • 大規模な埋め込み学習に適した効率的なトレーニングアルゴリズムを実装し、分散データ並びにモデル並列処理を活用する。
  • 人間によるアノテーションの監視データを活用してモデルの予測を精緻化し、人間の関連性判断と一致させる。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースの検索システムは、従来のインverted index手法に比べ、エコマース検索における意味的関連性をより効果的に捉えることができるか?
  • RQ2ルールベースのヒューリスティクスに依存せずに、ユーザー固有のパーソナライズを検索パイプラインに効果的に統合する方法は何か?
  • RQ3提案されたモデルは、キーワードベースのシステムにとって困難なロングテールクエリの検索パフォーマンスをどの程度向上させるか?
  • RQ4実際の生産ワークロード下で、本システムのレイテンシーとスループット性能はどのようになるか?
  • RQ5コンversion rate やグロスマーチャンダイズバリュー(GMV)といった主要ビジネス指標において、モデルは一貫した改善を達成できるか?

主な発見

  • DPSRは、ライブトラフィックの10%を対象にオンラインA/Bテストでユーザーコンversion率(UCVR)を+1.29%向上させ、顕著なビジネスインパクトを示した。
  • グロスマーチャンダイズバリュー(GMV)は+2.19%向上し、クエリリライトレート(QRR)は4.29%低下し、ユーザー満足度の向上を示した。
  • ロングテールクエリでは、コンversion rateが+10.03%向上し、曖昧またはレアな検索語の処理における有効性が顕著に示された。
  • オフラインの人間による評価では、「悪い」関連性ケースが6%削減され、500件のロングテールクエリにおいて悪い結果の割合が17.86%から13.70%に低下した。
  • CPUでは10ms未満の検索レイテンシー、GPUでは1ms未満の検索レイテンシーを達成し、GPUでは14倍のQPS向上を実現した。これにより、リアルタイム処理の実現可能性が裏付けられた。
  • 2ヘッドクエリタワーとパーソナライズ版(1ヘッド-p13n)の両方が、ベーシックな1ヘッドモデルを上回る性能を示し、アーキテクチャの強化の価値を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。