Skip to main content
QUICK REVIEW

[論文レビュー] AliExpress Learning-To-Rank: Maximizing Online Model Performance without Going Online

Guangda Huzhang, Zhen-Jia Pang|arXiv (Cornell University)|Mar 25, 2020
Optimization and Search Problems参考文献 41被引用数 5
ひとこと要約

本稿では、eコマースの学習ランキングシステムにおけるオフライン・オンライン性能の不一致を解消するため、エバリュエータ・ジェネレータ再順序付け(EG-Rerank)フレームワークを提案する。文脈に配慮したエバリュエータを訓練し、オンライン性能を予測させ、強化学習を用いてエバリュエータスコアを最適化するジェネレータを学習することで、実際のオンラインA/Bテストにおいて工業的ベースライン比でコンversions率が2.22%向上した。エバリュエータスコアは、従来のオフライン指標よりも実世界の性能とより一貫していることが示された。

ABSTRACT

Learning-to-rank (LTR) has become a key technology in E-commerce applications. Most existing LTR approaches follow a supervised learning paradigm from offline labeled data collected from the online system. However, it has been noticed that previous LTR models can have a good validation performance over offline validation data but have a poor online performance, and vice versa, which implies a possible large inconsistency between the offline and online evaluation. We investigate and confirm in this paper that such inconsistency exists and can have a significant impact on AliExpress Search. Reasons for the inconsistency include the ignorance of item context during the learning, and the offline data set is insufficient for learning the context. Therefore, this paper proposes an evaluator-generator framework for LTR with item context. The framework consists of an evaluator that generalizes to evaluate recommendations involving the context, and a generator that maximizes the evaluator score by reinforcement learning, and a discriminator that ensures the generalization of the evaluator. Extensive experiments in simulation environments and AliExpress Search online system show that, firstly, the classic data-based metrics on the offline dataset can show significant inconsistency with online performance, and can even be misleading. Secondly, the proposed evaluator score is significantly more consistent with the online performance than common ranking metrics. Finally, as the consequence, our method achieves a significant improvement ( extgreater$2\%$) in terms of Conversion Rate (CR) over the industrial-level fine-tuned model in online A/B tests.

研究の動機と目的

  • eコマースの学習ランキングモデルにおける、強いオフライン指標がオンライン性能に反映されないという、長年のオフライン・オンライン不一致を解消すること。
  • 実際のオンラインユーザー行動を反映する、信頼性の高いオフライン評価指標を構築すること、特にダミー効果などの文脈に依存する効果を捉えること。
  • 高価なオンラインA/Bテストを回避して、コンversions率などの実世界の目的関数を最適化する順序付けポリシーを設計すること。
  • 静的なオフラインデータに過剰適合しない、一般化可能なエバリュエータに従って誘導される強化学習による効果的な再順序付けを可能にすること。

提案手法

  • 文脈効果(例:ダミー効果)を捉えるために、オフラインデータ上で訓練されたエバリュエータモデルを導入し、順序付けられたアイテムリストが与えられたもとでのユーザー購入確率を予測する。
  • 強化学習を用いて訓練されたジェネレータモデルが、エバリュエータスコアを最大化するように最適化され、グリーディでない、創造的なアイテム順序付けを探索する。
  • ドミネーターを用いてエバリュエータの一般化性能を向上させ、オートコンフィデンススコアを提供することで、分布外の順序付けに対しても耐性を確保する。
  • エバリュエータスコアがオンライン性能の代理指標として機能し、オンラインデプロイメントなしでモデル選択やハイパーパrameterチューニングが可能になる。
  • ポリシー勾配法を用いてジェネレータを訓練し、報酬信号としてエバリュエータの出力を使用することで、複雑な順列空間の探索が可能になる。
  • シミュレーションおよびAliExpressにおける大規模なA/Bテストを通じてフレームワークを検証し、生産負荷下での遅延とパフォーランスを監視した。

実験結果

リサーチクエスチョン

  • RQ1標準的なオフライン順序付け指標(例:AUC、NDCG)は、eコマース順序付けにおいて、実際にオンラインで達成される性能とどの程度相関しているか?
  • RQ2学習されたエバリュエータモデルは、ダミー効果を含む文脈効果を伴う未観測のアイテム順序付けについて、オンライン性能を一般化して予測できるか?
  • RQ3エバリュエータに従って誘導される強化学習による再順序付けモデルは、教師ありベースラインと比較して、より良いオンラインコンversions率を達成できるか?
  • RQ4エバリュエータスコアは、高価なオンラインA/Bテストへの依存を減らすために、オンライン性能の信頼できる代理指標として機能できるか?

主な発見

  • AUCのような古典的オフライン指標は、実際のオンラインコンversions率と顕著な不一致を示しており、ある戦略はGAUCが最高であったが、コンversions率は8.45%も低かった。
  • 提案されたエバリュエータスコアは、従来の指標よりもオンラインコンversions率とはるかに強い相関を示し、より信頼できるオフライン評価の代理指標であることが判明した。
  • EG-Rerankは、長期間のA/Bテストにおいて工業的ベースライン(RankNet*)比でコンversions率が2.22%向上した(p値0.011)、統計的に有意な結果であった。
  • フレームワークは低遅延(平均115ms)を維持しており、ベースライン比でわずか9msの増加にとどまり、生産環境での実用的導入可能性を示した。
  • エバリュエータスコアは高い正確性でオンライン性能を予測しており、A/Bテストにおけるエバリュエータスコアと実際のコンversions率の乖離の一致が、その有効性を裏付けた。
  • EG-Rerank+はさらにコンversions率を0.63%向上させ、提案されたフレームワークの堅牢性とスケーラビリティを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。