Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Gross Merchandise Volume via DNN-MAB Dynamic Ranking Paradigm

Yan Yan, Wentao Guo|arXiv (Cornell University)|Aug 14, 2017
Advanced Bandit Algorithms ResearchDecision Sciences参考文献 21被引用数 17
ひとこと要約

本稿では、ユーザーの即時のフィードバック(クリックやコンversionsなど)を組み込むことで、ユーザーの意図との整合性を高め、JD.comでの本番環境での導入で売上高(GMV)を顕著に向上させる、動的順序付けフレームワークDNN-MABを提案する。DNN-MABは、ペairワイズの深層ニューラルネットワーク(DNN)プリランカーと、見直されたトマソンサンプリング多腕バンディット(MAB)ポストランカーを組み合わせたもので、売上高(GMV)を最適化することを目的としている。

ABSTRACT

With the transition from people's traditional `brick-and-mortar' shopping to online mobile shopping patterns in web 2.0 $\mathit{era}$, the recommender system plays a critical role in E-Commerce and E-Retails. This is especially true when designing this system for more than $\mathbf{236~million}$ daily active users. Ranking strategy, the key module of the recommender system, needs to be precise, accurate, and responsive for estimating customers' intents. We propose a dynamic ranking paradigm, named as DNN-MAB, that is composed of a pairwise deep neural network (DNN) $\mathit{pre}$-ranker connecting a revised multi-armed bandit (MAB) dynamic $\mathit{post}$-ranker. By taking into account of explicit and implicit user feedbacks such as impressions, clicks, conversions, etc. DNN-MAB is able to adjust DNN $\mathit{pre}$-ranking scores to assist customers locating items they are interested in most so that they can converge quickly and frequently. To the best of our knowledge, frameworks like DNN-MAB have not been discussed in the previous literature to either E-Commerce or machine learning audiences. In practice, DNN-MAB has been deployed to production and it easily outperforms against other state-of-the-art models by significantly lifting the gross merchandise volume (GMV) which is the objective metrics at JD.

研究の動機と目的

  • 静的順序付けの限界に対処すること。具体的には、ユーザーの意図やフィードバックが動的に統合されないEコマースレコメンデーションシステムにおける課題。
  • ユーザー行動に基づく順序付けの即時適応を可能にすることで、コンversionsレートと売上高(GMV)の向上を図ること。
  • 探索と活用のバランスを取る、スケーラブルで本番環境対応の動的順序付けフレームワークを設計すること。
  • 従来の学習-順序付け(learning-to-rank)およびMABモデルの欠陥を克服し、2段階の順序付けパイプラインにおいて深層学習と文脈付きバンディットを統合すること。
  • 2億3600万人以上のアクティブユーザーを擁する大規模Eコマース環境において、GMVやDCGといった実世界のパフォーマンス指標に焦点を当て、フレームワークの有効性を検証すること。

提案手法

  • フレームワークは、ユーザーおよびアイテムの特徴に基づいて、最初のアイテム関連スコアを生成するペアワイズDNNをプリランカーとして使用する。
  • 見直されたトマソンサンプリングアルゴリズムがポストランカーとして機能し、インプレッション、クリック、コンversionsといった即時のフィードバックを用いてプリランクスコアを動的に調整する。
  • MAB部は、本番環境での導入における収束速度の向上と初期の後悔の低減を図るための新規初期化戦略を採用している。
  • システムはユーザーのインタラクションをリアルタイムで処理し、オンライン学習とユーザー意図への継続的適応を可能にしている。
  • 2段階のアーキテクチャにより、静的関連性モデリング(DNN)と動的フィードバック適応(MAB)が分離されており、スケーラビリティと応答性が向上している。
  • フレームワークはJD.comで本番環境に導入されており、ユーザーのインタラクションから継続的に学習し、リアルタイムで順序付けを更新している。

実験結果

リサーチクエスチョン

  • RQ1Eコマースにおける動的順序付けを向上させるために、深層学習ベースのプリランカーと文脈付きバンディットポストランカーを効果的に統合する方法は何か?
  • RQ2クリックやコンversionsといった即時のフィードバックの統合が、静的モデルと比較してGMVおよび順序付け効果に与える影響は何か?
  • RQ3独自の初期化戦略を備えた見直されたトマソンサンプリングアルゴリズムは、本番規模のレコメンデーションシステムにおいて収束速度とパフォーマンスをどのように向上させるか?
  • RQ4ハイブリッドDNN-MABフレームワークは、スケーラビリティを維持しつつ、最先端のモデルを上回るGMVおよびDCG性能を達成できるか?
  • RQ5GMVの最適化と他のKPI(例:注文数)とのトレードオフは何か?また、動的順序付けにおいて多目的最適化をどのように扱えるか?

主な発見

  • DNN-MABフレームワークは本番環境でベースラインモデルを顕著に上回り、JD.comの主要ビジネス指標である売上高(GMV)に明確で顕著な増加をもたらした。
  • DCG(割引累積利得)の指標でも性能向上が確認され、順序付けの質とユーザー満足度の向上を示している。
  • 独自の初期化戦略を備えた見直されたトマソンサンプリングアルゴリズムにより、収束が早くなり、初期の後悔が低減され、ユーザーのフィードバックへの対応性が向上した。
  • 実世界の本番環境でも高い耐障害性を示し、2億3600万人以上のアクティブユーザーと毎日数十億件のインタラクションを処理できた。
  • GMVとDCGの向上にもかかわらず、一部の期間において注文数に一時的な悪影響が見られたため、多目的KPI最適化の必要性が示された。
  • DNNプリランクとMABポストランクの統合は、効果的かつスケーラブルであり、本番環境では顕著なスケーラビリティの問題は報告されていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。