Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Pricing on E-commerce Platform with Deep Reinforcement Learning

Jiaxi Liu, Yidong Zhang|arXiv (Cornell University)|Sep 27, 2018
Consumer Market Behavior and Pricing被引用数 15
ひとこと要約

本論文は、eコマース向けに、価格設定を連続的アクションを持つマルコフ決定過程(MDP)としてモデル化する、深層強化学習(DRL)に基づく動的価格設定フレームワークを提案する。差益転換率(DRCR)という新規の報酬関数を導入し、コールドスタート問題を解消するための事前学習を実施することで、アリババのプラットフォーム上で実施したオフラインおよびオンライン実験において、手動価格設定および収益ベースのDRLベースラインを上回る性能を発揮した。連続的価格セットは特に優れた性能を示した。

ABSTRACT

In this paper we present an end-to-end framework for addressing the problem of dynamic pricing on E-commerce platform using methods based on deep reinforcement learning (DRL). By using four groups of different business data to represent the states of each time period, we model the dynamic pricing problem as a Markov Decision Process (MDP). Compared with the state-of-the-art DRL-based dynamic pricing algorithms, our approaches make the following three contributions. First, we extend the discrete set problem to the continuous price set. Second, instead of using revenue as the reward function directly, we define a new function named difference of revenue conversion rates (DRCR). Third, the cold-start problem of MDP is tackled by pre-training and evaluation using some carefully chosen historical sales data. Our approaches are evaluated by both offline evaluation method using real dataset of Alibaba Inc., and online field experiments on this http URL, a major online shopping website owned by Alibaba Inc.. In particular, experiment results suggest that DRCR is a more appropriate reward function than revenue, which is widely used by current literature. In the end, field experiments, which last for months on 1000 stock keeping units (SKUs) of products demonstrate that continuous price sets have better performance than discrete sets and show that our approaches significantly outperformed the manual pricing by operation experts.

研究の動機と目的

  • eコマースプラットフォームにおける動的価格設定において、離散的価格設定と収益ベースの報酬関数の限界を克服すること。
  • 歴史的販売データを用いた事前学習により、コールドスタート状況におけるモデルの汎化性能と性能を向上させること。
  • より柔軟で迅速な価格決定を可能にする連続的アクションDRLフレームワークの開発。
  • 実世界のeコマース環境において、従来の収益ベースの報酬と比較してDRCR報酬関数の有効性を評価すること。

提案手法

  • ビジネスデータの4つのグループを状態特徴量として用い、動的価格設定を連続的アクションを持つマルコフ決定過程(MDP)として定式化する。
  • 直接的な収益最大化よりもビジネス目標と整合性の高い、新規の報酬関数「差益転換率(DRCR)」を導入する。
  • MDP学習におけるコールドスタート問題を軽減するため、歴史的販売データを用いた事前学習を実施する。
  • 深層強化学習アルゴリズム(例:DQNやSACの変種)を用い、状態からアクション(価格)へとエンドツーエンドで価格戦略を学習する。
  • 実際のアリババデータセットを用いたオフライン評価と、1000 SKUにわたるオンライン現実実験を通じて性能を検証する。
  • DRCRを主な学習信号として用い、深層Qネットワークやアクタクリティック法を用いて価格戦略を最適化する。

実験結果

リサーチクエスチョン

  • RQ1DRLに基づく動的価格設定において、連続的価格セットを用いることで、実際のeコマース環境において離散的価格セットよりも優れた性能が得られるか?
  • RQ2DRCR報酬関数は、直接的な収益最大化よりも価格戦略学習の誘導に有効であるか?
  • RQ3歴史的データを用いた事前学習は、DRLに基づく動的価格設定モデルの性能と収束性を顕著に向上させることができるか?
  • RQ4本研究で提案するDRLフレームワークは、実世界のオンライン現実実験において、運用専門家による手動価格設定と比較して優れているか?

主な発見

  • オフライン評価では、DRCR報酬関数が直接的な収益最大化よりも、より安定的かつ効果的な政策学習を実現していることが示された。
  • 複数か月にわたるオンライン現実実験の結果、1000 SKUにおいて、本手法は運用専門家による手動価格設定を顕著に上回った。
  • 性能面において、連続的価格セットは常に離散的価格セットを上回った。これは、より高い柔軟性と迅速応答性を示している。
  • 事前学習によりコールドスタート問題が効果的に軽減され、初期学習段階での収束が早まり、政策品質が向上した。
  • 実世界の条件下で、転換率や収益といった重要なビジネス指標に顕著な改善が見られた。
  • 連続的アクション空間とDRCR報酬関数の組み合わせにより、大規模eコマースプラットフォーム向けに、より強固でスケーラブルな動的価格設定ソリューションが実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。