[論文レビュー] Dynamic Pricing on E-commerce Platform with Deep Reinforcement Learning: A Field Experiment
本稿では、eコマースプラットフォーム向けに、連続的価格行動と独創的な収益転換率の差分(DRCR)報酬関数を備えたマルコフ意思決定過程(MDP)として価格設定をモデル化した、深層強化学習(DRL)ベースの動的価格設定フレームワークを提案する。Tmall.comで数千のSKUを対象に実施した現地実験では、DRLが手動価格設定や従来の収益ベース報酬を上回り、DDPGとDQNはそれぞれ手動コントロール群比で6.07倍および5.03倍の高いDRCRを達成した。
In this paper we present an end-to-end framework for addressing the problem of dynamic pricing (DP) on E-commerce platform using methods based on deep reinforcement learning (DRL). By using four groups of different business data to represent the states of each time period, we model the dynamic pricing problem as a Markov Decision Process (MDP). Compared with the state-of-the-art DRL-based dynamic pricing algorithms, our approaches make the following three contributions. First, we extend the discrete set problem to the continuous price set. Second, instead of using revenue as the reward function directly, we define a new function named difference of revenue conversion rates (DRCR). Third, the cold-start problem of MDP is tackled by pre-training and evaluation using some carefully chosen historical sales data. Our approaches are evaluated by both offline evaluation method using real dataset of Alibaba Inc., and online field experiments starting from July 2018 with thousands of items, lasting for months on Tmall.com. To our knowledge, there is no other DP field experiment using DRL before. Field experiment results suggest that DRCR is a more appropriate reward function than revenue, which is widely used by current literature. Also, continuous price sets have better performance than discrete sets and our approaches significantly outperformed the manual pricing by operation experts.
研究の動機と目的
- 複雑で変動が激しい市場環境下で、大規模eコマースプラットフォームにおける数千のSKUに対するリアルタイム動的価格設定の課題に対処すること。
- 従来のDRL研究の限界を克服し、直接的な収益ではなく、新たな報酬関数(DRCR)と連続的価格セットを導入すること。
- 初期経験が限られている現実の製品データを用いたDRL訓練におけるコールドスタート問題を、履歴データを用いた事前学習と評価によって緩和すること。
- 価格差によるA/Bテストに法的制約がある状況下でも、価格方針の有効なオンライン評価メカニズムを構築すること。
- Tmall.comにおける大規模現地実験を通じて、DRLが実世界のeコマース環境で実際に有効であることを実証すること。
提案手法
- 価格設定をマルコフ意思決定過程(MDP)としてモデル化し、状態を在庫、需要、価格履歴、市場状況の4つのビジネス特徴群で定義する。
- 価格の離散的および連続的アクション空間を提案し、連続的な価格範囲におけるリアルタイム価格調整を可能にする。
- 収益の変動が凸でない動的特性をより適切に反映するため、収益転換率の差分(DRCR)を報酬関数として導入する。
- 初期経験が限られているDRL学習におけるコールドスタート問題を緩和するため、履歴販売データを用いた事前学習と評価パイプラインを実装する。
- 需要パターンが類似する「simi-products」(類似製品)を活用し、直接的なA/Bテストを伴わずに政策の比較が可能となる。
- DQNおよびDDPGアルゴリズムを用いて、安定性とパフォーマンスを最適化するハイパーパrameterチューニングを施した、エンドツーエンドの価格方針学習を実施する。
実験結果
リサーチクエスチョン
- RQ1深層強化学習は、変動が激しく、連続的価格調整が可能な実世界の大規模eコマース環境で、動的価格設定を効果的に最適化できるか?
- RQ2変動が激しい市場環境下で、直接的な収益よりも収益転換率の差分(DRCR)が、動的価格設定においてより効果的な報酬関数であるか?
- RQ3初期経験が限られている現実の製品データを用いたDRLベース価格設定のコールドスタート問題は、どのように緩和できるか?
- RQ4価格ベースのA/Bテストに法的制約がある状況下でも、価格方針の有効なオンライン評価メカニズムを構築できるか?
- RQ5DRLベースの動的価格設定は、長期的収益性および収益転換率の観点で、手動価格設定戦略を著しく上回るか?
主な発見
- DRCR報酬関数は直接的な収益を報酬信号とするのと比べて顕著に優れており、FMCG実験ではDRL方針が手動価格設定比で6.07倍の高いDRCRを達成した。
- 連続的価格セットは離散的セットよりも優れたパフォーマンスを示し、DRLモデルが市場動態にさらに正確に適応できた。
- 現地実験の結果、DRLベース価格設定(DQNおよびDDPG)は、マーケティング担当者による手動価格設定を、マーケティングセールおよび日常的FMCG価格設定の両シナリオで一貫して上回った。
- 事前学習と評価パイプラインは、履歴データからの安定した方針学習を可能にする形で、コールドスタート問題を効果的に緩和した。
- simi-productsの活用により、直接的なA/Bテストが不可能な状況下でも信頼性の高い政策評価が可能となり、提案された評価メカニズムの有効性が検証された。
- DQNおよびDDPGモデルは、プロモーションイベントなどの市場変動に対しても頑健であり、外部条件が変化しても高いパフォーマンスを維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。