Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Pricing on E-commerce Platform with Deep Reinforcement Learning

Jiaxi Liu, Yidong Zhang|arXiv (Cornell University)|2018. 09. 27.
Consumer Market Behavior and Pricing인용 수 15
한 줄 요약

이 논문은 전자상거래 플랫폼를 위한 딥 강화학습(DRL) 기반의 동적 가격 설정 프레임워크를 제안한다. 가격 설정을 연속 행동 마르코프 결정 과정(MDP)으로 모델링하며, 사업 목표와 더 잘 부합하는 새로운 보상 함수인 수익 전환율의 차이(DRCR)를 도입하고, 냉시작 문제를 해결하기 위해 사전 훈련을 적용한다. 알리바바 플랫폼에서 실시한 오프라인 및 온라인 실험에서 수동 가격 설정 및 수익 기반 DRL 기준선보다 우수한 성능을 보이며, 연속적인 가격 설정이 더 뛰어난 성능을 보였다.

ABSTRACT

In this paper we present an end-to-end framework for addressing the problem of dynamic pricing on E-commerce platform using methods based on deep reinforcement learning (DRL). By using four groups of different business data to represent the states of each time period, we model the dynamic pricing problem as a Markov Decision Process (MDP). Compared with the state-of-the-art DRL-based dynamic pricing algorithms, our approaches make the following three contributions. First, we extend the discrete set problem to the continuous price set. Second, instead of using revenue as the reward function directly, we define a new function named difference of revenue conversion rates (DRCR). Third, the cold-start problem of MDP is tackled by pre-training and evaluation using some carefully chosen historical sales data. Our approaches are evaluated by both offline evaluation method using real dataset of Alibaba Inc., and online field experiments on this http URL, a major online shopping website owned by Alibaba Inc.. In particular, experiment results suggest that DRCR is a more appropriate reward function than revenue, which is widely used by current literature. In the end, field experiments, which last for months on 1000 stock keeping units (SKUs) of products demonstrate that continuous price sets have better performance than discrete sets and show that our approaches significantly outperformed the manual pricing by operation experts.

연구 동기 및 목표

  • 전자상거래 플랫폼의 동적 가격 설정에서 이산 가격 설정과 수익 기반 보상 함수의 한계를 해결하기 위해.
  • 역사적 판매 데이터 기반 사전 훈련을 통해 냉시작 시나리오에서 모델의 일반화 능력과 성능을 향상시키기 위해.
  • 더 유연하고 민감한 가격 결정을 가능하게 하는 연속 행동 DRL 프레임워크를 개발하기 위해.
  • 기존 수익 기반 보상과 비교하여 DRCR 보상 함수의 효과성을 실제 전자상거래 환경에서 평가하기 위해.

제안 방법

  • 비즈니스 데이터 4개 그룹을 상태 특성으로 사용하여 동적 가격 설정을 연속 행동 마르코프 결정 과정(MDP)으로 공식화한다.
  • 직접 수익 극대화보다 사업 목표와 더 잘 부합하는 새로운 보상 함수인 수익 전환율의 차이(DRCR)를 도입한다.
  • MDP 훈련의 냉시작 문제를 완화하기 위해 역사적 판매 데이터 기반 사전 훈련을 적용한다.
  • 딥 강화학습 알고리즘(예: DQN 또는 SAC 변종)을 사용하여 상태에서 행동(가격)으로의 정책 학습을 종단 간(end-to-end)으로 수행한다.
  • 실제 알리바바 데이터셋을 사용한 오프라인 평가와 1000개 SKU에 걸친 온라인 현장 실험을 통해 성능을 검증한다.
  • DRCR를 주 학습 신호로 사용하여 가격 정책을 최적화한다.

실험 결과

연구 질문

  • RQ1DRL 기반 동적 가격 설정에서 연속적 가격 설정을 사용할 경우, 실제 전자상거래 환경에서 이산적 가격 설정보다 더 뛰어난 성능을 내는가?
  • RQ2가격 정책 학습을 이끄는 데 있어 DRCR 보상 함수가 직접 수익 극대화보다 더 효과적인가?
  • RQ3역사적 데이터 기반 사전 훈련이 DRL 기반 동적 가격 설정 모델의 성능 향상과 수렴 속도 향상에 뚜렷한 영향을 미치는가?
  • RQ4실제 온라인 현장 실험에서 제안된 DRL 프레임워크는 운영 전문가가 수기로 설정한 가격보다 뛰어난가?

주요 결과

  • 오프라인 평가 결과, DRCR 보상 함수는 직접 수익 극대화보다 더 안정적이고 효과적인 정책 학습을 이끌었다.
  • 다양한 월 동안의 온라인 현장 실험 결과, 제안된 방법은 운영 전문가가 수기로 설정한 가격보다 1000개 SKU에서 유의미하게 뛰어난 성능을 보였다.
  • 성능 측면에서 연속적 가격 설정이 이산적 가격 설정보다 일관되게 뛰어나, 더 높은 유연성과 민감성의 가능성을 시사한다.
  • 사전 훈련은 냉시작 문제를 효과적으로 완화하여 초기 훈련 단계에서 더 빠른 수렴과 향상된 정책 품질을 가능하게 했다.
  • 실제 환경에서 핵심 비즈니스 지표인 전환율과 수익에 대해 측정 가능한 향상이 이루어졌다.
  • 연속 행동 공간과 DRCR 보상 함수의 조합은 대규모 전자상거래 플랫폼에 대해 더 견고하고 확장 가능한 동적 가격 설정 솔루션을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.