Skip to main content
QUICK REVIEW

[논문 리뷰] An online learning approach to dynamic pricing and capacity sizing in service systems

Xinyun Chen, Yunan Liu|arXiv (Cornell University)|2020. 09. 07.
Advanced Bandit Algorithms Research참고 문헌 24인용 수 5
한 줄 요약

이 논문은 중복된 가용성 근사치 없이 GI/GI/1 서비스 시스템에서의 동적 가격 설정과 능력 규모 설정을 위한 기울기 기반 온라인 학습 프레임워크인 GOLiQ를 제안한다. 도착 수, 대기 시간, 서버 복잡도 시간 등의 실시간 데이터를 사용해 반복적으로 가격 설정 및 인력 배치 정책을 업데이트함으로써 GOLiQ는 로그 수준의 회귀를 달성하여 최적의 수익으로의 빠른 수렴을 보장하면서 다양한 시스템 규모에서 성능을 유지한다.

ABSTRACT

We study a dynamic pricing and capacity sizing problem in a $GI/GI/1$ queue, where the service provider's objective is to obtain the optimal service fee $p$ and service capacity $μ$ so as to maximize the cumulative expected profit (the service revenue minus the staffing cost and delay penalty). Due to the complex nature of the queueing dynamics, such a problem has no analytic solution so that previous research often resorts to heavy-traffic analysis where both the arrival rate and service rate are sent to infinity. In this work we propose an online learning framework designed for solving this problem which does not require the system's scale to increase. Our framework is dubbed Gradient-based Online Learning in Queue (GOLiQ). GOLiQ organizes the time horizon into successive operational cycles and prescribes an efficient procedure to obtain improved pricing and staffing policies in each cycle using data collected in previous cycles. Data here include the number of customer arrivals, waiting times, and the server's busy times. The ingenuity of this approach lies in its online nature, which allows the service provider do better by interacting with the environment. Effectiveness of GOLiQ is substantiated by (i) theoretical results including the algorithm convergence and regret analysis (with a logarithmic regret bound), and (ii) engineering confirmation via simulation experiments of a variety of representative $GI/GI/1$ queues.

연구 동기 및 목표

  • 복잡한 큐잉 역학으로 인해 해석적 해법이 구현 불가능한 GI/GI/1 큐에서 동적 가격 설정과 인력 배치 최적화 문제를 해결하기 위해.
  • 중복된 가용성 근사치에 의존하지 않는 스케일링 가능하고 비점근적 방법을 개발하여 소규모 시스템에서 정확도가 저하되는 문제를 해결하기 위해.
  • 관측 가능한 데이터만을 사용하여 환경과의 실시간 상호작용을 통해 서비스 제공자가 최적의 가격 설정 및 능력 정책을 학습할 수 있도록 하기 위해.
  • 일반적인 서비스 및 도착 분포 하에서 제안된 온라인 학습 알고리즘의 이론적 수렴성과 회귀 한계를 확립하기 위해.
  • 다양한 대표적인 GI/GI/1 큐잉 시스템에서의 시뮬레이션 실험을 통해 프레임워크의 타당성을 검증하기 위해.

제안 방법

  • 시스템은 연속적인 운영 사이클을 거치며, 각 사이클의 시작 시 이전 데이터를 기반으로 가격 설정 및 인력 배치 결정을 업데이트한다.
  • 이전 사이클의 관측 데이터인 고객 도착 수, 대기 시간, 서버 복잡도 시간을 사용하여 기울기 추정치 $ H_{k-1} $ 를 구성한다.
  • 감소하는 단계 크기 $ \eta_k $ 를 사용하여 $ (\mu_k, p_k) \leftarrow (\mu_{k-1}, p_{k-1}) + \eta_{k-1} H_{k-1} $ 를 통해 결정을 업데이트한다.
  • 이 프레임워크는 온라인 볼록 최적화에 기반하며, 약한 분포 가정 하에서 수렴성과 회귀에 대한 이론적 보장을 제공한다.
  • 기울기 추정의 편향을 줄이기 위해 온난업 단계를 도입하며, 사이클 길이 $ D_k $ 는 $ \lceil 4\log(k)/\min(\theta,\gamma) \rceil $ 로 선택된다.
  • 회귀는 최적 정책 대비 누적 손실로 분석되며, 매끄럽고 꼬리가 가벼운 조건 하에서 로그 수준의 회귀 한계가 증명된다.

실험 결과

연구 질문

  • RQ1중복된 가용성 근사치에 의존하지 않고 GI/GI/1 큐에서 온라인 학습 프레임워크가 near-optimal 가격 설정 및 인력 배치 결정을 달성할 수 있는가?
  • RQ2이러한 프레임워크는 얼마나 빨리 최적 정책으로 수렴할 수 있으며, 이론적 회귀 한계는 무엇인가?
  • RQ3중복된 가용성 근사치가 실패하는 소규모 시스템을 포함한 다양한 시스템 규모에서 알고리즘이 성능을 유지할 수 있는가?
  • RQ4효과적인 정책 학습을 위해 필요한 데이터 입력은 무엇이며, 실시간 큐잉 관측치로부터 기울기를 어떻게 정확하게 추정할 수 있는가?
  • RQ5단계 크기와 온난업 기간의 선택은 수렴성과 회귀 성능에 어떤 영향을 미치는가?

주요 결과

  • GOLiQ는 로그 수준의 회귀 한계를 달성하여 최적 정책 대비 누적 손실이 시간이 지남에 따라 느리게 증가함을 의미하며, 이는 빠른 학습을 보장한다.
  • 사이클 수가 증가함에 따라 알고리즘은 거의 확실하게 최적의 가격 설정 및 인력 배치 정책 $ (\mu^*, p^*) $ 로 수렴한다.
  • 요구 조건이 충족될 경우, 회귀 한계는 $ O(\log L) $ 로, $ L $ 은 사이클 수를 의미한다.
  • 중복된 가용성 근사치가 정확도가 떨어지는 소규모 시스템을 포함하여 다양한 시스템 규모에서 프레임워크가 강건함을 입증한다.
  • 시뮬레이션 결과는 일반적인 도착 간격 및 서비스 시간 분포를 가진 다양한 대표적인 GI/GI/1 큐에서 GOLiQ의 효과성을 확인한다.
  • 모델 가정 하에서 기울기 추정치 $ H_k $ 는 일관성 있고 편향이 없음을 입증되어 신뢰할 수 있는 정책 업데이트를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.