[논문 리뷰] Thompson Sampling for Dynamic Pricing
이 논문은 전자상거래에서 동적 가격 설정을 위한 톰슨 샘플링(TS)을 제안하며, 수익을 향상시키기 위해 수동 학습 대신 능동적 탐색을 도입한다. 사후 분포에서 수요 모델 파라미터를 샘플링하고 매일 가격을 최적화함으로써, Max-Rev-TS 알고리즘은 통계적으로 유의미한 수익 증가를 달성한다—특히 충분히 큰 비율의 품목에 적용할 경우에 특히 그렇다. 이는 실전에서 능동적 동적 가격 설정을 처음으로 구현한 사례이다.
In this paper we apply active learning algorithms for dynamic pricing in a prominent e-commerce website. Dynamic pricing involves changing the price of items on a regular basis, and uses the feedback from the pricing decisions to update prices of the items. Most popular approaches to dynamic pricing use a passive learning approach, where the algorithm uses historical data to learn various parameters of the pricing problem, and uses the updated parameters to generate a new set of prices. We show that one can use active learning algorithms such as Thompson sampling to more efficiently learn the underlying parameters in a pricing problem. We apply our algorithms to a real e-commerce system and show that the algorithms indeed improve revenue compared to pricing algorithms that use passive learning.
연구 동기 및 목표
- 역사적 데이터를 사용하지만 능동적 탐색 없이 사용하는 수동 학습의 한계를 해결하기 위해.
- 탐색과 이용의 균형을 통해 장기 수익을 향상시키는 동적 가격 설정을 위한 능동적 학습 알고리즘을 개발하고 구현하기 위해.
- 톰슨 샘플링이 실전 전자상거래 시스템에서의 타당성과 효과성을 입증하기 위해.
- 능동적으로 학습된 품목 수와 전체 품목 수의 비율(신호 대 잡음 비율)이 성능에 미치는 영향을 조사하기 위해.
- 실전 환경에서 측정 가능한 수익 결과를 바탕으로, 능동 학습(Max-Rev-TS)을 기존의 수동 학습(Max-Rev-Passive)과 비교하기 위해.
제안 방법
- 가격의 함수로 수요를 매개수적 함수로 모델링하며, 알려진 기능 형태(예: 로그-선형)를 가정하고 미지의 파라미터를 가진다.
- 베이즈의 정리에 의해 닫힌 형태의 사후 분포 갱신이 가능하도록, 수요 모델 파라미터에 대해 공액 사전 분포를 사용한다.
- 각 시간 단계에서 현재 사후 분포에서 모델 파라미터의 집합을 샘플링하여 불확실성을 표현한다.
- 샘플된 파라미터를 사용해 수익 함수를 최적화하여 다음 테스트할 가격을 결정한다.
- 새로운 가격을 적용하고 그에 따른 수요를 관측한 후, 관측된 데이터를 사용해 사후 분포를 갱신한다.
- 유한한 시간 범위 동안 이 과정을 반복하며, 알고리즘이 자연스럽게 불확실한 영역(탐색)과 높은 보상 영역(이용)을 균형 잡는다.
실험 결과
연구 질문
- RQ1톰슨 샘플링은 대규모 전자상거래 시스템에서 실전 동적 가격 설정에 효과적으로 적용될 수 있는가?
- RQ2톰슨 샘플링을 통한 능동적 학습은 수동 학습 대비 장기 수익 성능에서 어떻게 비교되는가?
- RQ3신호 대 잡음 비율(즉, TS로 업데이트된 품목의 비율)은 능동적 동적 가격 설정의 성능에 어떤 영향을 미치는가?
- RQ4왜 Max-Rev-TS는 생산 환경에서 다양한 제품 카트에 대해 일관되지 않은 성능을 보이는가?
- RQ5어떤 조건에서 능동적 학습이 수동 학습 대비 통계적으로 유의미한 수익 향상으로 이어지는가?
주요 결과
- Max-Rev-TS는 $β_2$ 카트에서 항목당 수익에 통계적으로 유의미한 향상을 달성했으며, 10일 필터 기준 p-value는 $3.13 \times 10^{-7}$이고, 평균 수익 증가액은 항목당 1.649였다.
- $β_1$ 카트에서는 수익 감소가 관찰되었지만, 통계적으로 유의미하지 않았다(p-value = 0.00099, 20일 필터 기준), 이는 잡음 또는 낮은 신호 대 잡음 비율 때문일 가능성이 있다.
- 신호 대 잡음 비율은 $|\mathcal{B}_{TS}| / |\mathcal{B}_{\textsc{Max-Rev}}|$로 측정되었으며, $β_1$의 경우 0.004, $β_2$의 경우 0.1이었고, 이는 성능 격차를 설명한다.
- TS로 업데이트된 품목 비율이 낮을 경우(예: $β_1$에서 0.4%), TS 업데이트는 너무 노이즈가 많아 신뢰할 수 있는 향상 결과를 도출하지 못했다.
- 조금이라도 성능 향상이 있었더라도, 전체 Max-Rev 솔버는 $β_{TS}$의 성과 향상과 다른 품목 간의 트레이드오프를 고려할 수 있어, 시스템 수준에서의 향상가시성이 가려질 수 있었다.
- 본 연구는 톰슨 샘플링을 사용한 실전 동적 가격 설정의 첫 번째 실전 구현을 입증했으며, 신호 대 잡음 비율이 충분히 높을 경우 측정 가능한 성과 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.