Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Armed Bandit Strategies for Non-Stationary Reward Distributions and Delayed Feedback Processes

Larkin Liu, Richard Downe|arXiv (Cornell University)|2019. 02. 22.
Advanced Bandit Algorithms Research참고 문헌 11인용 수 8
한 줄 요약

이 논문은 지연된 피드백이 있는 비정상적인 보상 분포에 특화된 새로운 베이지안 다중 손잡이 슬롯머신 전략인 AG1을 제안한다. 이전 시간 창의 파rameter 추정치를 유지하고 활용함으로써 AG1은 시뮬레이션된 온라인 도시락 재고 최적화 시나리오에서 에psilon-그리디, 쿠르브, 톰슨 샘플링보다 누적 손해를 더 효과적으로 줄인다.

ABSTRACT

A survey is performed of various Multi-Armed Bandit (MAB) strategies in order to examine their performance in circumstances exhibiting non-stationary stochastic reward functions in conjunction with delayed feedback. We run several MAB simulations to simulate an online eCommerce platform for grocery pick up, optimizing for product availability. In this work, we evaluate several popular MAB strategies, such as $ε$-greedy, UCB1, and Thompson Sampling. We compare the respective performances of each MAB strategy in the context of regret minimization. We run the analysis in the scenario where the reward function is non-stationary. Furthermore, the process experiences delayed feedback, where the reward function is not immediately responsive to the arm played. We devise a new adaptive technique (AG1) tailored for non-stationary reward functions in the delayed feedback scenario. The results of the simulation show show superior performance in the context of regret minimization compared to traditional MAB strategies.

연구 동기 및 목표

  • 비정상적인 보상 분포와 지연된 피드백 조건에서 표준 MAB 전략—에psilon-그리디, UCB1, 톰슨 샘플링—의 성능을 평가하기 위해.
  • 보상 피드백이 지연되고 보상 분포가 시간에 따라 변화하는 온라인 도시락 콜렉션 서비스에서 제품 가용성을 최적화하는 실무적 과제를 해결하기 위해.
  • 이전 관측치의 역사적 파라미터 추정치를 활용하여 비정상적인 환경과 지연된 피드백에 적응할 수 있도록 새로운 베이지안 MAB 전략(AG1)을 설계하고 검증하기 위해.
  • sinusoidal 보상 함수를 사용한 K=2 및 K=10 손잡이 시뮬레이션에서 AG1이 기존 전략보다 유의미하게 낮은 누적 손해를 기록함을 입증하기 위해.
  • 실제 이커머스 애플리케이션에 관련된 동적이고 피드백 지연이 있는 MAB 설정에서 메모리 기반의 베이지안 적응 전략의 우수성을 경험적으로 제시하기 위해.

제안 방법

  • AG1은 이전 시간 창에서의 사후 파라미터 추정치를 유지함으로써 각 에포크에서 다시 추정을 시작하지 않도록 베이지안 프레임워크를 활용한다.
  • 최근의 사후 평균 추정치를 기반으로 한 탐욕적 정책을 사용하여 보상의 제도 변화에 신속하게 적응한다.
  • 비정상적인 보상 함수의 경우, AG1은 시간 창 간에 이전 관측치의 기억을 유지함으로써 리스타트 기반 전략의 성능 저하를 방지한다.
  • 손잡이들은 다양한 앙상블 예측 알고리즘을 나타내고, 메트릭은 수거 시점의 품목 가용성(필링 레이트)인 시뮬레이션된 온라인 도시락 플랫폼에서 방법을 평가한다.
  • 손해는 시간에 따라 최적의 기대 보상과 실제 보상 간의 누적 차이로 계산되며, AG1은 지속적인 파라미터 추정을 통해 이 값을 최소화한다.
  • 시뮬레이션은 예측 알고리즘의 시간에 따라 변화하는 성능을 모델링하기 위해 삼각함수 형태의 보상 함수를 사용하며, 실제 데이터 지연을 반영하기 위해 피드백 지연을 도입한다.

실험 결과

연구 질문

  • RQ1지연된 피드백이 있는 비정상적인 보상 분포 조건에서 표준 MAB 전략(에psilon-그리디, UCB1, 톰슨 샘플링)의 성능은 어떠한가?
  • RQ2역사적 파라미터 추정치를 유지하는 베이지안 MAB 전략은 비정상적이고 피드백 지연이 있는 환경에서 리스타트 기반 전략보다 뛰어나게 성능을 내는가?
  • RQ3지연된 피드백은 동적 보상 설정에서 기존 MAB 알고리즘의 손해 성능에 어떤 영향을 미치는가?
  • RQ4손잡이 수가 2에서 10으로 증가할 때 AG1 전략은 에psilon-그리디와 톰슨 샘플링에 비해 누적 손해와 보상 측면에서 어떻게 비교되는가?
  • RQ5AG1의 파라미터 메모리는 각 시간 창에서 추정치를 리셋하는 전략에 비해 손해를 얼마나 줄이는가?

주요 결과

  • 삼각함수 보상이 있는 K=2 손잡이 시뮬레이션에서 AG1은 누적 손해 2.784를 기록하여 에psilon-그리디의 6.881보다 유의미하게 낮았다.
  • K=10 손잡이의 경우 AG1는 누적 손해 2.558을 기록하여 에psilon*-그리디(7.121)와 TS*(6.241)를 모두 능가했으며, 더 높은 손잡이 수에서도 뛰어난 성능을 보였다.
  • AG1의 성능 우월성은 시간 창 간에 이전 파라미터 추정치를 유지함으로써 발생하며, 재추정 지연 없이 제도 변화에 더 빠르게 적응할 수 있도록 한다.
  • 톰슨 샘플링은 정상적인 설정에서는 뛰어난 성능를 보였지만, 비정상적인 경우와 지연된 피드백 조건에서는 성능이 열 劣했다. 이는 과도하게 보수적인 탐색 때문일 가능성이 높다.
  • UCB1은 비정상적인 시나리오에서 빈약한 성능을 보였는데, 이는 지연된 피드백이 탐색을 너무 강하게 억제하여 최적의 손잡이 선택을 하지 못했기 때문일 수 있다.
  • 결과는 AG1와 같은 메모리 기반의 베이지안 전략이 리스타트 기반 또는 순수한 빈도주의 접근보다 비정상적이고 피드백 지연이 있는 환경에 더 적합하다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.