Skip to main content
QUICK REVIEW

[논문 리뷰] Bandit problems with Levy payoff processes

Asaf Cohen, Eilon Solan|ArXiv.org|2009. 06. 04.
Stochastic processes and financial applications인용 수 9
한 줄 요약

이 논문은 연속 시간에서 두 개의 팔을 가진 Lévy 밴딧 문제를 연구한다. 한 팔은 일정한 보상(고정 수익)을 주며, 다른 팔은 Lévy 과정에 의해 결정되는 확률적 보상(브라운 운동과 점프를 포함)을 제공한다. 정규성 조건 하에서 최적 전략은 유일한 컷오프 규칙이다: 후행 belief가 높은 유형의 위험 팔에 대해 임계값을 초과할 동안 실험을 계속하고, 그 이하로 떨어지면 안정된 팔로 전환한다. 이 논문은 비선형 상미분방정식 시스템의 해를 이용해 컷오프 지점과 최적 보상에 대한 명시적 공식을 유도한다.

ABSTRACT

We study two-armed Levy bandits in continuous-time, which have one safe arm that yields a constant payoff s, and one risky arm that can be either of type High or Low; both types yield stochastic payoffs generated by a Levy process. The expectation of the Levy process when the arm is High is greater than s, and lower than s if the arm is Low. The decision maker (DM) has to choose, at any given time t, the fraction of resource to be allocated to each arm over the time interval [t,t+dt). We show that under proper conditions on the Levy processes, there is a unique optimal strategy, which is a cut-off strategy, and we provide an explicit formula for the cut-off and the optimal payoff, as a function of the data of the problem. We also examine the case where the DM has incorrect prior over the type of the risky arm, and we calculate the expected payoff gained by a DM who plays the optimal strategy that corresponds to the incorrect prior. In addition, we study two applications of the results: (a) we show how to price information in two-armed Levy bandit problem, and (b) we investigate who fares better in two-armed bandit problems: an optimist who assigns to High a probability higher than the true probability, or a pessimist who assigns to High a probability lower than the true probability.

연구 동기 및 목표

  • Lévy 과정을 보상 생성자로 사용하여 불확실성 하에서의 동적 의사결정 모델링.
  • 두 개의 팔 밴딧 문제에서 Lévy 보상이 존재할 때 최적 전략이 컷오프 전략이 되는 조건 설정.
  • 모델 매개변수에 대한 함수로서 최적 컷오프 지점과 기대 보상에 대한 명시적 공식 유도.
  • 결정자가 위험 팔의 유형에 대해 잘못된 믿음을 가질 경우 기대 보상에 미치는 영향 분석.
  • 결과를 정보 가격 설정에 적용하고, 밴딧 설정에서 낙관론자와 비관론자의 성능 비교.

제안 방법

  • 안정된 팔(일정한 보상 s)과 위험 팔(두 가지 가능한 유형: 고유형 또는 저유형)을 가진 연속 시간 최적 제어 문제로 밴딧 문제 모델링.
  • 관측된 Lévy 과정 경로를 기반으로 위험 팔이 고유형일 가능성에 대한 후행 확률을 추적하기 위해 베이지안 업데이트 사용.
  • 최적 기대 보상에 대한 동적 프rogramming 방정식을 설정하여, 가치 함수와 후행 믿음을 포함하는 비선형 상미분방정식 시스템 유도.
  • 상미분방정식 시스템을 풀어 모델 매개변수(s, g1, g2, g1', g2', 등)에 대한 최적 컷오프 지점 p*의 명시적 표현 유도.
  • 최적 전략을 임계값 규칙으로 특성화: 믿음 > p*이면 계속 탐색, 그렇지 않으면 안정 팔로 전환.
  • 해를 이용해 잘못된 사전 확률 하에서의 기대 보상 계산 및 낙관론자 대비 비관론자 성능 비교.

실험 결과

연구 질문

  • RQ1연속 시간 Lévy 과정 보상이 존재하는 두 개의 팔 Lévy 밴딧 문제에서 유일한 최적 컷오프 전략이 존재하는 조건은 무엇인가?
  • RQ2모델 매개변수에 대한 함수로서 최적 컷오프 지점과 해당 최적 기대 보상의 명시적 공식은 무엇인가?
  • RQ3결정자가 위험 팔의 유형에 대해 잘못된 사전 확률을 사용할 경우 기대 보상은 어떻게 변화하는가?
  • RQ4최적 전략의 가치를 기반으로 이 두 개의 팔 Lévy 밴딧 프레임워크에서 정보를 어떻게 가격 설정할 수 있는가?
  • RQ5최적 전략 하에서 낙관론자(고유형 확률을 과대평가) 또는 비관론자(저유형 확률을 과소평가) 중 누가 더 높은 기대 보상을 달성하는가?

주요 결과

  • 최적 전략은 고유형 위험 팔에 대한 후행 믿음이 임계값 p*를 초과할 동안 실험을 계속하고, 믿음이 p* 이하로 떨어지면 안정 팔로 전환하는 고유한 컷오프 전략이다.
  • 컷오프 지점 p*는 Lévy 과정의 평균 이동 및 점프 특성과 안정 팔의 보상 s를 포함하는 비선형 방정식의 해로서 명시적으로 유도된다.
  • 최적 기대 보상은 초기 믿음 p0, 컷오프 p*, Lévy 과정 및 안정 팔의 매개변수에 의존하는 닫힌 형식의 표현식으로 주어진다.
  • 결정자가 잘못된 사전 확률을 사용할 경우 기대 보상은 정확한 사전 확률을 사용할 때보다 엄격히 낮아지며, 유도된 가치 함수를 통해 손실이 정량화된다.
  • ODE 시스템의 해 α가 1보다 클 경우 낙관론자(사전 확률 q0 > p0)가 비관론자(사전 확률 q0 < p0)보다 성과가 뛰어나며, 그렇지 않으면 일부 믿음 범위에서는 비관론자가 성과가 뛰어날 수 있다.
  • 이 논문은 정보가 긍정적인 가치를 가짐을 입증한다: 최적 전략의 기대 보상은 사전의 정밀도가 높을수록 증가하며, 유도된 공식을 이용해 정보의 가치를 명시적으로 가격 설정할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.