Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Bandits with Context Distributions

Johannes Kirschner, Andreas Krause|arXiv (Cornell University)|2019. 06. 06.
Advanced Bandit Algorithms Research참고 문헌 34인용 수 17
한 줄 요약

이 논문은 환경이 정확한 컨텍스트가 아니라 컨텍스트의 분포를 제공하고 학습자는 오직 그 분포만 관측하는 새로운 스토하스틱 컨텍스추얼 밴디트 모델을 제안한다. 저자들은 이 설정에 맞게 UCB 알고리즘을 적응시켜 선형 및 커널화된 보상 함수에 대해 순서적으로 최적의 O(d√T) 확률적 최소 손실 경계를 증명한다. 이는 컨텍스트 분포가 Dirac 델타일 때 기존의 컨텍스추얼 밴디트 모델으로 일반화된다.

ABSTRACT

We introduce a stochastic contextual bandit model where at each time step the environment chooses a distribution over a context set and samples the context from this distribution. The learner observes only the context distribution while the exact context realization remains hidden. This allows for a broad range of applications where the context is stochastic or when the learner needs to predict the context. We leverage the UCB algorithm to this setting and show that it achieves an order-optimal high-probability bound on the cumulative regret for linear and kernelized reward functions. Our results strictly generalize previous work in the sense that both our model and the algorithm reduce to the standard setting when the environment chooses only Dirac delta distributions and therefore provides the exact context to the learner. We further analyze a variant where the learner observes the realized context after choosing the action. Finally, we demonstrate the proposed method on synthetic and real-world datasets.

연구 동기 및 목표

  • 진짜 컨텍스트가 관측되지 않고 오직 컨텍스트 분포만 제공될 때 컨텍스트 밴디트 학습의 과제를 다루는 것.
  • 실현된 컨텍스트가 아니라 컨텍스트 분포 기반으로 최고의 행동 선택에 대응하는 학습 알고리즘을 개발하는 것.
  • 기능 차원 d와 시간 범위 T에 대해 순서적으로 최적의 고확률 손실 경계를 확립하는 것.
  • 커널 평균 임베딩과 분포 위험 최소화를 사용하여 커널화된 보상 함수로 이 프레임워크를 확장하는 것.
  • 행동 선택 이후 실현된 컨텍스트가 관측되는 변형을 분석하여 적용 범위를 넓히는 것.

제안 방법

  • 모델은 각 라운드 t마다 환경이 컨텍스트 분포 μt를 선택하고, 컨텍스트 ct는 μt에서 추출되지만 학습자는 오직 μt만 관측한다.
  • 보상 함수는 특징 벡터 φx,c에 대해 선형으로 가정되며, f(x,c) = φx,c⊤θ로 표현되며, θ ∈ ℝd는 알려지지 않은 값이다.
  • 관측된 보상과 컨텍스트 분포를 사용하여 최소 제곱 추정기를 통해 θ에 대한 신뢰 집합을 구성함으로써 이 설정에 맞게 UCB 알고리즘을 적응시킨다.
  • 환경의 컨텍스트 분포 μt에 대한 샘플링 접근만 필요로 하며 전체 분포 지식이 필요로 하지 않는 실용적 변형 알고리즘을 제안한다.
  • 커널화된 설정에서는 보상 함수가 알려진 RKHS에 속해 있다고 가정하고, 기대 보상을 추정하기 위해 커널 평균 임베딩을 사용한다.
  • 손실 경계를 유도하기 위해 농도 부등식과 정보 이론적 도구를 활용하며, 선형 설정에서 O(d√T)의 고확률 손실 경계를 보여준다.

실험 결과

연구 질문

  • RQ1진짜 컨텍스트가 숨겨져 있고 오직 컨텍스트 분포만 관측될 때, 컨텍스트 밴디트 알고리즘이 비선형 손실을 달성할 수 있는가?
  • RQ2컨텍스트 분포에 적응된 UCB 알고리즘이 선형 밴디트 설정에서 순서적으로 최적의 손실을 달성하는가?
  • RQ3컨텍스트 분포 불확실성이 존재할 때, 손실 경계는 기능 차원 d와 시간 범위 T에 대해 어떻게 스케일링되는가?
  • RQ4커널 평균 임베딩과 분포 위험 최소화를 사용하여 이 프레임워크를 커널화된 보상 함수로 확장할 수 있는가?
  • RQ5행동 선택 이후 실현된 컨텍스트를 관측하는 것과 분포만 관측하는 것에 비해 성능 향상은 얼마나 되는가?

주요 결과

  • 제안된 UCB 기반 알고리즘은 선형 밴디트 설정에서 O(d√T)의 고확률 손실 경계를 달성하며, 로그 인자들을 제외한 순서적으로 최적이다.
  • 환경가 적응적으로 컨텍스트 분포를 선택하더라도 손실 경계가 유지되며, 학습자는 실현된 컨텍스트를 관측하지 못한다.
  • 이 방법은 기존의 표준 컨텍스트 밴디트 모델을 일반화한다: 컨텍스트 분포가 Dirac 델타일 경우 알고리즘이 고전적 UCB로 축소된다.
  • 커널화된 설정에서는 커널 평균 임베딩을 사용해 기대 보상을 추정하고, 커널의 고유스pektr럼 감쇠에 따라 손실 경계가 달라진다.
  • 실제 세계에서 컨텍스트 분포에 대한 샘플링 접근만 가능할 때도 알고리즘이 실용적 유지되며, 전체 분포 지식이 필요로 하지 않는다.
  • 행동 선택 이후 실현된 컨텍스트를 관측하는 변형에서는 손실 경계가 향상되어 결정 시점에서의 컨텍스트 예측이 필요한 응용 분야에서 더 나은 성능을 달성할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.