[논문 리뷰] Diffusion Approximations for Thompson Sampling in the Small Gap Regime
이 논문은 암 보상 차이가 $1/\sqrt{n}$ 비율로 스케일링되는 소 gap 영역에서 톰슨 샘플링의 약한 수렴 이론을 개발한다. 이는 알고리즘의 동역학이 확률적 미분 방정식(SDE)과 랜덤 ODE의 해로 약한 수렴을 이룬다는 것을 보여주며, 핵심 기여는 보상 분포와 사전 분포에 관계없이 동일한 극한으로 수렴하는 보편성 원리(인вар리언스 원리)를 입증하는 것이다.
We study the process-level dynamics of Thompson sampling in the ``small gap'' regime. The small gap regime is one in which the gaps between the arm means are of order $\sqrtγ$ or smaller and the time horizon is of order $1/γ$, where $γ$ is small. As $γ\downarrow 0$, we show that the process-level dynamics of Thompson sampling converge weakly to the solutions to certain stochastic differential equations and stochastic ordinary differential equations. Our weak convergence theory is developed from first principles using the Continuous Mapping Theorem, can handle stationary, weakly dependent reward processes, and can also be adapted to analyze a variety of sampling-based bandit algorithms. Indeed, we show that the process-level dynamics of many sampling-based bandit algorithms -- including Thompson sampling designed for any single-parameter exponential family of rewards, as well as non-parametric bandit algorithms based on bootstrap re-sampling -- satisfy an invariance principle. Namely, their weak limits coincide with that of Gaussian parametric Thompson sampling with Gaussian priors. Moreover, in the small gap regime, the regret performance of these algorithms is generally insensitive to model mis-specification, changing continuously with increasing degrees of mis-specification.
연구 동기 및 목표
- 소 gap 영역에서 톰슨 샘플링을 분석하기 위한 엄밀한 약한 수렴 프레임워크를 개발하는 것.
- 시간 수평 $n \to \infty$ 에서 $\Delta/\sqrt{n}$ 스케일링 하에 암 평균 간격이 스케일링될 때 톰슨 샘플링 동역학의 점근적 행동을 기술하는 것.
- 다양한 보상 분포와 사전 분포에 대해 제한적인 확산 과정이 동일한 극한으로 수렴함을 입증하는 것, $1/\sqrt{n}$ 스케일링 하에.
- 다양한 암 밴딧 및 선형 밴딧 설정, 포함하여 시간에 따라 변하는 행동 집합까지도 약한 수렴 이론을 확장하는 것.
- 연속성 맵핑 정리(Continuous Mapping Theorem)를 사용한 원천적 유도를 제공하여 다른 샘플링 기반 밴딧 알고리즘에의 적응 가능성을 확보하는 것.
제안 방법
- 암 간격이 $\Delta/\sqrt{n}$ 비율로 스케일링될 때 톰슨 샘플링 동역학을 분석하기 위해 약한 수렴(확률적 수렴)을 사용한다.
- 유한한 $n$ 에서 톰슨 샘플링 행동를 지배하는 이산 시간 형태의 SDE 및 랜덤 ODE를 유도한다.
- $D_{\mathbb{R}^d}[0,1]$ 공간에서 연속성 맵핑 정리와 타이트니스 기준을 적용하여 연속적인 확산 극한으로의 약한 수렴을 증명한다.
- empirical process 수렴을 검증하기 위해 글리벤코-칸텔레 정리(Glivenko-Cantelli Theorem)와 브라켓팅 엔트로피 조건을 활용한다.
- 마팅게일 기반의 중심극한정리 함수를 적용하여 공분산 행렬이 특정된 브라운 운동으로의 수렴을 확립한다.
- $D_{\mathbb{R}}[0,1]$ 공간에서 타이트니스를 위한 충분한 조건을 순간값 유계와 증분 분산 제어를 통해 제공한다.
실험 결과
연구 질문
- RQ1암 평균 간격이 $1/\sqrt{n}$ 비율로 스케일링될 때 톰슨 샘플링의 동역학은 점근적으로 어떻게 행동하는가?
- RQ2이산 시간 동역학이 분포 수렴할 때 톰슨 샘플링은 어떤 연속 시간 확률적 과정으로 수렴하는가?
- RQ3톰슨 샘플링의 약한 확산 극한은 다양한 보상 분포와 사전 선택에 대해 보편적인가?
- RQ4약한 수렴 프레임워크는 유한하거나 무한한 행동 집합, 포함하여 시간에 따라 변하는 행동 집합을 포함한 선형 밴딧으로 확장 가능한가?
- RQ5후행 분포 근사와 부트스트랩 샘플링은 제한적인 확산 과정의 형태를 어떻게 결정하는가?
주요 결과
- $\Delta/\sqrt{n}$ 스케일링 하에, 톰슨 샘플링 동역학은 $n \to \infty$ 일 때 SDE 및 랜덤 ODE의 해로 약한 수렴한다.
- 제한적인 확산 과정은 보편적이다: 특정 보상 분포나 사전에 관계없이 동일한 극한으로 수렴한다, 후행 분포가 잘 근사된다는 조건 하에.
- 약한 확산 극한은 정규 분포 보상과 사전에 대한 것과 일치한다. 이는 고전적인 버르슈타인-폰 마이제스 근사의 확인이다.
- 인바리언스 원리가 성립한다: 후행 분포 근사 또는 부트스트랩을 사용하는 톰슨 샘플링 및 유사 알고리즘은 $1/\sqrt{n}$ 간격 영역에서 동일한 약한 극한을 가진다.
- 수렴 프레임워크는 일반적이며, 부트스트랩 기반 탐색과 같은 다른 샘플링 기반 밴딧 알고리즘을 분석하는 데 직접 적용 가능하다.
- 이 이론은 다앙한 암 밴딧과 선형 밴딧에 모두 적용 가능하며, 유한하거나 무한한 행동 집합, 포함하여 확률적 및 시간에 따라 변하는 행동 집합에도 적용된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.