[논문 리뷰] On Worst-case Regret of Linear Thompson Sampling.
이 논문은 선형 톰슨 샘플링(LinTS)이 사후 분산 확장 없이 악성 경우에 선형적 손실을 입는다는 것을 입증하여, 하한 없는 손실을 방지하기 위해 $\tilde{\mathcal{O}}(\sqrt{d})$의 확장이 필요하다는 것을 보여주며, 하한 없는 손실을 달성하기 위해 필요한 최소한의 사후 분산 확장이 $\tilde{\mathcal{O}}(\sqrt{d})$임을 증명한다. 또한, 약간의 조건 하에서 $\tilde{\mathcal{O}}(1)$의 확장으로도 충분함을 보이며, LinTS의 악성 경우 손실 한계에 대한 오랜 동안 미해결이었던 문제를 해결한다.
In this paper, we consider the worst-case regret of Linear Thompson Sampling (LinTS) for the linear bandit problem. \citet{russo2014learning} show that the Bayesian regret of LinTS is bounded above by $\widetilde{\mathcal{O}}(d\sqrt{T})$ where $T$ is the time horizon and $d$ is the number of parameters. While this bound matches the minimax lower-bounds for this problem up to logarithmic factors, the existence of a similar worst-case regret bound is still unknown. The only known worst-case regret bound for LinTS, due to \cite{agrawal2013thompson,abeille2017linear}, is $\widetilde{\mathcal{O}}(d\sqrt{dT})$ which requires the posterior variance to be inflated by a factor of $\widetilde{\mathcal{O}}(\sqrt{d})$. While this bound is far from the minimax optimal rate by a factor of $\sqrt{d}$, in this paper we show that it is the best possible one can get, settling an open problem stated in \cite{russo2018tutorial}. Specifically, we construct examples to show that, without the inflation, LinTS can incur linear regret up to time $\exp(\Omega(d))$. We then demonstrate that, under mild conditions, a slightly modified version of LinTS requires only an $\widetilde{\mathcal{O}}(1)$ inflation where the constant depends on the diversity of the optimal arm.
연구 동기 및 목표
- 사후 분산 확장이 과도하게 증가하지 않더라도 LinTS가 최소 최악의 경우 손실을 달성할 수 있는지 여부를 해결하는 것.
- 악성 환경에서 선형 손실을 피하기 위해 LinTS가 필요로 하는 최소한의 사후 분산 확장의 양을 규명하는 것.
- 하한 없는 손실을 달성하기 위해 상수 수준의 확장 인자가 충분한지 조건을 규명하는 것.
- 사후 분산 확장을 적용하지 않았을 경우 선형 손실이 발생하는 구체적인 예를 제시하는 것.
제안 방법
- 사후 분산 확장을 하지 않았을 경우 LinTS가 시간 $\exp(\Omega(d))$까지 선형 손실을 입는 악성 선형 밴딧 예제를 구성하는 것.
- 최적 액션의 다양성에 따른 손실의 의존도를 분석하여 필요한 확장 인자의 크기를 제한하는 것.
- 최적 액션의 다양성에 대해 약간의 조건이 만족될 경우 $\tilde{\mathcal{O}}(1)$의 확장 인자를 사용하는 수정된 LinTS 알고리즘을 제안하는 것.
- 집중 부등식과 사후 분산 분석을 활용하여 악성 경우 손실 한계를 유도하는 것.
- Hard instances를 구성하여 LinTS가 그 확장을 하지 않았을 경우 실패함을 입증함으로써 필요한 확장 인자의 하한을 설정하는 것.
실험 결과
연구 질문
- RQ1사후 분산 확장을 하지 않더라도 LinTS가 하한 없는 최악의 경우 손실을 달성할 수 있는가?
- RQ2악성 경우에서 선형 손실을 피하기 위해 LinTS가 필요로 하는 최소한의 확장 인자는 무엇인가?
- RQ3최적 액션에 대한 약간의 구조적 가정 하에서 필요한 확장 인자를 $\tilde{\mathcal{O}}(1)$로 줄일 수 있는가?
- RQ4최적 액션의 다양성이 필요한 확장 인자 크기에 어떤 영향을 미치는가?
주요 결과
- 사후 분산 확장을 하지 않았을 경우, LinTS는 시간 $\exp(\Omega(d))$까지 선형 손실을 입을 수 있으며, 이는 최악의 경우 $\tilde{\mathcal{O}}(\sqrt{d})$의 확장이 필요하다는 것을 증명한다.
- 사후 분산이 $\tilde{\mathcal{O}}(\sqrt{d})$로 확장되지 않으면서 LinTS의 최악의 경우 손실은 $\tilde{\mathcal{O}}(d\sqrt{T})$로 제한되지 않는다.
- 최적 액션의 다양성에 대해 약간의 조건이 만족될 경우, $\tilde{\mathcal{O}}(1)$의 확장 인자가 $\tilde{\mathcal{O}}(d\sqrt{T})$의 손실을 달성하는 데 충분하다.
- 논문은 \cite{russo2018tutorial}에서 제기된 오랜 동안 미해결이었던 문제를 해결하며, LinTS에 대해 $\tilde{\mathcal{O}}(\sqrt{d})$의 확장이 최악의 경우에 가능한 최고의 한계임을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.