Skip to main content
QUICK REVIEW

[논문 리뷰] On the Performance of Thompson Sampling on Logistic Bandits

Shi Dong, Tengyu Ma|arXiv (Cornell University)|2019. 05. 12.
Advanced Bandit Algorithms Research참고 문헌 16인용 수 4
한 줄 요약

이 논문은 행동 집합과 매개변수 집합이 동일할 조건 하에서, 기울기 매개변수 $\beta$에 관계없이 로지스틱 밴디트에서 톰슨 샘플링의 베이지안 리그레트 한계를 $\tilde{O}(d\sqrt{T})$로 확립한다. 또한 유연성 차원 $\eta$와 최악의 경우 최적의 로그오즈 $\lambda$를 사용하여 이 결과를 일반화하여 리그레트가 $\tilde{O}(\sqrt{d\eta T}/\lambda)$ 비례함을 보이고, $\eta$ 또는 $\lambda$에 대한 의존성이 없이 $T$에 대해 다항식보다 더 낮은 리그레트를 달성할 수 있는 알고리즘이 존재하지 않음을 증명한다. 분석은 로지스틱 밴디트에 특화된 새로운 정보 비율 한계를 도입하여, 이전에 알려진 $\beta$-의존성에 대한 오랜 열린 질문을 해결한다.

ABSTRACT

We study the logistic bandit, in which rewards are binary with success probability $\exp(βa^ op θ) / (1 + \exp(βa^ op θ))$ and actions $a$ and coefficients $θ$ are within the $d$-dimensional unit ball. While prior regret bounds for algorithms that address the logistic bandit exhibit exponential dependence on the slope parameter $β$, we establish a regret bound for Thompson sampling that is independent of $β$. Specifically, we establish that, when the set of feasible actions is identical to the set of possible coefficient vectors, the Bayesian regret of Thompson sampling is $ ilde{O}(d\sqrt{T})$. We also establish a $ ilde{O}(\sqrt{dηT}/λ)$ bound that applies more broadly, where $λ$ is the worst-case optimal log-odds and $η$ is the "fragility dimension," a new statistic we define to capture the degree to which an optimal action for one model fails to satisfice for others. We demonstrate that the fragility dimension plays an essential role by showing that, for any $ε> 0$, no algorithm can achieve $\mathrm{poly}(d, 1/λ)\cdot T^{1-ε}$ regret.

연구 동기 및 목표

  • 로지스틱 밴디트에서의 톰슨 샘플링이 이전의 한계에서 기하급수적 의존성을 보였음에도 불구하고 기울기 매개변수 $\beta$에 독립적인 리그레트를 달성할 수 있는지 여부를 해결하는 것.
  • 선형 및 독립적 밴디트에 대한 이전 작업을 확장하여, 로지스틱 밴디트에서 정보 비율을 유한하게 제한하기 위한 새로운 정보 이론적 분석 기법을 개발하는 것.
  • 최적 행동의 민감도를 캡처하는 새로운 통계량인 유연성 차원 $\eta$를 정의하고 분석하며, 이가 리그레트 한계에서 핵심적인 역할을 함을 보여주는 것.
  • 엄격한 리그레트 하한을 확립하여, 어떤 $\epsilon > 0$에 대해서도 $\eta$ 또는 $\lambda$에 대한 다항식 의존성이 없이 $T^{1-\epsilon}$ 리그레트를 달성할 수 있는 알고리즘이 존재하지 않음을 증명하는 것.

제안 방법

  • 로지스틱 링크 함수의 구조와 매개변수 및 행동 공간의 기하학적 성질을 활용하여, 로지스틱 밴디트에 특화된 새로운 정보 비율 한계를 제안한다.
  • 행동 집합 $\mathcal{A}$와 매개변수 집합 $\Theta$가 동일할 때, 한 모델에서 최적 행동이 다른 모델에서 성공 확률 $\leq 50\%$가 되는 최대 모델 수로 유연성 차원 $\eta$를 정의한다.
  • 베이지안 리그레트 프레임워크를 사용하고, 행동과 진짜 매개변수 $\theta$ 사이의 상호정보량의 정밀한 분석을 통해 농도성 및 반농도성 성질을 활용한다.
  • 정보 비율과 행동-매개변수 쌍의 로그오즈 사이의 핵심 부등식을 수립하여, $\mathcal{A} = \Theta$일 경우 $\tilde{O}(d\sqrt{T})$ 한계를 이끌어내는 데 성공한다.
  • $\mathcal{A} \neq \Theta$의 일반적인 경우로 일반화하기 위해 $\lambda$를 도입하고, 리그레트가 $\tilde{O}(\sqrt{d\eta T}/\lambda)$ 비례함을 보인다.
  • 구성적 하한 증명을 통해 구면 코드와 내적 제약 조건을 활용하여, $\eta$가 특정 영역에서 $d$에 대해 지수적으로 증가할 수 있음을 보이고, 이는 다항식보다 더 낮은 리그레트를 달성하기 위해 피할 수 없는 증가임을 입증한다.

실험 결과

연구 질문

  • RQ1기울기 매개변수 $\beta$에 의존하지 않고, 이전의 한계에서 기하급수적 의존성이 보고된 바 있음에도 불구하고, 로지스틱 밴디트에서의 톰슨 샘플링이 리그레트를 달성할 수 있는가?
  • RQ2유연성 차원 $\eta$가 로지스틱 밴디트에서 리그레트의 근본적 한계를 결정하는 데 어떤 역할을 하는가?
  • RQ3모든 $\epsilon > 0$에 대해 $\eta$ 또는 $\lambda$에 대한 의존성이 없이 $T^{1-\epsilon}$ 리그레트를 달성하는 것이 가능한가?
  • RQ4행동 집합과 매개변수 집합의 구조가 로지스틱 밴디트에서 학습의 어려움에 어떤 영향을 미치는가? 특히 $\mathcal{A} \neq \Theta$일 경우에 대해.
  • RQ5정보 비율 프레임워크는 비선형 밴디트인 로지스틱 밴디트로 확장될 수 있는가? 그리고 새로운 기술적 과제는 무엇인가?

주요 결과

  • 행동 집합 $\mathcal{A}$가 매개변수 집합 $\Theta$와 동일할 경우, 톰슨 샘플링은 기울기 매개변수 $\beta$에 영향을 받지 않는 $\tilde{O}(d\sqrt{T})$의 베이지안 리그레트 한계를 달성한다.
  • 일반적인 경우 $\mathcal{A} \neq \Theta$에 대해 리그레트는 $\tilde{O}(\sqrt{d\eta T}/\lambda)$로 한정되며, 여기서 $\eta$는 유연성 차원이고 $\lambda$는 최악의 경우 최적의 로그오즈이다.
  • 이 논문은 어떤 $\epsilon > 0$에 대해서도 $\mathrm{poly}(d,1/\lambda) \cdot T^{1-\epsilon}$ 리그레트를 달성할 수 있는 알고리즘이 존재하지 않음을 증명하여, $\eta$가 리그레트 한계에서 필수적인 매개변수임을 입증한다.
  • 유연성 차원 $\eta$는 특정 구성에서 $d$에 대해 지수적으로 증가할 수 있으며, 특히 최악의 경우 최적의 로그오즈 $\iota = 0$일 경우에 그렇다. 그러나 대부분의 실용적 설정에서는 $\eta$가 $d$에 대해 선형으로 증가할 것으로 예상된다.
  • 분석 결과, 행동 집합에서 행동을 제거하면 문제의 난이도가 증가할 수 있음을 보여주는 반례를 제시하였다. 행동 수가 줄어들었음에도 불구하고 $\eta$가 증가하여 학습이 더 어려워지는 현상이 발생한다.
  • 이 연구에서 개발된 정보 비율 한계 기법은 비선형 밴디트 문제, 특히 지수족 보상이 있는 문제 분석을 위한 새로운 길을 열어준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.