[논문 리뷰] Tsallis-INF: An Optimal Algorithm for Stochastic and Adversarial Bandits
Tsallis-INF는 스위치 환경이나 시간 수평에 대한 사전 지식 없이도 스토케스틱 및 악성 환경에서 최적의 리그레트 한계를 달성하는 새로운 밴딧 알고리즘입니다. 이 알고리즘은 α=1/2에서의 타살리스 엔트로피 정규화와 감소된 분산 손실 추정기를 사용하는 온라인 미러 디센트를 결합하여, 스트로케스틱 및 스트로케스틱으로 제약된 설정에서 로그 리그레트를 달성하면서도 악성 리그레트 보장을 유지합니다.
We derive an algorithm that achieves the optimal (within constants) pseudo-regret in both adversarial and stochastic multi-armed bandits without prior knowledge of the regime and time horizon. The algorithm is based on online mirror descent (OMD) with Tsallis entropy regularization with power $α=1/2$ and reduced-variance loss estimators. More generally, we define an adversarial regime with a self-bounding constraint, which includes stochastic regime, stochastically constrained adversarial regime (Wei and Luo), and stochastic regime with adversarial corruptions (Lykouris et al.) as special cases, and show that the algorithm achieves logarithmic regret guarantee in this regime and all of its special cases simultaneously with the adversarial regret guarantee.} The algorithm also achieves adversarial and stochastic optimality in the utility-based dueling bandit setting. We provide empirical evaluation of the algorithm demonstrating that it significantly outperforms UCB1 and EXP3 in stochastic environments. We also provide examples of adversarial environments, where UCB1 and Thompson Sampling exhibit almost linear regret, whereas our algorithm suffers only logarithmic regret. To the best of our knowledge, this is the first example demonstrating vulnerability of Thompson Sampling in adversarial environments. Last, but not least, we present a general stochastic analysis and a general adversarial analysis of OMD algorithms with Tsallis entropy regularization for $α\in[0,1]$ and explain the reason why $α=1/2$ works best.
연구 동기 및 목표
- 스위치 환경이나 시간 수평에 대한 사전 지식 없이도 스위치적 및 악성 환경에서 최적의 리그레트를 달성하는 단일 밴딧 알고리즘을 개발하는 것.
- 공통 프레임워크 하에 스위치적, 악성, 그리고 손상된 스위치적 밴딧 설정의 분석을 통합하는 것.
- α=1/2에서의 타살리스 엔트로피 정규화가 다양한 밴딧 환경에서 최적의 성능을 가능하게 한다는 것을 보여주는 것.
- 타살리스-인피니티(Thompson Sampling)가 악성 환경에서 취약한 반면, Tsallis-INF는 그렇지 않다는 것을 보여주는 것.
- α∈[0,1] 범위에서 타살리스 엔트로피를 사용한 OMD의 일반적 분석을 제공하여 왜 α=1/2가 최적이라는 것을 설명하는 것.
제안 방법
- 알고리즘은 α=1/2에서의 타살리스 엔트로피 정규화를 사용하는 온라인 미러 디센트(OMD)를 사용합니다.
- 감소된 분산 손실 추정기를 사용하여 스위치적 설정에서 리그레트 한계를 향상시킵니다.
- 이 방법은 스위치적 및 악성 밴딧을 일반화하는 자기유지 제약(self-bounding constraint) 하에서 분석됩니다.
- 알고리즘은 일반화된 자기유지 제약 환경에서 로그 리그레트를 달성하며, 이는 스위치적 밴딧과 악성으로 제약된 스위치적 밴딧, 그리고 악성 손상이 있는 스위치적 밴딧을 포함합니다.
- 이론적 분석을 통해 α=1/2가 스위치적 및 악성 환경에서 리그레트를 최소화함을 확인합니다.
- 이 프레임워크는 유틸리티 기반 듀얼링 밴딧으로 확장되었으며, 여기서도 최적의 리그레트를 달성합니다.
실험 결과
연구 질문
- RQ1단일 밴딧 알고리즘이 스위치적 및 악성 환경에서 사전 지식 없이도 최적의 리그레트를 달성할 수 있는가?
- RQ2밴딧 알고리즘에서 타살리스 엔트로피 정규화 파라미터 α의 최적 값은 무엇인가?
- RQ3UCB1과 톰슨 샘플링이 실패하는 악성 환경에서 Tsallis-INF는 어떻게 작동하는가?
- RQ4자기유지 제약 프레임워크는 스위치적 및 악성 밴딧 설정을 하나의 리그레트 보장 하에 통합할 수 있는가?
- RQ5왜 α=1/2가 OMD에서 타살리스 엔트로피 정규화에 최적의 성능을 낳는가?
주요 결과
- Tsallis-INF는 스위치적 및 악성 밴딧 설정에서 모두 최적(상수 인자 내)의 의사 리그레트를 달성하며, 환경나 시간 수평에 대한 사전 지식이 없어도 됩니다.
- 알고리즘은 일반화된 자기유지 제약 환경에서 로그 리그레트를 달성하며, 이는 스위치적 밴딧, 스트로케스틱으로 제약된 악성 밴딧, 그리고 악성 손상이 있는 스위치적 밴딧을 포함합니다.
- 실험 결과 Tsallis-INF는 스위치적 환경에서 UCB1과 EXP3보다 뚜렷이 뛰어난 성능을 보입니다.
- 악성 환경에서는 UCB1과 톰슨 샘플링이 거의 선형 리그레트를 보이지만, Tsallis-INF는 로그 리그레트를 유지합니다.
- 이 연구는 톰슨 샘플링이 악성 환경에서 취약하다는 최초의 실증적 증거를 제공합니다.
- 이론적 분석을 통해 α=1/2가 OMD에서 타살리스 엔트로피 정규화에 대해 스위치적 및 악성 환경에서 리그레트를 최소화함을 확인합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.