Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic bandits robust to adversarial corruptions

Thodoris Lykouris, Vahab Mirrokni|arXiv (Cornell University)|2018. 03. 25.
Advanced Bandit Algorithms Research참고 문헌 8인용 수 5
한 줄 요약

이 논문은 순수한 스토하스틱 환경에서 최적의 리그레트 한계를 유지하면서도 적대적인 교란이 존재할 경우 교란 수준 $C$에 대해 선형적으로 악화되는 강건한 스토하스틱 밴딧 알고리즘을 소개한다. 제안된 멀티레벨 활성 암 제거 레이스 알고리즘은 $C$에 대한 사전 지식 없이도 이를 달성하여 성능이 최적에서 적대적 수준으로 부드럽게 악화됨을 보장한다.

ABSTRACT

We introduce a new model of stochastic bandits with adversarial corruptions which aims to capture settings where most of the input follows a stochastic pattern but some fraction of it can be adversarially changed to trick the algorithm, e.g., click fraud, fake reviews and email spam. The goal of this model is to encourage the design of bandit algorithms that (i) work well in mixed adversarial and stochastic models, and (ii) whose performance deteriorates gracefully as we move from fully stochastic to fully adversarial models. In our model, the rewards for all arms are initially drawn from a distribution and are then altered by an adaptive adversary. We provide a simple algorithm whose performance gracefully degrades with the total corruption the adversary injected in the data, measured by the sum across rounds of the biggest alteration the adversary made in the data in that round; this total corruption is denoted by $C$. Our algorithm provides a guarantee that retains the optimal guarantee (up to a logarithmic term) if the input is stochastic and whose performance degrades linearly to the amount of corruption $C$, while crucially being agnostic to it. We also provide a lower bound showing that this linear degradation is necessary if the algorithm achieves optimal performance in the stochastic setting (the lower bound works even for a known amount of corruption, a special case in which our algorithm achieves optimal performance without the extra logarithm).

연구 동기 및 목표

  • 대부분의 보상이 스토하스틱 패턴을 따르지만 일부가 적대적으로 교란되는 혼합 스토하스틱-적대적 환경에서 잘 작동하는 밴딧 알고리즘을 설계하는 것.
  • 교란이 증가함에 따라 성능이 부드럽게 악화되도록 보장하여, 스토하스틱 설정에서는 최적 성능을, 교란 수준 $C$에 대해 선형적으로 악화되도록 하는 것.
  • 교란 수준 $C$의 양에 대해 무관한 알고리즘을 개발하여, 그 보증을 위해 $C$에 대한 사전 지식이 필요하지 않도록 하는 것.
  • 로그랜드 인자까지 정확한 상한을 제공하는 이론적 보증을 제시하여, 최적의 스토하스틱 성능를 달성하기 위해 $C$에 대해 선형적인 악화가 필수적임을 보여주는 것.

제안 방법

  • 보상이 처음에는 스토하스틱이지만, 적응형 적대자에 의해 변경될 수 있으며 총 교란이 $C = \sum_t \max_a |r^t(a) - r^t_\mathcal{S}(a)|$ 로 제한되는 새로운 모델을 도입한다.
  • 손상된 데이터를 처리하면서도 강건성을 유지하는 레이어드 엘리미네이션을 사용하는 멀티레벨 활성 암 제거 레이스 알고리즘을 제안한다.
  • 서브샘플링과 레이어 프로젝션 기법을 적용하여, 적대적 교란 하에서도 열악한 암이 플레이되는 횟수를 제한한다.
  • 호프딩 유사 농도 경계를 사용하여 분산을 통제하고, 손상된 피드백에도 불구하고 고확률 리그레트 보증을 확보한다.
  • 다양한 교란 수준에서 이중 기준 pseudo-리그레트 상한을 달성하기 위해, 수정된 레이어 수준에서 SAPO 알고리즘을 통합한다.
  • 열악한 암의 플레이 횟수를 상한으로 제시하고, 작은 갭 $\Delta(a)$와 큰 갭 $\Delta(a)$ 조건 하에서 리그레트 기여도를 분석하여 이론적 보증을 수립한다.

실험 결과

연구 질문

  • RQ1밴딧 알고리즘이 순수한 스토하스틱 환경에서 최적의 리그레트를 유지하면서도 적대적 교란에 강건하게 작동할 수 있는가?
  • RQ2스토하스틱 환경에서 교란 환경으로 전이할 때 성능이 최소한으로 악화되는 정도는 무엇이며, 이는 $C$에 대해 선형적으로 상한을 가질 수 있는가?
  • RQ3교란 수준 $C$의 크기에 무관한 알고리즘을 설계할 수 있으며, 이는 스토하스틱 케이스에서 거의 최적의 성능를 달성할 수 있는가?
  • RQ4작은 갭 $\Delta(a)$를 가진 암의 리그레트 상한에서 $\Delta(a)$에 대한 역수 의존성을 개선할 수 있는가? 특히 $\Delta(a) \leq 1/\sqrt{T}$ 인 경우에 대해.
  • RQ5조직 수준 $C$가 알려져 있더라도, 그러한 강건성에 대해 $C$에 대해 선형 의존성이 필수적인가?

주요 결과

  • 제안된 알고리즘은 확률 $1 - \delta$ 에서 $\mathcal{O}\left(\sum_{a \neq a^*} \frac{K C \log(\frac{KT}{\delta}) + \log T}{\Delta(a)} \log(\frac{KT}{\delta}) \right)$ 의 리그레트를 달성하며, 이는 $C$에 대해 선형적으로 악화되지만 스토하스틱 케이스에서는 $T$에 대해 최적의 로그 의존성을 유지한다.
  • 리그레트 상한은 부드럽게 악화된다: $C = 0$ 일 때, 알고리즘은 로그 인자까지 정확한 상한을 제공하는 최적의 $\mathcal{O}(\log T)$ 리그레트를 회복한다.
  • 작은 갭 $\Delta(a) \leq 1/\sqrt{T}$ 를 가진 암에 대해서는 리그레트 상한을 $\min(\sqrt{T}, 1/\Delta(a))$ 로 개선할 수 있으며, 이는 이러한 암을 완전히 이용하더라도 손실이 제한적이라는 사실을 반영한다.
  • 하한을 확립하여, 스토하스틱 설정에서 최적의 성능를 달성하는 어떤 알고리즘이라도 $C$에 대해 선형 의존성이 필수적임을 보여준다. 이는 $C$가 알려져 있더라도 마찬가지다.
  • SAPO 알고리즘과 조합함으로써, 이중 기준 보장을 달성한다: $C \leq T^a$ 이면 pseudo-리그레트는 $\mathcal{O}(\log T)$ 이고, 그렇지 않으면 $\mathcal{O}(T^{1/2 + a})$ 이며, $a < 1/2$ 이다. $a=0$ 일 때는 최고의 두 세계를 모두 달성하는 영역으로 복귀된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.