QUICK REVIEW
[논문 리뷰] Better Algorithms for Stochastic Bandits with Adversarial Corruptions
Anupam Gupta, Tomer Koren|arXiv (Cornell University)|2019. 02. 22.
Advanced Bandit Algorithms Research참고 문헌 26인용 수 13
한 줄 요약
이 논문은 적대적 오염 하에서 확률적 다익음 밴딧 문제를 위한 새로운 알고리즘 BARBAR를 소개한다. 이 알고리즘은 오염 수준 $C$에 대해 곱셈적 대신 덧셈적 의존성을 가지며, 심지어 상당한 오염 상황에서도 강건한 성능을 달성한다. 알고리즘은 $C$에 대해 무지성이며 자동으로 적응하며, 최적의 오염 없음 상태의 성능에 대해 덧셈적 $O(KC)$ 항 이내로 일치시킨다.
ABSTRACT
We study the stochastic multi-armed bandits problem in the presence of adversarial corruption. We present a new algorithm for this problem whose regret is nearly optimal, substantially improving upon previous work. Our algorithm is agnostic to the level of adversarial contamination and can tolerate a significant amount of corruption with virtually no degradation in performance.
연구 동기 및 목표
- 보상에 적대적 오염이 존재할 때도 강건한 오차 보장을 유지하는 문제에 대응한다.
- 이전 알고리즘이 오염 수준 $C$에 비례해 오차가 곱셈적으로 악화되는 한계를 극복한다.
- 오염 수준 $C$에 대해 무지성인 방법을 설계하여 $C$에 대한 사전 지식이 필요 없도록 한다.
- 최적의 확률적 경우에서부터 적대적 환경으로의 오차 경계가 부드럽게 떨어지도록 한다.
- 간단하고 실용적인 알고리즘을 제공하여 낮은 오염 수준과 높은 오염 수준 모두에서 높은 성능을 유지를 한다.
제안 방법
- 다양한 UCB 스타일의 탐색 단계를 조합하고 적응적 필터링을 통해 오염된 피드백을 탐지하고 완화하는 새로운 알고리즘 BARBAR를 제안한다.
- 각 층이 점차 증가하는 신뢰 구간을 사용하는 UCB를 적용하는 계층적 구조를 사용하여 재현성에 의해 강건성을 확보한다.
- 각 층 간의 보상 일관성 검사를 기반으로 한 새로운 오염 탐지 메커니즘을 도입하여 오염된 피드백을 식별하고 제거할 수 있도록 한다.
- 손님 평균과 신뢰 구간을 별도로 유지하며, 일관성 있는 피드백에서만 업데이트하여 오염으로 인한 편향을 방지한다.
- 관측된 보상의 일관성에 기반해 가장 신뢰할 수 있는 층을 동적으로 선택함으로써 최종 선택이 적대적 오염에 강건하도록 보장한다.
- 최대 $C$ 라운드 동안 오염된 경우에도 다수의 일관된 관측에 기반한 결정을 통해 강건성을 확보한다.
실험 결과
연구 질문
- RQ1적대적 오염이 존재할 때도 오염 수준 $C$에 대한 사전 지식 없이 near-optimal 오차를 유지할 수 있는 확률적 밴딧 알고리즘을 설계할 수 있는가?
- RQ2오염 수준 $C$에 대해 곱셈적 의존성 대신 덧셈적 의존성을 가지는 것이 가능하여 고오염 상황에서도 성능을 유지할 수 있는가?
- RQ3조정이나 사전 가정 없이 오염 수준에 자동으로 적응하는 단순하고 무지성인 알고리즘을 구축할 수 있는가?
- RQ4적대적 오염 하에서 확률적 밴딧의 오염에 대한 강건성과 오차 사이의 기본적인 상충 관계는 무엇인가?
- RQ5강건성을 유지하면서도 $ ext{polylog}(T)$ 의존성을 제거할 수 있는가?
주요 결과
- 제안된 BARBAR 알고리즘은 높은 확률로 $O(KC) + \widetilde{O}\left(\sum_{i \neq i^*} \frac{1}{\Delta_i}\right)$ 오차 경계를 달성하며, 이는 $C$에 대해 덧셈적이다.
- 이 경계는 이전 최고 성능의 경계 $\widetilde{O}(KC \sum_{i \neq i^*} \frac{1}{\Delta_i})$ 에서 곱셈적 $C$ 요소를 제거함으로써 향상되었다.
- 알고리즘은 $C$에 대해 무지성이며 오염 수준에 대한 사전 지식이 필요 없으며, $C$가 클수록 잘 작동한다.
- 특수한 예시($\Delta_i = \sqrt{K/T}$)에서 $C = O(\sqrt{T/K})$ 일 때 BARBAR는 $\widetilde{O}(\sqrt{KT})$ 오차를 달성하며, 오염 없음 경우와 일치한다.
- 이전 연구 대비 성능이 뛰어나며, $C = O(1)$ 일 때조차도 상당한 성능 저하를 보이고, $C = \Omega(\sqrt{T/K})$ 일 때는 의미 없어지는 경우가 있다.
- 오차에 대해 $\Omega(C)$ 의 하한 경계가 확립되어, 상한 경계에서의 덧셈적 의존성이 거의 최적임을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.