[논문 리뷰] What You See May Not Be What You Get: UCB Bandit Algorithms Robust to ε-Contamination
이 논문은 ε-오염 환경에서 스토하스틱 다익음 밴드잇 문제에 대해 강건한 상한 신뢰도(UCB) 알고리즘인 crUCB를 제안한다. 여기서는 각 액션에 대해 최대 ε 비율의 보상이 적응형 적대자에 의해 임의로 손상될 수 있다. α-트림드 평균 및 α-쇼트 평균 추정기의 농도 불등식을 활용하여, ε 이하일 경우 진정한 스토하스틱 보상에서 O(√(KT log T))의 리그레트를 달성하며, UCB1, EXP3, EXP3++, TsallisInf와 비교해도 우월한 성능을 보인다. 이는 적대적 오염 환경에서도 성립한다.
Motivated by applications of bandit algorithms in education, we consider a stochastic multi-armed bandit problem with $\varepsilon$-contaminated rewards. We allow an adversary to give arbitrary unbounded contaminated rewards with full knowledge of the past and future. We impose the constraint that for each time $t$ the proportion of contaminated rewards for any action is less than or equal to $\varepsilon$. We derive concentration inequalities for two robust mean estimators for sub-Gaussian distributions in the $\varepsilon$-contamination context. We define the $\varepsilon$-contaminated stochastic bandit problem and use our robust mean estimators to give two variants of a robust Upper Confidence Bound (UCB) algorithm, crUCB. Using regret derived from only the underlying stochastic rewards, both variants of crUCB achieve $\mathcal{O} (\sqrt{KT\log T})$ regret for small enough contamination proportions. Our simulations assume small horizons, reflecting the newly explored setting of bandits in education. We show that in certain adversarial regimes crUCB not only outperforms algorithms designed for stochastic (UCB1) and adversarial (EXP3) bandits but also those that have "best of both worlds" guarantees (EXP3++ and TsallisInf) even when our constraint on the proportion of contaminated rewards is broken.
연구 동기 및 목표
- 교육 및 인간 피드백 응용 분야에서 흔한 저품질 응답으로 인해 발생하는 적대적 오염 문제를 해결하기 위한 도전 과제를 다루기 위해.
- 각 액션에 대해 최대 ε 비율의 손상된 보상이 존재하더라도 강력한 리그레트 보장을 유지할 수 있는 밴드잇 알고리즘을 개발하기 위해.
- 서브-가우시안 분포에 대해 ε-오염 하에서 강건한 평균 추정기의 이론적 농도 불등식을 제공하기 위해.
- 작은 수평선 설정에서 적대적 오염 환경 하에서 crUCB가 UCB1, EXP3, EXP3++, TsallisInf를 능가함을 실증적으로 보여주기 위해.
- 적대자가 과거 및 미래 행동을 완전히 알고 있는 상황에서도 알고리즘이 효과적으로 유지됨을 보여주기 위해.
제안 방법
- 서브-가우시안 보상 분포에서 ε-오염에 강건하도록 설계된 두 가지 강건한 평균 추정기인 α-트림드 평균과 α-쇼트 평균을 제안한다.
- ε-오염 하에서 이러한 추정기의 새로운 농도 불등식을 유도하여, 적대적 오염이 존재하는 환경에서도 신뢰도 구간을 신뢰성 있게 계산할 수 있도록 한다.
- 강건한 평균 추정기를 사용해 신뢰구간을 계산하는 두 가지 변형인 crUCB-s와 crUCB-t를 구성한다.
- 모든 시간 단계에서 각 액션에 대해 오직 ε 이하의 보상만이 오염될 수 있도록 제약 조건을 설정하여, 현실적인 인간의 무관심 또는 봇 행동을 모델링한다.
- 트리밍 또는 쇼트홀딩 과정을 제어하기 위해 조정 파라미터 α를 사용하며, 이는 사전에 알려져야 하지만 과소추정에 대해 강건하다.
- 작은 수평선(T=1000)과 베르누이 적대자로 구성된 시뮬레이션을 통해 청소 및 오염 환경 하에서의 성능을 평가한다.
실험 결과
연구 질문
- RQ1서브-가우시안 밴드잇 환경에서 ε-오염 하에서도 α-트림드 평균 및 α-쇼트 평균과 같은 강건한 평균 추정기가 농도 성질을 유지할 수 있는가?
- RQ2이러한 추정기를 기반으로 한 강건한 UCB 알고리즘이 ε가 작을 경우 진정한 보상 분포에서 O(√(KT log T)) 리그레트를 달성할 수 있는가?
- RQ3ε 제약 조건을 초과하는 오염 상황에서 crUCB는 UCB1, EXP3, EXP3++, TsallisInf와 비교해 어떻게 성능을 내는가?
- RQ4crUCB는 조정 파라미터 α의 선택에 얼마나 민감한가? α를 과소추정하거나 과대추정했을 경우 성능은 어떻게 되는가?
- RQ5적대자가 과거 및 미래 행동을 완전히 알고 있는 상황에서도 오염에 강건한 알고리즘이 강력한 성능을 유지할 수 있는가?
주요 결과
- ε가 충분히 작을 경우 crUCB는 진정한 스토하스틱 보상에서 O(√(KT log T)) 리그레트를 달성하며, 오염되지 않은 환경에서 표준 UCB의 리그레트 경계와 동일하다.
- T=1000과 베르누이 적대자로 구성된 시뮬레이션에서, ε-오염 제약 조건이 위반된 상황에서도 crUCB는 UCB1, EXP3, EXP3++, TsallisInf를 능가한다.
- crUCB의 성능은 α의 과대추정에 대해 상대적으로 민감하지 않으며, α의 과소추정은 오히려 성능 향상을 이끌 수 있어, 조정 오류에 대해 강건함을 시사한다.
- 표준편차 σ를 과대추정하면 성능이 저하되고, 과소추정하면 성능 향상이 가능하며, 이는 UCB 알고리즘에서의 실증적 조정 관행과 일치한다.
- ε=0(오염 없음)일 경우 crUCB는 표준 UCB와 거의 동일한 성능을 보이며, 청소 환경에서 강건한 방법을 사용하는 데서 발생하는 비용이 최소임을 시사한다.
- 프론트 클러스터 공격—첫 번째 ε 보상이 모두 오염되는 경우—는 대부분의 알고리즘의 성능을 심각하게 떨어뜨리지만, crUCB는 특히 초기 단계에서 뛰어난 회복력을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.