Skip to main content
QUICK REVIEW

[논문 리뷰] Best Arm Identification for Contaminated Bandits

Jason M. Altschuler, Victor-Emmanuel Brunel|arXiv (Cornell University)|2018. 02. 26.
Machine Learning and Algorithms참고 문헌 40인용 수 7
한 줄 요약

이 논문은 각 암 풀이 확률 ε로 임의의 오염 분포에서 오염된 샘플을 얻을 수 있는 Contaminated Best Arm Identification (CBAI) 문제를 제안한다. 저자들은 오염된 데이터에서 강력한 모멘트(중위수 및 중위수 평균 차이, MAD)를 추정하기 위한 비점근적 농도 경계를 개발하고, 기존의 BAI 알고리즘을 이 설정에 적응시켰으며, 샘플 복잡도의 엄밀한 상한 및 하한을 확립하여, 로그 인자 외에는 거의 최적임을 보였다.

ABSTRACT

This paper studies active learning in the context of robust statistics. Specifically, we propose a variant of the Best Arm Identification problem for \emph{contaminated bandits}, where each arm pull has probability $\varepsilon$ of generating a sample from an arbitrary contamination distribution instead of the true underlying distribution. The goal is to identify the best (or approximately best) true distribution with high probability, with a secondary goal of providing guarantees on the quality of this distribution. The primary challenge of the contaminated bandit setting is that the true distributions are only partially identifiable, even with infinite samples. To address this, we develop tight, non-asymptotic sample complexity bounds for high-probability estimation of the first two robust moments (median and median absolute deviation) from contaminated samples. These concentration inequalities are the main technical contributions of the paper and may be of independent interest. Using these results, we adapt several classical Best Arm Identification algorithms to the contaminated bandit setting and derive sample complexity upper bounds for our problem. Finally, we provide matching information-theoretic lower bounds on the sample complexity (up to a small logarithmic factor).

연구 동기 및 목표

  • 보상이 확률 ε로 임의의 오염과 함께 오염될 수 있는 상황에서 최적의 암을 식별하는 데 도전하는 것.
  • 진짜 분포가 오염로 인해 부분적으로만 식별 가능한 새로운 밴딧 설정인 오염된 최적 암 식별(CBAI)을 정식화하는 것.
  • 오염된 샘플에서 중위수 및 중위수 평균 차이(MAD)를 추정하기 위한 비점근적 통계적 보장을 개발하는 것.
  • 기존의 최적 암 식별(BAI) 알고리즘을 샘플 복잡도 보장이 있는 CBAI 설정에 적응시키는 것.
  • 정보 이론적 하한을 제공하여 제안된 알고리즘의 거의 최적성을 입증하는 것.

제안 방법

  • 오염 과정을 혼합 모델로 모델링: 확률 1−ε로 진짜 암 분포 F_i에서 샘플을 추출하고, 확률 ε로 임의의 오염 분포 G_i,t에서 추출한다.
  • 부분적 식별 가능성의 개념을 도입하여, 적대적 오염으로 인해 무한한 샘플에서도 진짜 중위수 및 MAD가 완전히 복원되지 않는 상황을 설명한다.
  • 무심한, 사전 지식이 있는, 악성 공격자에 대한 상황에서 중위수 및 MAD 추정에 대해 엄밀한 비점근적 농도 부등식을 유도한다.
  • 표준 갭 기반 분석을 오염에 의한 불확실성을 반영한 효과적 갭으로 대체하여 고전적 BAI 알고리즘(예: 연속 제거)을 적응시킨다.
  • 유니온 바운드와 강력한 추정 보장을 활용하여 선택된 암의 중위수 및 MAD에 대한 고확률 신뢰구간을 유도한다.
  • 클래식 BAI 하한을 오염된 설정으로 확장하는 데 사용되는 리프팅 기법을 통해 일치하는 하한을 확립한다.

실험 결과

연구 질문

  • RQ1각 암 풀이 확률 ε로 오염될 수 있을 때, 최적의 암을 식별하는 데 필요한 기본적인 샘플 복잡도는 무엇인가?
  • RQ2적대적 오염 하에서 오염된 샘플에서 강력한 통계적 추정량(중위수 및 MAD)을 신뢰성 있게 추정하는 방법은 무엇인가?
  • RQ3고전적 최적 암 식별 알고리즘이 샘플 복잡도 보장이 있는 오염된 밴딧 설정에 적응될 수 있는가?
  • RQ4이 설정에서 신뢰도, 비최적 갭, 오염 수준 사이의 최적의 트레이드오프는 무엇인가?
  • RQ5정보 이론적 하한은 제안된 알고리즘의 상한과 어떻게 비교되는가?

주요 결과

  • 논문은 무심한, 사전 지식이 있는, 악성 공격자에 대해 오염된 샘플에서 중위수 추정에 대한 비점근적 농도 경계를 확립하였다.
  • 중위수의 경우, 고정된 신뢰도에 대해 샘플 복잡도는 O((1/ε²) log(1/δ))로 상한이 존재하며, 오염 수준 ε에 의존한다.
  • 중위수 평균 차이(MAD)에 대해서는, 추정 가능한 두 번째 강력한 모멘트를 갖는 분포의 클래스에서 농도 결과를 도출하였다.
  • 적응된 BAI 알고리즘은 CBAI 문제에 대해 O((1/ε²) log(k/δ))의 샘플 복잡도 상한을 달성하였으며, 로그 인자 외에는 하한과 일치한다.
  • 저자들은 순수 식별에 필요한 것보다 약간 더 많은 샘플로 선택된 암의 품질 보장을 제공할 수 있음을 보였다. 특히, 그 암의 중위수 및 MAD에 대한 경계를 제공할 수 있다.
  • 정보 이론적 하한은 암의 수에 대해 로그 인자 외에는 상한과 일치하며, 제안된 알고리즘이 거의 최적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.