Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Linear Bandits Robust to Adversarial Attacks

Ilija Bogunovic, Arpan Losalka|arXiv (Cornell University)|2020. 07. 07.
Advanced Bandit Algorithms Research참고 문헌 26인용 수 7
한 줄 요약

이 논문은 적대적 손상이 있는 조건 하에서 스토하스틱 선형 밴디트 문제를 위한 두 가지 강건한 단계별 제거 알고리즘을 제안한다. 하나의 변종은 손상 예산 $C$를 알고 있으며, 다른 하나는 그렇지 않다. 둘 다 손상이 없는 경우 near-optimal regret을 달성하며, 각각 $C$에 대해 선형 및 이차 종속성을 보이는 추가적 regret 항을 유발한다. 이러한 항들은 알고리즘에 독립적인 하한을 통해 near-optimal임이 입증된다.

ABSTRACT

We consider a stochastic linear bandit problem in which the rewards are not only subject to random noise, but also adversarial attacks subject to a suitable budget $C$ (i.e., an upper bound on the sum of corruption magnitudes across the time horizon). We provide two variants of a Robust Phased Elimination algorithm, one that knows $C$ and one that does not. Both variants are shown to attain near-optimal regret in the non-corrupted case $C = 0$, while incurring additional additive terms respectively having a linear and quadratic dependency on $C$ in general. We present algorithm independent lower bounds showing that these additive terms are near-optimal. In addition, in a contextual setting, we revisit a setup of diverse contexts, and show that a simple greedy algorithm is provably robust with a near-optimal additive regret term, despite performing no explicit exploration and not knowing $C$.

연구 동기 및 목표

  • 스토하스틱 선형 밴디트 문제에 대한 적대적 손상 하에서의 이해 부족을 메우기 위한 것, 특히 이전에 강건성 보장을 제공하지 못하는 설정에서의 문제 해결.
  • 손상이 없는 경우($C=0$) near-optimal regret을 유지하면서도 적대적 공격 하에서 점진적으로 성능이 떨어지는 알고리즘 개발.
  • 손상 예산 $C$에 대한 명시적 종속성을 포함한 날카로운 regret 하한 설정, 특히 $C$의 값이 알려져 있는지 여부에 따라 구분.
  • 다양한 컨텍스트 하에서의 컨텍스트 기반 선형 밴디트 문제 재고 및 단순한 그레디 알고리즘이 명시적 탐색이나 $C$ 지식 없이도 증명 가능한 강건성을 확보할 수 있음을 보여줌.

제안 방법

  • 손상 가능성을 고려해 확장된 신뢰 구간을 사용하는 강건한 단계별 제거 알고리즘 제안.
  • 두 가지 변종 도입: 하나는 $C$를 알고 있으며 이를 통해 신뢰 구간을 校정하고, 다른 하나는 사전 지식 없이 $C$를 적응적으로 추정함.
  • 손상에 대응하는 보정된 신뢰 구간 기반으로 부적절한 암호를 체계적으로 제거하는 단계별 제거 전략 활용.
  • 적대적 손상 하에서 추정된 파라미터 벡터의 고확률 농도 하한 유도로 악성 공격에 대한 강건성 확보.
  • 신규 분석 프레임워크를 사용해 regret을 스토하스틱 및 적대적 성분으로 분해하고, 손상에 기인한 추가 항을 분리.
  • 다양한 컨텍스트 하에서의 컨텍스트 기반 선형 밴디트 설정 재고 및 그레디 알고리즘이 명시적 탐색이나 $C$ 의존 없이 near-optimal regret 달성 가능함을 증명.

실험 결과

연구 질문

  • RQ1손상 예산 $C$ 가 제한된 적대적 공격 하에서 보상이 손상될 경우에도 near-optimal regret을 유지하는 스토하스틱 선형 밴디트 알고리즘을 설계할 수 있는가?
  • RQ2만약 $C$ 가 알려져 있거나 알려지지 않은 경우, regret이 $C$ 에 대해 최적의 종속성(선형 또는 곱셈적)을 가지는가?
  • RQ3컨텍스트 다양성이 있는 조건 하에서, 명시적 탐색이나 $C$ 지식 없이도 컨텍스트 기반 선형 밴디트에서 강건성을 달성할 수 있는가?
  • RQ4적대적 손상 하에서 기존 알고리즘과 비교해 제안된 알고리즘의 regret 하한은 어떻게 되는가?
  • RQ5제안된 $C$ 에 대한 추가적 regret 항이 near-optimal임을 입증하기 위해 알고리즘에 독립적인 하한을 도출할 수 있는가?

주요 결과

  • 알려진 $C$ 를 사용하는 제안된 알고리즘은 $C$ 에 대해 선형 종속성을 보이는 regret을 달성하며, 알고리즘에 독립적인 하한을 통해 near-optimal임이 입증됨.
  • 알려지지 않은 $C$ 를 사용하는 알고리즘은 $C$ 에 대해 이차 종속성을 보이는 regret을 유발하며, 이 종속성 역시 near-optimal임이 입증됨.
  • 손상이 없는 경우($C=0$) 둘 다 near-optimal regret 스케일링을 달성하며, 기존 스토하스틱 선형 밴디트의 최고 수준의 하한과 일치함.
  • 컨텍스트 다양성이 있는 컨텍스트 기반 선형 밴디트에서, 단순한 그레디 알고리즘이 명시적 탐색이나 $C$ 지식 없이도 near-optimal regret을 달성하며, $C$ 에 대한 추가 항을 포함함.
  • 논문은 $C$ 에 대한 추가적 regret 항이 로그 인자 수준까지 최적임을 입증하며, 추가적 vs. 곱셈적 종속성에 대한 열린 문제를 해결함.
  • 결과적으로, 명시적 탐색 메커니즘이 없더라도 선형 밴디트에서 적대적 손상에 대한 강건성이 최소한의 알고리즘 오버헤드로 달성 가능함을 보여줌.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.