Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Stochastic Linear Contextual Bandits Under Adversarial Attacks

Qin Ding, Cho‐Jui Hsieh|arXiv (Cornell University)|2021. 06. 05.
Advanced Bandit Algorithms Research참고 문헌 20인용 수 4
한 줄 요약

이 논문은 보상과 컨텍스트 양쪽에 대해 완전히 적응형이며 통찰력 있는 적대적 공격을 받는 상황에서도 공격 예산이나 공격 형태에 대한 사전 지식 없이 부분선형 잔차를 달성하는 최초의 강건한 확률적 선형 컨텍스추얼 밴딧 알고리즘을 제안한다. 이 방법은 동적 탐색 조정 기능을 갖춘 이중층 밴딧 구조를 사용하여 시뮬레이션 및 Movielens, Netflix와 같은 실세계 데이터셋에서 Garcelon 및 Oracle 공격 하에서 LinUCB, LinTS 및 Greedy 기준선보다 강력한 성능을 보인다.

ABSTRACT

Stochastic linear contextual bandit algorithms have substantial applications in practice, such as recommender systems, online advertising, clinical trials, etc. Recent works show that optimal bandit algorithms are vulnerable to adversarial attacks and can fail completely in the presence of attacks. Existing robust bandit algorithms only work for the non-contextual setting under the attack of rewards and cannot improve the robustness in the general and popular contextual bandit environment. In addition, none of the existing methods can defend against attacked context. In this work, we provide the first robust bandit algorithm for stochastic linear contextual bandit setting under a fully adaptive and omniscient attack with sub-linear regret. Our algorithm not only works under the attack of rewards, but also under attacked context. Moreover, it does not need any information about the attack budget or the particular form of the attack. We provide theoretical guarantees for our proposed algorithm and show by experiments that our proposed algorithm improves the robustness against various kinds of popular attacks.

연구 동기 및 목표

  • 보상과 컨텍스트가 모두 조작되는 상황에서 확률적 선형 컨텍스추얼 밴딧 알고리즘이 취약한 점을 해결하기 위해.
  • 플레이어의 결정을 실시간으로 관찰하는 완전히 적응형이자 통찰력 있는 공격자에 대해 부분선형 잔차를 유지할 수 있는 방법을 개발하기 위해.
  • 공격 예산이나 공격 패턴에 대한 지식이 필요 없도록 알고리즘을 설계하여 일반적인 컨텍스추얼 밴딧 설정에 적용 가능하게 하기 위해.
  • 기존에 다루지 않은 과제인 보상 오염 외에도 컨텍스트 조작까지 강건성을 확장하기 위해.
  • 실세계 추천 데이터에서 다양한 유형의 공격에 대해 LinUCB, LinTS 및 Greedy 방법과의 비교를 통해 알고리즘의 우수성을 실증적으로 검증하기 위해.

제안 방법

  • 상위층에 EXP3를 사용하는 이중층 밴딧 아키텍처를 제안하며, 하위층의 LinUCB 레이어에 대해 탐색 파라미터 C'를 동적으로 선택한다.
  • EXP3 레이어는 매 라운드마다 이전 라운드의 즉각적인 피드백에 기반해 C'를 선택하여 에포크 기반 재시작을 피함으로써 역사적 정보를 유지한다.
  • C'에 따라 변하는 확대된 탐색 파라미터를 갖춘 수정된 LinUCB 알고리즘을 도입하여 적대적 공격에 대한 강건성을 확보한다.
  • 이론적 분석을 통해 Õ(d^{1/2}(C+1)T^{3/4}) + Õ(d^{3/2}CT^{1/4})의 잔차 경계를 도출하였으며, 이는 유한한 공격 예산 C 하에서 부분선형이다.
  • 이론적 보장이 없는 실무에서 더 우수한 성능을 보이는 재시작이 없는 BOB-No-Restart의 변형을 통해 방법을 실증 평가한다.
  • 실세계 데이터셋(Movielens, Netflix)을 사용하며, 행렬 분해로부터 유도된 특징 벡터를 활용해 현실적인 컨텍스추얼 밴딧 환경을 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1보상과 컨텍스트 양쪽에 대해 완전히 적응형이며 통찰력 있는 공격을 받는 상황에서, 확률적 선형 컨텍스추얼 밴딧 알고리즘이 부분선형 잔차를 달성할 수 있는가?
  • RQ2공격 예산이나 공격 패턴에 대한 사전 지식 없이도 강건한 알고리즘을 설계할 수 있는가?
  • RQ3보상 및 컨텍스트 공격 하에서 제안된 알고리즘의 성능은 LinUCB, LinTS 및 Greedy와 비교해 어떻게 되는가?
  • RQ4재시작이 없는 변형인 BOB-No-Restart는 이론적 보장이 없음에도 불구하고 실증적으로 더 뛰어난 강건성을 달성할 수 있는가?
  • RQ5강건한 컨텍스추얼 밴딧의 잔차 경계에서 공격 예산 C와 시간 영역 T 사이의 이론적 상충 관계는 어떠한가?

주요 결과

  • 제안된 RobustBandit 알고리즘은 보상과 컨텍스트 양쪽에 대해 적대적 공격 상황에서도 Õ(d^{1/2}(C+1)T^{3/4}) + Õ(d^{3/2}CT^{1/4})의 부분선형 잔차를 달성한다.
  • Garcelon 및 Oracle 공격 하에서 시뮬레이션, Movielens 및 Netflix 데이터셋에서 LinUCB, LinTS 및 Greedy 기준선 대비 누적 잔차 측면에서 모두 성능이 뛰어나다.
  • 재시작이 없는 변형인 BOB-No-Restart는 이론적으로 보장된 RobustBandit보다도 실증적으로 훨씬 뛰어난 강건성을 확보한다.
  • 전통적인 LinUCB는 공격 예산 C가 Ω(log T)일 경우 선형 잔차를 보이며, 이는 표준 알고리즘이 공격 하에서 취약함을 보여준다.
  • 이 방법은 공격 예산이나 공격 형태 정보 없이 일반적인 컨텍스추얼 밴딧 설정에서 보상과 컨텍스트 양쪽 공격에 대비하는 최초의 방법이다.
  • 실험 결과는 공격자가 암호화된 상위 반의 액션을 표적으로 삼더라도 알고리즘이 강건한 성능을 유지함을 확인하였으며, 이는 전략적이고 적응형 공격에 대한 강력한 내성성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.