Skip to main content
QUICK REVIEW

[논문 리뷰] Data Poisoning Attacks in Contextual Bandits

Yuzhe Ma, Kwang-Sung Jun|arXiv (Cornell University)|2018. 08. 17.
Advanced Bandit Algorithms Research참고 문헌 16인용 수 4
한 줄 요약

이 논문은 맥락 기반 밴디트에 대한 최적화 기반 데이터 풀링 공격 프레임워크를 제안하며, 특정 맥락에서 목표 암을 선택하도록 유도하기 위해 역사를 기반으로 한 보상을 조작한다. 볼록 최적화 문제를 해결함으로써 공격자는 최소한의 부작용으로 높은 성공률를 달성하며, 특히 고차원 공간에서 뛰어난 성능을 보이며 강화학습 시스템의 심각한 보안 취약성을 드러낸다. 이는 추천 및 헬스케어 응용 분야에서 사용되는 강화학습 시스템에 해당한다.

ABSTRACT

We study offline data poisoning attacks in contextual bandits, a class of reinforcement learning problems with important applications in online recommendation and adaptive medical treatment, among others. We provide a general attack framework based on convex optimization and show that by slightly manipulating rewards in the data, an attacker can force the bandit algorithm to pull a target arm for a target contextual vector. The target arm and target contextual vector are both chosen by the attacker. That is, the attacker can hijack the behavior of a contextual bandit. We also investigate the feasibility and the side effects of such attacks, and identify future directions for defense. Experiments on both synthetic and real-world data demonstrate the efficiency of the attack algorithm.

연구 동기 및 목표

  • 온라인 추천 및 적응적 의료 치료에 널리 사용되는 맥락 기반 밴디트 시스템에서 오프라인 데이터 풀링 공격의 가능성을 탐구한다.
  • 특정 맥락에서 특정 암이 선택되도록 역사적 보상을 조작하는 일반적인 공격 프레임워크를 개발한다.
  • 특히 고차원 및 실제 세계 설정에서 이러한 공격의 부작용과 탐지 가능성에 대해 분석한다.
  • 맥락 기반 밴디트 시스템에서 공격 및 방어 기법의 향후 연구 방향을 규명한다.

제안 방법

  • 공격 프레임워크는 공격자가 역사적 보상을 수정하여 목표 맥락에 대해 목표 암을 선호하도록 추정된 매개변수 벡터를 이동시키는 볼록 최적화 문제로 공격 문제를 수립한다.
  • 공격자가 조작한 보상 값이 원래 값에서 작은 범위 내에 있도록 제약 조건을 적용한 최적화 방법을 사용하여 탐지 가능성을 최소화한다.
  • 공격자는 목표 맥락 $x^*$와 목표 암 $a^*$를 지정하고, 맥락 $x^*$가 관측될 때 밴디트 알고리즘의 정책이 $a^*$를 선택하도록 보상 변형을 해결한다.
  • 선형 맥락 기반 밴디트에서 사용하는 정규화 및 노이즈 모델을 고려하여 최적화를 수행함으로써, 표준 학습 알고리즘에서도 공격의 효과성이 유지되도록 보장한다.
  • 부작용은 테스트용 맥락 세트를 사용하여 공격로 인해 원래 정책에서 벗어나는 맥락의 비율을 측정함으로써 정량화된다.
  • 공격 성공률와 부작용을 다양한 차원, 암의 수, 사용자 빈도에서 평가하기 위해 합성 데이터와 실제 세계 데이터셋 모두에서 실험을 수행한다.

실험 결과

연구 질문

  • RQ1공격자가 맥락이나 액션을 변경하지 않고도 역사적 보상만을 풀링하여 맥락 기반 밴디트 정책을 성공적으로 악용할 수 있는가?
  • RQ2암의 수와 문제의 차원에 따라 부작용(정책이 원래와 다를 확률)은 어떻게 변화하는가?
  • RQ3고차원 설정에서 공격의 탐지 가능성은 어떠한가? 저차원 또는 실제 사용자 빈도 시나리오와 비교해 볼 때 어떻게 다른가?
  • RQ4공격을 동시에 여러 맥락을 대상으로 확장할 수 있는가? 그 경우의 과제는 무엇인가?
  • RQ5방어자는 부작용을 어떻게 활용하여 이러한 데이터 풀링 공격을 탐지할 수 있으며, 공격자는 탐지 가능성을 최소화하기 위해 어떤 전략을 사용할 수 있는가?

주요 결과

  • 공격은 실제 노이즈와 정규화 설정에서도 목표 맥락에서 목표 암이 선택되도록 높은 정확도로 성공한다.
  • 고차원 공간(예: $d=200$)에서는 부작용 비율이 0.035로 감소하여, 차원 수가 증가할수록 공격의 탐지가 상당히 어려워지는 것으로 나타났다.
  • 실제 세계 데이터에서는 사용자 빈도에 따라 부작용이 달라졌다: 고빈도 사용자에 대해선 53.91%와 50.40%였지만, 중간 빈도 사용자에 대해서는 단지 7.50%였으며, 이는 탐지 가능성의 변동성을 보여준다.
  • 암의 수($K=2, 20, 200$)에 따라 다양한 조건에서의 중앙부작용 비율은 약 0.2–0.3 수준에서 안정되어 있어 $K$ 증가에 따른 급격한 증가가 없음을 나타낸다.
  • 목표 암이 목표 맥락에서 가장 성능이 열악한 암이더라도 공격은 여전히 효과적이며, 학습 과정에 대한 강력한 제어력을 보여준다.
  • 결과는 추천 및 헬스케어와 같이 데이터 풀링이 장기적 영향을 미칠 수 있는 응용 분야에서 맥락 기반 밴디트를 기반으로 하는 실제 AI 시스템에 심각한 보안 위협을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.