Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Teaching via Environment Poisoning: Training-time Adversarial Attacks against Reinforcement Learning

Amin Rakhsha, Goran Radanović|arXiv (Cornell University)|2020. 03. 28.
Adversarial Robustness in Machine Learning인용 수 39
한 줄 요약

논문은 강화학습에서 데이터를 학습 시 poisoning 프레임워크를 개발하여 에이전트가 특정 정책을 채택하도록 하고, 보상 및 전이 역학 poisoning 하에서 오프라인 계획 및 온라인 학습 위협을 평가한다.

ABSTRACT

We study a security threat to reinforcement learning where an attacker poisons the learning environment to force the agent into executing a target policy chosen by the attacker. As a victim, we consider RL agents whose objective is to find a policy that maximizes average reward in undiscounted infinite-horizon problem settings. The attacker can manipulate the rewards or the transition dynamics in the learning environment at training-time and is interested in doing so in a stealthy manner. We propose an optimization framework for finding an \\emph{optimal stealthy attack} for different measures of attack cost. We provide sufficient technical conditions under which the attack is feasible and provide lower/upper bounds on the attack cost. We instantiate our attacks in two settings: (i) an \\emph{offline} setting where the agent is doing planning in the poisoned environment, and (ii) an \\emph{online} setting where the agent is learning a policy using a regret-minimization framework with poisoned feedback. Our results show that the attacker can easily succeed in teaching any target policy to the victim under mild conditions and highlight a significant security threat to reinforcement learning agents in practice.

연구 동기 및 목표

  • 무할인 무한 시계 간의 평균 보상을 운영하는 RL 에이전트에 대한 학습 시 poisoning 위협을 동기부여하고 형식화한다.
  • 타깃 정책을 ε-robust 최적으로 만들도록 은밀한 poisoning 전략을 구성하기 위한 최적화 기반 방법을 개발한다.
  • 오프라인 계획과 온라인 학습, 보상과 전이 역학에 대한 공격 모델을 구분한다.
  • 공격 실행 가능성과 비용에 대한 이론적 경계와 구성적 접근법 및 시뮬레이션을 제공한다.

제안 방법

  • RL을 평균 보상 MDP로 모델링하고 타깃 정책에 대해 ε-robust 최적성을 정의한다.
  • 타깃 정책을 최적화하게 만드는 보상 또는 전이 역학을 수정하는 poisoning 문제를(오프라인에서) 포맷하거나 온라인 학습자를 타깃 정책으로 유도한다.
  • 제한 조건의 복잡도를 S와 A의 선형으로 줄이기 위해 이웃 정책 기반 검증(π{s;a})을 도입한다.
  • 보상 또는 전이를 poisoned 문제의 convex/구조적 최적화 문제(P1, P3)와 비볼록 형식(P2, P4)을 도출하고 타당성을 분석한다.
  • Hajnal 측정(α)과 χ̄ 항을 사용한 공격 비용에 대한 충분 조건과 한계를 제공하고, 오프라인 결과를 온라인 샘플링 기반 공격과 연관시킨다.

실험 결과

연구 질문

  • RQ1오프라인 계획에서 선택된 목표 정책 ε-robust 최적화를 만들기 위해 공격자가 환경을 중독할 수 있는가?
  • RQ2보상이나 전이 역학을 어떻게 은밀하게 중독하여 온라인 RL 학습자를 목표 정책으로 유도하면서 공격 비용을 최소화할 수 있는가?
  • RQ3이러한 poisoning 공격의 비용에 대한 이론적 경계와 타당성을 보장하는 조건은 무엇인가?
  • RQ4오프라인 poisoning 결과가 샘플링 MDP를 사용한 실제 온라인 공격 템플릿으로 어떻게 번역되는가?
  • RQ5보상 중독과 역학 중독 간에 공격 설계에 차이가 있는가?

주요 결과

  • 공격자는 완만한 조건에서 타깃 정책을 feasibility하게 그리고 은밀하게 가르칠 수 있으며, 비용 한계가 양화된다.
  • 보상 중독을 통한 오프라인 계획 공격은 볼록 최적화(P1)를 통해 가능하고, 비용을 χ̄ 및 α와 연결하는 해를 제공한다.
  • 오프라인 역학 중독 공격은 일반적으로 비볼록한 문제(P2)로 이어지지만, 공격 비용에 대한 충분 조건과 상한/하한을 제공한다.
  • 온라인 공격은 샘플링 MDP 접근을 활용하여 평균 차이와 평균 비용을 학습자의 후회 및 χ̄ε에 연결하고 공격 설계를 안내한다.
  • 온라인 공격의 경우 샘플링 MDP가 균등성(ergodic)이고 목표 정책이 ε-robust 최적일 때 평균 차이가 o(1)에 달성 가능하다는 프레임워크를 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.