[논문 리뷰] Adaptive Reward-Poisoning Attacks against Reinforcement Learning
논문은 강화학습(RL)에 대한 보상 독살 공격을 형식화하고, L-무한대(ε) 교란 하에서 이러한 공격이 실행 가능하거나 실행 불가능한지를 증명하며, 다항 시간 내에 목표 정책을 달성하는 빠른 적응형 공격을 제시하고, 경험적 DRL 기반 공격 방법을 제시한다.
In reward-poisoning attacks against reinforcement learning (RL), an attacker can perturb the environment reward $r_t$ into $r_t+δ_t$ at each step, with the goal of forcing the RL agent to learn a nefarious policy. We categorize such attacks by the infinity-norm constraint on $δ_t$: We provide a lower threshold below which reward-poisoning attack is infeasible and RL is certified to be safe; we provide a corresponding upper threshold above which the attack is feasible. Feasible attacks can be further categorized as non-adaptive where $δ_t$ depends only on $(s_t,a_t, s_{t+1})$, or adaptive where $δ_t$ depends further on the RL agent's learning process at time $t$. Non-adaptive attacks have been the focus of prior works. However, we show that under mild conditions, adaptive attacks can achieve the nefarious policy in steps polynomial in state-space size $|S|$, whereas non-adaptive attacks require exponential steps. We provide a constructive proof that a Fast Adaptive Attack strategy achieves the polynomial rate. Finally, we show that empirically an attacker can find effective reward-poisoning attacks using state-of-the-art deep RL techniques.
연구 동기 및 목표
- attacker에 의해 보상이 교란되는 RL의 학습 시점 보상 poisoning 연구를 동기 부여한다.
- perturbation의 무한수(norm) 제약 하에서 보상 독살의 실행 가능성 영역을 특성화한다.
- 비적응적 및 빠른 적응형 공격 전략을 모두 개발하고 그 비용을 상한으로 제시한다.
- 딥 RL 기법을 활용한 공격자들이 효과적인 보상 독살 공격을 발견할 수 있음을 실증적 근거로 제시한다.
제안 방법
- 환경 MDP, Q-learning를 사용하는 학습 에이전트, 보상에 대한 제약된 변동 delta_t를 가진 공격자 간의 추론으로 공격을 모델링한다.
- 타깃 정책 집합 pi^dagger와 이에 대응하는 타깃 Q-테이블 집합 Q^dagger를 정의하여 공격 목표를 형식화한다.
- 공격 하에서 Q-learning의 경계성(boundednes) 결과를 입증하고 비적응적 공격에 대한 불가능성 증명서 Delta_1 및 Delta_2와 가능성 증명서 Delta_3를 도출한다.
- 빠른 적응형 공격(Fast Adaptive Attack, FAA)을 도입하여 Q_t를 사용하고 타깃 상태로의 탐색을 통해 다항 시간 내 공격 비용을 달성한다(특정 희소성 및 Delta 조건 하에서).
- 적응형 공격 정책 phi^xi_FAA를 제시하고 그 비용 상한(정리 5)과 격자형 환경에 대한 보조정리를 분석한다.
- RL 실험을 통해 적응형 공격이 비적응형 공격보다 효과적임을 보여주고, DRL이 효과적인 공격 정책(TD3 기반)을 발견할 수 있음을 입증한다.
실험 결과
연구 질문
- RQ1어떤 L-무한대 보상 교란 델타 Delta에서 보상 독살이 실행 가능하거나 목표 정책을 강제하는 것이 불가능한가?
- RQ2비적응적 대 적응형 공격 전략이 공격 비용 및 pi^dagger를 강제하는 시간 측면에서 어떻게 비교되는가?
- RQ3적응형 공격이 목표 정책의 다항 시간 강제를 달성할 수 있는가, 그리고 필요한 구조적 가정은 무엇인가(예: 목표 상태의 희소성 등)?
- RQ4데이터 기반 방법(예: 딥 RL)이 분석적으로 구성된 공격을 넘어 효과적인 보상 독살 전략을 발견할 수 있는가?
- RQ5보상 독살 하에서 안전한 RL 동작을 보장하는 강건성 증명서는 무엇인가?
주요 결과
- Delta 임계값 Delta_1, Delta_2 이하에서는 RL 에이전트가 안전하게 남아 최적 정책으로 수렴한다.
- Delta_3 이상의 더 높은 임계값이 존재하여 비적응적 공격이 목표 정책을 실행 가능하게 강제할 수 있으며, 공격 비용은 O(L^5)로 상한된다(L은 커버링 수).
- 빠른 적응형 공격(FAA)은 희소한 목표 상태에 대해서 타깃 정책의 다항 시간 강제를 달성하며, 비용 상한은 상태 공간 크기 |S| 및 기타 요인에 따라 다항적으로 확장된다.
- 실험은 적응형 공격(FAA)이 비적응형 공격에 비해 효율성 면에서 상당한 우수성을 보이고, 딥 RL(TD3)이 효과적인 공격 정책을 발견할 수 있음을 보여준다.
- 체인 MDP 및 격자 환경에 대한 실험은 적응 방법의 다항 시간 공격 비용을 보여주고, 비적응 방법은 지수적으로 확장됨을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.