Skip to main content
QUICK REVIEW

[논문 리뷰] Provably Efficient Black-Box Action Poisoning Attacks Against Reinforcement Learning

Guanlin Liu, Lifeng Lai|arXiv (Cornell University)|2021. 10. 09.
Adversarial Robustness in Machine Learning참고 문헌 51인용 수 13
한 줄 요약

이 논문은 강화학습에서 악성 공격자가 에이전트의 행동을 조작하여 목표 정책을 강제하는 행동 품질 오염 공격을 소개한다. 공격자가 환경 또는 에이전트 알고리즘에 대한 사전 지식이 없더라도, 하위선형 비용과 손실로 어떤 효율적인 강화학습 에이전트도 공격자의 정책을 따르도록 유도할 수 있는 LCB-H 블랙박스 공격 전략을 제안한다.

ABSTRACT

Due to the broad range of applications of reinforcement learning (RL), understanding the effects of adversarial attacks against RL model is essential for the safe applications of this model. Prior theoretical works on adversarial attacks against RL mainly focus on either observation poisoning attacks or environment poisoning attacks. In this paper, we introduce a new class of attacks named action poisoning attacks, where an adversary can change the action signal selected by the agent. Compared with existing attack models, the attacker's ability in the proposed action poisoning attack model is more restricted, which brings some design challenges. We study the action poisoning attack in both white-box and black-box settings. We introduce an adaptive attack scheme called LCB-H, which works for most RL agents in the black-box setting. We prove that the LCB-H attack can force any efficient RL agent, whose dynamic regret scales sublinearly with the total number of steps taken, to choose actions according to a policy selected by the attacker very frequently, with only sublinear cost. In addition, we apply LCB-H attack against a popular model-free RL algorithm: UCB-H. We show that, even in the black-box setting, by spending only logarithm cost, the proposed LCB-H attack scheme can force the UCB-H agent to choose actions according to the policy selected by the attacker very frequently.

연구 동기 및 목표

  • 에이전트의 관측값이나 환경 동역학이 아닌 행동을 조작하는 행동 품질 오염 공격의 타당성과 영향력을 조사한다.
  • 특히 에이전트의 내부 모델이나 환경 구조에 접근할 수 없는 제한된 공격자 능력 하에서 효과적인 공격을 설계하는 과제를 해결한다.
  • 비용(행동 조작 횟수)과 손실(목표 정책에서의 이탈 횟수)을 모두 최소화하는 증명 가능한 효율성의 블랙박스 공격 전략을 개발한다.
  • 제한된 정보가 존재하더라도 공격자가 하위선형 비용과 손실로 강화학습 에이전트가 원하는 정책을 채택하도록 유도할 수 있음을 입증한다. 이는 실용적 타당성을 보장한다.

제안 방법

  • 악성 공격자가 실시간으로 에이전트가 선택한 행동을 조작하여 사전 정의된 목표 정책으로 유도하는 새로운 공격 모델인 행동 품질 오염을 제안한다.
  • 상한 신뢰도(UCB) 원리를 활용해 행동 품질을 추정하고 최소한의 비용으로 행동을 선택적으로 조작하는 블랙박스 방법인 LCB-H 공격 전략을 도입한다.
  • 비용-손실 트레이드오프 프레임워크를 사용하며, 비용은 행동 변경 횟수이고 손실은 에이전트가 목표 정책에서 이탈한 횟수이다.
  • 동적 정규화와 하위선형 스케일링 기반의 이론적 분석을 통해 LCB-H가 동적 정규화가 하위선형으로 증가하는 어떤 효율적인 강화학습 에이전트에 대해서도 하위선형 비용과 손실을 달성함을 증명한다.
  • LCB-H 전략을 UCB-H 알고리즘에 적용하여, 목표 정책를 따르도록 유도하기 위해 로그 비용만으로도 충분함을 보여준다.
  • 확률적 농도 경계와 정규화 분해 기법을 활용해 손실과 비용에 대한 상한을 유도하며, 불확실성 하에서 이론적 보장을 확보한다.

실험 결과

연구 질문

  • RQ1공격자가 환경이나 에이전트에 대한 사전 지식이 없더라도, 블랙박스 환경에서 강화학습 에이전트의 행동을 효과적으로 조작하여 목표 정책을 강제할 수 있는가?
  • RQ2행동 품질 오염 공격의 이론적 비용과 손실 트레이드오프는 무엇이며, 두 지표 모두 하위선형 스케일링을 달성할 수 있는가?
  • RQ3LCB-H 공격 전략은 화이트박스 공격 방법에 비해 성능과 효율성 측면에서 어떻게 비교되는가?
  • RQ4LCB-H 공격 전략은 UCB-H와 같은 특정 모델-프리 강화학습 알고리즘에 대해 증명 가능한 보장을 통해 작동함을 입증할 수 있는가?
  • RQ5행동 공간이 이산적이고 유한할 경우 행동 품질 오염 공격의 근본적인 제약는 무엇인가?

주요 결과

  • LCB-H 블랙박스 공격 전략은 동적 정규화가 단계 수에 대해 하위선형으로 증가하는 어떤 효율적인 강화학습 에이전트에 대해서도 하위선형 비용과 하위선형 손실을 달성한다.
  • UCB-H 알고리즘에 대해 LCB-H 공격은 로그 비용만으로도 에이전트가 공격자의 목표 정책을 따르도록 강제하며, 높은 효율성을 보여준다.
  • 이론적 분석을 통해 LCB-H 공격의 손실과 비용이 O(H^5 log(2H/p) + 1/Δ_min SAH^4 + 1/Δ_min^2 H^10 SAι)로 스케일링됨을 입증하여 하위선형 성장을 확인한다.
  • 에이전트의 정책, 환경 동역학, 내부 모델에 접근할 수 없더라도 공격이 증명 가능하게 효과적이며, 현실적인 블랙박스 시나리오에 적용 가능하다.
  • LCB-H 전략은 화이트박스 α-포트션 공격의 성능에 거의 근접함을 입증하여, 제한된 정보에도 불구하고 효과적임을 확인한다.
  • 이 연구는 행동 품질 오염 공격가 강화학습에서 제한된 공격자 능력 하에서도 실현 가능하고 강력한 위협 벡터임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.