[논문 리뷰] Optimal Attacks on Reinforcement Learning Policies
이 논문은 에이전트의 누적 보상 최소화를 목표로 하여 강화학습 정책에 대한 최적의 블랙박스 적대적 공격을 제안한다. 이를 위해 공격를 마르코프 결정 과정(MDP)으로 공식화한다. DDPG와 동작 공간 정규화를 사용하여, 특히 이산 동작 공간에서 기울기 기반 공격(예: FGSM)보다 뛰어난 성능을 보이며, 더 부드럽고(Lipschitz) 연속적인 정책이 공격에 더 저항성이 있음을 입증한다.
Control policies, trained using the Deep Reinforcement Learning, have been recently shown to be vulnerable to adversarial attacks introducing even very small perturbations to the policy input. The attacks proposed so far have been designed using heuristics, and build on existing adversarial example crafting techniques used to dupe classifiers in supervised learning. In contrast, this paper investigates the problem of devising optimal attacks, depending on a well-defined attacker's objective, e.g., to minimize the main agent average reward. When the policy and the system dynamics, as well as rewards, are known to the attacker, a scenario referred to as a white-box attack, designing optimal attacks amounts to solving a Markov Decision Process. For what we call black-box attacks, where neither the policy nor the system is known, optimal attacks can be trained using Reinforcement Learning techniques. Through numerical experiments, we demonstrate the efficiency of our attacks compared to existing attacks (usually based on Gradient methods). We further quantify the potential impact of attacks and establish its connection to the smoothness of the policy under attack. Smooth policies are naturally less prone to attacks (this explains why Lipschitz policies, with respect to the state, are more resilient). Finally, we show that from the main agent perspective, the system uncertainties and the attacker can be modeled as a Partially Observable Markov Decision Process. We actually demonstrate that using Reinforcement Learning techniques tailored to POMDP (e.g. using Recurrent Neural Networks) leads to more resilient policies.
연구 동기 및 목표
- 정책과 환경 동역학이 알려진 경우, 에이전트의 평균 보상을 명시적으로 최소화하는 최적의 적대적 공격을 개발하는 것.
- 공격자가 정책이나 환경 동역학에 접근할 수 없고, 관측 가능한 상태와 보상만을 알 수 있는 블랙박스 공격의 과제를 다루는 것.
- 특히 리프시츠 연속성으로 측정되는 정책의 부드러움이 적대적 편향에 대한 취약도에 어떤 영향을 미치는지 조사하는 것.
- 부분 관측 가능 MDP(POMDP)에 적합한 방법(예: 순환 신경망)을 사용해 에이전트를 훈련시키면, 적대적 공격에 대한 저항성이 향상되는지 탐색하는 것.
- 다양한 OpenAI Gym 환경에서 이산 및 연속 동작 공간을 모두 포함하여 제안된 공격 프레임워크의 효과성을 검증하는 것.
제안 방법
- 공격자의 목적이 에이전트의 누적 수익을 최소화하도록 맞춘 커스터마이즈된 보상 함수를 포함한 마르코프 결정 과정(MDP)으로 최적의 공격를 공식화한다.
- 화이트박스 공격의 경우, 히우리스틱 방법(예: FGSM)에 의존하지 않고 MDP 내에서 탐색을 향상시키기 위해 기울기 기반 최적화를 사용한다.
- 블랙박스 공격의 경우, 대규모 연속 동작 공간(입력 편향을 나타냄)을 처리할 수 있도록 조정된 딥 디터미니스틱 정책 기반(DDPG)을 사용해 공격자의 정책을 훈련시킨다.
- 편향을 유한한 $ε$-공내에 제약하는 동작 공간 정규화를 DDPG에 적용하여 현실적이고 타겟된 공격를 보장한다.
- Pong과 같은 이미지 기반 환경에서는 공격을 수행하기 위해 공백, 볼, 패드의 위치를 포함한 4차원 특징 벡터를 추출하고, 계산 비용을 줄이고 해석 가능성을 높이기 위해 특징 공간에서 직접 공격를 적용한다.
- 에이전트의 관점에서 공격자의 영향을 POMDP로 모델링하여, 메모리 증강 정책(예: DRQN)을 사용해 저항성을 향상시키는 데 정당성을 부여한다.
실험 결과
연구 질문
- RQ1정책과 환경 동역학이 알려진 경우(화이트박스 케이스), 최적의 적대적 공격를 마르코프 결정 과정(MDP)으로 공식화할 수 있는가?
- RQ2정책이나 동역학에 접근할 수 없고, 상태와 보상만 관측 가능한 블랙박스 환경에서 최적의 공격를 어떻게 훈련시킬 수 있는가?
- RQ3리프시츠 연속성으로 측정되는 정책의 부드러움은 적대적 편향에 대한 저항성에 어느 정도의 영향을 미치는가?
- RQ4POMDP 인식 훈련 방법(예: 순환 신경망)을 사용해 에이전트를 훈련시키면, 적대적 공격에 대한 저항성이 향상되는가?
- RQ5다양한 환경과 동작 공간 유형에서 최적의 공격 성능는 표준 기울기 기반 방법(FGSM)과 비교해 어떻게 다른가?
주요 결과
- DDPG를 통해 훈련된 제안된 최적의 공격는 기울기 기반 공격(FGSM)보다 일관되게 뛰어난 성능을 보이며, 이산 MountainCar 환경에서 $ε=0.07$일 때 에이전트 성능을 최대 30%까지 감소시켰다.
- 연속 MountainCar 환경에서는 $ε=0.07$일 때 13%의 성능 손실을 기록하여, 작은 편향에 대해 연속 동작 공간이 본질적으로 더 저항성이 있음을 시사한다.
- Pong에 적용된 공격는 4차원 특징 공간에서 수행되었으며, 500개의 훈련 에피소드 내에 에이전트의 평균 보상을 최대에서 근접 최소값(-20)으로 감소시켜, 매우 낮은 편향($ε=0.013$)으로도 높은 효과성을 입증했다.
- 이론적 분석을 통해 공격의 최대 피해는 정책의 리프시츠 상수로 상한선이 존재함을 보이며, 이는 더 부드러운 정책이 더 견고한 이유를 설명한다.
- 메모리 메커니즘을 사용해 훈련된 정책(예: DRQN)은 더 큰 저항성을 보이며, POMDP 모델링이 적대적 불확실성 하에서 저항성을 향상시킨다는 것을 확인한다.
- 표준 기울기 기반 공격는 최적임을 확인하며, 이는 제안된 MDP 기반 접근과 달리 궤적을 거쳐 에이전트의 누적 보상을 명시적으로 최소화하지 않기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.