Skip to main content
QUICK REVIEW

[논문 리뷰] Who Is the Strongest Enemy? Towards Optimal and Efficient Evasion Attacks in Deep RL

Yanchao Sun, Ruijie Zheng|arXiv (Cornell University)|2021. 06. 09.
Adversarial Robustness in Machine Learning참고 문헌 29인용 수 15
한 줄 요약

이 논문은 강화학습 기반의 최적의 오용 공격자를 찾기 위해 정책 변형과 상태 수준의 적대적 공격을 동시에 최적화하는 새로운 협업 프레임워크 PA-AD를 제안한다. 정책 적대자 MDP(PAMDP)와 디렉터-액터 아키텍처를 도입함으로써, 이전의 RL 기반 방법보다 이론적 최적성과 훨씬 높은 효율성을 달성하며, Atari 및 MuJoCo 환경 전반에서 최첨단 공격 성능을 뛰어넘고, 적대적 훈련을 통해 최첨단의 강건성을 실현한다.

ABSTRACT

Evaluating the worst-case performance of a reinforcement learning (RL) agent under the strongest/optimal adversarial perturbations on state observations (within some constraints) is crucial for understanding the robustness of RL agents. However, finding the optimal adversary is challenging, in terms of both whether we can find the optimal attack and how efficiently we can find it. Existing works on adversarial RL either use heuristics-based methods that may not find the strongest adversary, or directly train an RL-based adversary by treating the agent as a part of the environment, which can find the optimal adversary but may become intractable in a large state space. This paper introduces a novel attacking method to find the optimal attacks through collaboration between a designed function named "actor" and an RL-based learner named "director". The actor crafts state perturbations for a given policy perturbation direction, and the director learns to propose the best policy perturbation directions. Our proposed algorithm, PA-AD, is theoretically optimal and significantly more efficient than prior RL-based works in environments with large state spaces. Empirical results show that our proposed PA-AD universally outperforms state-of-the-art attacking methods in various Atari and MuJoCo environments. By applying PA-AD to adversarial training, we achieve state-of-the-art empirical robustness in multiple tasks under strong adversaries. The codebase is released at https://github.com/umd-huang-lab/paad_adv_rl.

연구 동기 및 목표

  • 제한된 제약 조건 하에서 DRL 에이전트의 가장 강력하고 최적의 적대적 변형을 찾는 문제를 해결하기 위해.
  • 고차원 상태 공간에서 직접적인 RL 기반 적대자들이 효율성이 떨어지는 문제를 해결하기 위해.
  • 계산 부담을 줄이며 이론적 최적성을 달성하는 방법을 개발하기 위해.
  • 제안된 공격을 활용한 효과적인 적대적 훈련을 통해 DRL 에이전트의 강건성을 향상시키기 위해.

제안 방법

  • 최적의 정책이 가장 강력한 상태 수준의 적대자로 이어지는 정책 적대자 MDP(PAMDP)를 도입한다.
  • 협업형 이중 에이전트 프레임워크를 활용: '디렉터'는 최적의 정책 변형 방향을 학습하고, '액터'는 해당하는 상태 변형을 생성한다.
  • 기존의 RL 알고리즘을 활용해 PAMDP에서 디렉터를 훈련함으로써, 전체 상태공간 적대자에 비해 크기와 탐색 부담을 크게 줄인다.
  • 액터는 정책 변형 방향을 상태공간 변형으로 매핑하여 효율적이고 타겟된 공격 생성을 가능하게 한다.
  • 이 방법은 결정론적 및 확률적 정책, 벡터 기반 및 픽셀 기반 관측, 이산 및 연속적 행동 공간에 모두 일반화 가능하다.
  • 이론적 분석을 통해 PAMDP에서의 최적 정책이 주어진 공격 예산 ε 하에서 최적의 상태 적대자를 유도함을 증명한다.

실험 결과

연구 질문

  • RQ1제한된 변형 예산 하에서 히우리스틱 또는 부분 최적 방법에 의존하지 않고, DRL 에이전트에 대한 최적의 오용 적대자 공격자를 찾을 수 있는가?
  • RQ2직접적인 RL 기반 적대자가 비현실적이게 되는 고차원 상태 공간에서 가장 강력한 적대자를 효율적으로 탐색할 수 있는가?
  • RQ3최적의 정책 변형 탐색을 직접적인 상태공간 최적화에서 분리하여 계산 복잡도를 줄일 수 있는가?
  • RQ4협업형 디렉터-액터 프레임워크는 기존 방법보다 더 뛰어난 공격 성능과 강건성 향상을 가능하게 하는가?

주요 결과

  • PA-AD는 다양한 Atari 및 MuJoCo 환경에서 최첨단 공격 방법을 항상 능가하며, 더 작은 공격 예산으로도 뛰어난 공격 성공률을 달성한다.
  • Pong 및 LunarLander와 같은 환경에서는 l∞ 변형 반경 0.005로 100% 타겟 공격 성공률를 기록하며, CIFAR-10에서 훈련된 이미지 분류기보다도 뛰어나다.
  • 이전 연구 대비 공격자의 RL 문제 크기를 줄여 고차원 상태공간에서도 효율적인 학습이 가능하게 한다.
  • PA-AD를 활용한 적대적 훈련은 여러 DRL 과제에서 최첨단의 경험적 강건성을 달성하며, 에이전트의 내성적 저항력을 향상시키는 데서 이 방법의 효과성을 입증한다.
  • 특히 큰 상태공간에서 이전의 RL 기반 적대자보다 훨씬 더 효율적이면서도 이론적 최적성을 유지한다.
  • 이 프레임워크는 이산 및 연속적 행동 공간, 벡터 기반 및 픽셀 기반 관측 모두에 일반화 가능하여 광범위하게 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.