Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Deep Reinforcement Learning through Adversarial Loss

Tuomas Oikarinen, Tsui-Wei Weng|arXiv (Cornell University)|2020. 08. 05.
Adversarial Robustness in Machine Learning참고 문헌 43인용 수 15
한 줄 요약

이 논문은 강화학습의 적대적 방어성 향상을 위해 안정성 검증 경계에서 유도된 적대적 손실 함수를 활용하는 강건한 딥 강화학습 프레임워크 RADIAL-RL을 제안한다. 이는 DQN, A3C, PPO 에이전트가 이전 방법보다 최대 5배 더 강한 펌업을 견딜 수 있도록 하면서도 학습에 있어 2–10배 더 빠른 계산 효율성을 제공한다. 또한 최악의 성능을 효율적으로 측정할 수 있는 새로운 평가 지표인 Greedy Worst-Case Reward (GWC)를 도입하여, 최악의 상황에서의 성능을 보다 빠르게 추정한다.

ABSTRACT

Recent studies have shown that deep reinforcement learning agents are vulnerable to small adversarial perturbations on the agent's inputs, which raises concerns about deploying such agents in the real world. To address this issue, we propose RADIAL-RL, a principled framework to train reinforcement learning agents with improved robustness against $l_p$-norm bounded adversarial attacks. Our framework is compatible with popular deep reinforcement learning algorithms and we demonstrate its performance with deep Q-learning, A3C and PPO. We experiment on three deep RL benchmarks (Atari, MuJoCo and ProcGen) to show the effectiveness of our robust training algorithm. Our RADIAL-RL agents consistently outperform prior methods when tested against attacks of varying strength and are more computationally efficient to train. In addition, we propose a new evaluation method called Greedy Worst-Case Reward (GWC) to measure attack agnostic robustness of deep RL agents. We show that GWC can be evaluated efficiently and is a good estimate of the reward under the worst possible sequence of adversarial attacks. All code used for our experiments is available at https://github.com/tuomaso/radial_rl_v2.

연구 동기 및 목표

  • 관측 공간에서 작은, 눈에 띄지 않는 적대적 펌업에 취약한 딥 강화학습 에이전트의 문제를 해결하기 위해.
  • DQN, A3C, PPO와 같은 인기 있는 딥 강화학습 알고리즘과 호환되는 일반화 가능하고 효율적인 방어 프레임워크를 개발하기 위해.
  • 청정 환경에서의 샘플 효율성이나 성능을 희생시키지 않고 ℓp-노름으로 제한된 적대적 공격에 대한 강건성을 향상시키기 위해.
  • 적대적 입력 펌업에 대한 최악의 성능을 효율적으로 추정할 수 있는 새로운 평가 지표인 Greedy Worst-Case Reward (GWC)를 도입하기 위해.
  • 강건한 학습이 새로운 환경, 예를 들어 ProcGen 벤치마크에서의 일반화 능력을 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 에이전트가 ℓp-노름으로 제한된 적대적 펌용에 강건하도록 하기 위해, 안정성 검증 경계를 손실 함수에 통합한다.
  • 학습 중에 최악의 행동 시퀀스에 대한 미분 가능한 근사치를 사용하여 적대적 손실을 계산함으로써, 엔드 투 엔드 최적화를 가능하게 한다.
  • 최대한 강력한 펌용을 ε-한계 내에서 시뮬레이션하는 이중 최적화 과정을 통해 적대적 손실을 계산한다.
  • 기존의 딥 강화학습 알고리즘과 호환되며, 아키텍처의 최소한의 변경으로 적용 가능하다.
  • 최악의 성능을 선형 시간 내에 추정할 수 있는 새로운 평가 지표인 Greedy Worst-Case Reward (GWC)를 제안하여 기하급수적 복잡도를 피한다.
  • 기존 기술 [28]을 활용하여 의미적 펌용(예: 밝기, 색상 변화)을 다룰 수 있도록 프레임워크를 확장하여 실제 응용에 더 넓은 적용 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1안정성 검증 경계에서 유도된 적대적 손실이 ℓp-노름으로 제한된 공격에 대해 딥 강화학습 에이전트의 강건성을 크게 향상시킬 수 있는가?
  • RQ2기존 최고 수준의 방법들인 SA-PPO와 비교해 볼 때, 제안된 RADIAL-RL 프레임워크는 학습 효율성과 강건성 면에서 어떻게 비교되는가?
  • RQ3강건한 학습이 ProcGen 벤치마크에서 예측할 수 없는 환경으로의 일반화 능력을 얼마나 향상시키는가?
  • RQ4Greedy Worst-Case Reward (GWC)는 적대적 펌용 하에서 진정한 최악의 보상과 비교해 정확하고 효율적인 대체 지표로 기능할 수 있는가?
  • RQ5이 프레임워크는 이산 제어(Atari), 연속 제어(MuJoCo), 프로시저럴 생성(ProcGen)을 포함한 다양한 RL 벤치마크에 적용되었을 때도 효과를 유지하는가?

주요 결과

  • RADIAL-RL 에이전트는 기존 최고 수준의 접근 방식보다 최대 5배 더 강한 적대적 펌용을 견딜 수 있다.
  • SA-PPO 대비 학습 시간을 2–10배 감소시켜, 훨씬 높은 계산 효율성과 함께 더 뛰어난 강건성을 달성한다.
  • MuJoCo 환경에서 RADIAL-PPO는 Half-Cheetah 환경에서 ε=0.15일 때 평균 수익 4724.3 ± 10.6을 기록하여, 동일한 공격 강도에서 SA-PPO의 4175.0 ± 29.9를 초월한다.
  • ProcGen 벤치마크에서 RADIAL 에이전트는 ε=5/255 PGD 공격 조건에서도 높은 보상을 기록하여, 예측할 수 없는 레벨에 대한 강력한 일반화 능력을 보였다.
  • ε ∈ {1.3,1.4}일 때, GWC는 40개의 에피소드 중 37개에서 진짜 Absolute Worst-Case Reward (AWC)와 밀도를 유지했고, ε ∈ {1.0,1.2}일 땐 완벽하게 일치하여, GWC가 유의미한 대체 지표임을 검증했다.
  • 기존 연구에서 제안한 행동 인증률(ACR)은 AWC와의 상관관계가 GWC보다 약했으며, 이는 GWC가 강건성 평가에 있어 더 우수한 평가 지표임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.