Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Adversarial Training without Attacking: Worst-Case-Aware Robust Reinforcement Learning

Yongyuan Liang, Yanchao Sun|arXiv (Cornell University)|2022. 10. 12.
Adversarial Robustness in Machine Learning인용 수 8
한 줄 요약

이 논문은 별도의 공격자 학습이 필요 없이 유한한 ℓp 공격 하에서 악성 공격에 대한 강건성을 직접 추정하고 최적화함으로써 효율적으로 강건한 강화학습 프레임워크인 WocaR-RL을 제안한다. 기존 방법보다 50% 적은 학습 시간과 샘플을 사용하면서도 SOTA 수준의 강건한 성능을 달성하며, Walker2d와 같은 환경에서 더 해석 가능한 강건한 행동을 학습한다.

ABSTRACT

Recent studies reveal that a well-trained deep reinforcement learning (RL) policy can be particularly vulnerable to adversarial perturbations on input observations. Therefore, it is crucial to train RL agents that are robust against any attacks with a bounded budget. Existing robust training methods in deep RL either treat correlated steps separately, ignoring the robustness of long-term rewards, or train the agents and RL-based attacker together, doubling the computational burden and sample complexity of the training process. In this work, we propose a strong and efficient robust training framework for RL, named Worst-case-aware Robust RL (WocaR-RL) that directly estimates and optimizes the worst-case reward of a policy under bounded l_p attacks without requiring extra samples for learning an attacker. Experiments on multiple environments show that WocaR-RL achieves state-of-the-art performance under various strong attacks, and obtains significantly higher training efficiency than prior state-of-the-art robust training methods. The code of this work is available at https://github.com/umd-huang-lab/WocaR-RL.

연구 동기 및 목표

  • 실세계 응용에서 딥 강화학습 정책의 공격에 대한 취약성을 해결하기 위해.
  • 별도의 공격자 학습에 의존하지 않고, 유한한 공격 하에서 최악의 보상 취약성을 특성화함으로써 장기적인 강건성을 향상시키기 위해.
  • 기존의 악성 훈련 방법에서 발생하는 이중 샘플 및 계산 비용을 피하기 위해 효율적인 훈련 프레임워크를 개발하기 위해.
  • 단순히 작은 변형에만 강건한 것이 아니라, 본질적으로 공격에 덜 취약한 정책을 만들기 위해.
  • 기존의 DRL 알고리즘(PPO 및 DQN 등)에 즉시 통합할 수 있는 플러그 앤 플레이 개선 방법을 제공하기 위해.

제안 방법

  • 기존의 오프-폴리시 샘플을 사용하여 최악의 공격 하에서 정책 가치의 하한을 추정하는 새로운 최악의 공격 벨먼 연산자를 도입함으로써, 공격자 학습을 위한 환경 상호작용이 필요 없게 한다.
  • 자연 상태와 최악의 상황에서의 기대 수익의 가중 조합을 최대화하도록 정책을 최적화함으로써, 공격 없음과 공격 상황에서의 성능 간 균형을 이룬다.
  • 작은 변형이 보상 감소에 큰 영향을 미치는 상태에 대해 강조하는 상태 중요도 가중치 w(s)를 통합함으로써, 핵심 의사결정 영역에서의 강건성을 향상시킨다.
  • 정책 네트워크에 정규화 손실 Lreg를 적용하여, 특히 고영향도 상태에서의 내재적 강건성을 향상시킨다.
  • 추가적인 환경 롤아웃 없이 오프-폴리시 리PLAY 버퍼를 사용하여 최악의 상황 가치를 추정함으로써 효율적인 훈련을 가능하게 한다.
  • PPO 및 DQN과 같은 표준 DRL 알고리즘과 통합되어 핵심 아키텍처를 수정하지 않고도 강건성을 향상시킬 수 있다.

실험 결과

연구 질문

  • RQ1별도의 RL 기반 공격자 학습 없이도 유한한 ℓp 공격 하에서 정책의 최악의 가치를 추정할 수 있는가?
  • RQ2최악의 성능을 직접 최적화함으로써 DRL 에이전트의 장기적 강건성을 어떻게 향상시킬 수 있는가?
  • RQ3상태 중요도 가중치와 정규화 손실을 통합하는 것이 학습된 공격자와 함께 하는 악성 훈련보다 더 효과적으로 강건성을 향상시키는가?
  • RQ4기존 방법과 비교해 상당히 줄어든 샘플 및 계산 비용으로 SOTA 수준의 강건한 성능을 달성할 수 있는가?
  • RQ5복잡한 환경에서 자연 성능과 강건성 간의 트레이드오���이 정책 행동에 어떤 영향을 미치는가?

주요 결과

  • WocaR-RL은 가장 강력한 공격 조건에서 Walker2d 환경에서 PA-ATLA-PPO보다 최악의 보상이 20% 높으며, 학습 샘플과 학습 시간을 각각 50%만 사용한다.
  • qualitative 분석을 통해 WocaR-RL은 PA-ATLA-PPO보다 더 해석 가능하고 강건한 행동을 학습함을 확인할 수 있었다.
  • 제거 실험 결과, 상태 중요도 가중치 w(s)와 정규화 손실 Lreg 모두 강건성 향상에 상당한 기여를 하며, w(s)는 MuJoCo 환경 전반에서 성능 향상을 이끌었다.
  • 트레이드오프 조정 하이퍼파라미터 κwst는 자연 성능과 강건성 간 균형을 효과적으로 제어하며, κwst가 높을수록 최악의 상황에서의 성능이 향상되지만 자연 성능은 감소한다.
  • Hopper, Walker2d, Halfcheetah, Ant 환경 전반에서 WocaR-RL은 최악의 상황 강건성에서 모든 베이스라인보다 뛰어나며, 자연 성능는 유사하게 유지한다.
  • 이 프레임워크는 보편적으로 적용 가능하며, 핵심 아키텍처를 수정하지 않고도 기존의 DRL 알고리즘(PPO 및 DQN 등)을 강건하게 만들 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.