Skip to main content
QUICK REVIEW

[논문 리뷰] On the Robustness of Safe Reinforcement Learning under Observational Perturbations

Zuxin Liu, Zijian Guo|arXiv (Cornell University)|2022. 05. 29.
Cardiac electrophysiology and arrhythmias인용 수 9
한 줄 요약

이 논문은 관측적 적대적 편향에 대한 안전 강화학습(RL) 정책의 취약성을 조사하며, 비용 최대화 및 보상 최대화라는 두 가지 새로운 공격 방법을 제안하여 핵심적인 안전성 취약점을 드러낸다. 또한 이러한 공격을 활용한 강건한 훈련 프레임워크를 도입하여, 다양한 연속 제어 환경에서 적대적 조건 하에서도 제약 조건을 잘 준수하는 성능을 입증한다.

ABSTRACT

Safe reinforcement learning (RL) trains a policy to maximize the task reward while satisfying safety constraints. While prior works focus on the performance optimality, we find that the optimal solutions of many safe RL problems are not robust and safe against carefully designed observational perturbations. We formally analyze the unique properties of designing effective observational adversarial attackers in the safe RL setting. We show that baseline adversarial attack techniques for standard RL tasks are not always effective for safe RL and propose two new approaches - one maximizes the cost and the other maximizes the reward. One interesting and counter-intuitive finding is that the maximum reward attack is strong, as it can both induce unsafe behaviors and make the attack stealthy by maintaining the reward. We further propose a robust training framework for safe RL and evaluate it via comprehensive experiments. This paper provides a pioneer work to investigate the safety and robustness of RL under observational attacks for future safe RL studies. Code is available at: \url{https://github.com/liuzuxin/safe-rl-robustness}

연구 동기 및 목표

  • 안전 기반 강화학습(RL) 정책이 관측적 적대적 편향에 얼마나 취약한지, 특히 안전이 핵심적인 응용 분야에서 조사하기 위해.
  • 기존의 적대적 공격 방법이 표준 RL에선 효과적이지만, 제약 위반이 치명적인 안전 강화학습 환경에선 부적절하거나 불충분한 이유를 규명하기 위해.
  • 은폐성 또는 비용 최대화를 유지하면서도 불안전 행동을 유도할 수 있는, 안전 강화학습에 특화된 효과적인 적대적 공격자 설계를 위해.
  • 최악의 관측 편향에 대비한 정책의 강건성 향상을 위해 제약 조건을 유지하면서도 안정성을 높이는 강건한 훈련 프레임워크 개발을 위해.
  • 제안된 방법의 효과성을 다양한 안전 강화학습 알고리즘과 환경에서 검증하여, 최악의 편향 조건 하에서도 제약 조건 준수의 강건성 향상을 입증하기 위해.

제안 방법

  • 안전 강화학습을 위한 두 가지 새로운 적대적 공격 전략을 제안한다: (1) 제약 위반을 직접 증가시키는 비용 최대화(MC), (2) 위험부담이 높고 보상이 큰 행동을 유도하는 보상 최대화(MR).
  • 정책 최적화 과정에서 MC 및 MR 공격을 모두 활용한 강건한 훈련 프레임워크를 도입하여, 최악의 편향 상황에 대비한 정책 학습을 가능하게 한다.
  • 다양한 적대적 상황에서의 강건성 평가를 위해 MC와 MR 목표의 선형 조합을 활용한 혼합 공격자(Mixture Attacker)를 사용한다.
  • SAC-Lagrangian, FOCOPS, CVPO에 대해 제안된 공격를 적용하여 정책 및 가치 네트워크를 업데이트함으로써, 강건성이 향상된 훈련을 수행한다.
  • 이론적 분석을 통해 제안된 공격 하에서 벨먼 연산자의 수축 성질을 입증하여, 훈련 과정의 수렴성과 안정성을 뒷받침한다.
  • 공격 강도와 보상 및 비용 목표 간의 트레이드오���을 고려해, 초깃값 가중치를 활용한 혼합 공격자(w × MC + (1−w) × MR)를 사용하여 다양한 상황에서의 강건성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1안전 강화학습 정책은 관측적 적대적 편향에 얼마나 취약한가, 특히 제약 위반 측면에서?
  • RQ2표준 적대적 공격 방법(예: 보상 최소화)이 안전 강화학습 환경에선 효과적이지 않거나 불충분한 이유는 무엇인가?
  • RQ3은폐성 유지와 함께 불안전 행동을 더 효과적으로 유도할 수 있는 보상 최대화 공격이 비용 최대화 공격보다 더 효과적인가?
  • RQ4제안된 공격를 활용한 적대적 훈련이 최악의 편향 조건 하에서도 제약 조건 준수의 강건성을 향상시킬 수 있는가?
  • RQ5혼합 적대적 공격 하에서 다양한 안전 강화학습 알고리즘과 환경에서 강건하게 훈련된 정책의 성능은 어떻게 비교되는가?

주요 결과

  • 안전 강화학습 문제의 최적 해는 청소된 환경에서는 안전 제약 조건을 충족하더라도, 관측적 적대적 편향에 취약하다.
  • 최대 보상 공격(MR)은 불안전 행동을 매우 효과적으로 유도하며, 높은 작업 보상을 유지함으로써 은폐성이 높아 감지하기 어렵다.
  • 기본 안전 강화학습 에이전트(SAC-Lagrangian, FOCOPS, CVPO)는 MC 및 MR 공격 하에서 심각한 제약 위반을 겪으며, Car-Circle에서 최대 112.53, Car-Run에서 최대 184.22까지 비용이 증가한다.
  • 적대적 훈련을 거친 정책(ADV-PPOL, ADV-CVPO)은 MC 및 MR 공격 하에서도 비용이 거의 0.02–0.08 수준으로 유지되며, 높은 보상을 확보하여 강건성을 입증한다.
  • 혼합 공격자(MC:MR = 1:1)는 기본 정책의 성능을 일관되게 떨어뜨리지만, 강건하게 훈련된 에이전트는 안정적이고 안전한 상태를 유지함으로써 다양한 공격 유형에 대한 일반화 능력을 보여준다.
  • α=0.01인 Car-Run 환경에서 ADV-PPOL(MR) 에이전트는 MR 공격 하에 보상 557.07 ± 3.05, 비용 0.02 ± 0.13를 기록하지만, 기본 PPOL은 보상 624.68 ± 8.85를 기록하지만 비용은 184.22 ± 0.45로 나타나, 비강건한 정책에서 보상과 안전성 간의 트레이드오프를 명확히 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.