Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Reinforcement Learning Using Advantage-Based Intervention

Nolan Wagener, Boots, Byron|arXiv (Cornell University)|2021. 06. 16.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

SAILR는 알 수 없는 마르코프 결정 과정에서 훈련 중 안전성을 보장하기 위해 이점 기반 간섭을 사용하는 안전 강화 학습 알고리즘입니다. 표준 강화 학습 알고리즘을 그대로 활용하고 데이터를 변환하여 간섭에 대해 보상 감소를 적용함으로써, 훈련 및 배포 중 강력한 안전 보장을 달성하며, 이전 방법에 비해 제약 위반 수를 크게 줄입니다.

ABSTRACT

Many sequential decision problems involve finding a policy that maximizes total reward while obeying safety constraints. Although much recent research has focused on the development of safe reinforcement learning (RL) algorithms that produce a safe policy after training, ensuring safety during training as well remains an open problem. A fundamental challenge is performing exploration while still satisfying constraints in an unknown Markov decision process (MDP). In this work, we address this problem for the chance-constrained setting. We propose a new algorithm, SAILR, that uses an intervention mechanism based on advantage functions to keep the agent safe throughout training and optimizes the agent's policy using off-the-shelf RL algorithms designed for unconstrained MDPs. Our method comes with strong guarantees on safety during both training and deployment (i.e., after training and without the intervention mechanism) and policy performance compared to the optimal safety-constrained policy. In our experiments, we show that SAILR violates constraints far less during training than standard safe RL and constrained MDP approaches and converges to a well-performing policy that can be deployed safely without intervention. Our code is available at https://github.com/nolanwagener/safe_rl.

연구 동기 및 목표

  • 알 수 없는 MDP에서 탐색 중 안전성을 보장하는 데 도전하는 문제를 해결하기 위해, 기존 표준 안전 강화 학습 방법이 훈련 중 안전성 보장을 제공하지 못하는 점을 보완합니다.
  • 복잡한 제약 최적화나 제어 이론적 가정에 의존하지 않고도 훈련 전반에 걸쳐 안전성을 유지하면서 높은 정책 성능을 달성하는 방법을 개발합니다.
  • 훈련 및 배포 중 안전성에 대한 이론적 보장을 제공하며, 표준 비제약 강화 학습 알고리즘을 사용하는 경우에도 적용 가능합니다.
  • 기존의 CMDP 기반 및 간섭 기반 접근법에 비해 훈련 중 안전 위반 수를 줄입니다.
  • 이점 함수를 사용해 간섭 결정을 이끌어내어 안정적이고 신뢰할 수 있는 학습을 가능하게 하며, 이는 일반화되고 확장 가능한 방법을 제공합니다.

제안 방법

  • SAILR는 이점 기반 간섭 규칙을 사용하여, 에이전트의 행동이 기대 수익 측면에서 안전 정책에 비해 낮은 이점을 가지면(즉, 안전하지 않은 경우) 백업 정책을 작동시킵니다.
  • 롤아웃 중에 에이전트가 고위험 행동을 제안할 경우, 백업 정책이 간섭하여 에이전트를 안전한 상태로 이동시키며, 음수 보상을 가진 흡수 상태로의 전이를 시뮬레이션합니다.
  • 수집된 궤적은 간섭이 발생한 상태-행동 쌍에 대해 보상 감소를 적용함으로써 비제약 MDP용 경험으로 변환되며, 이는 대체 MDP $ ilde{ ho}$를 사용합니다.
  • 변환된 데이터는 SAC나 PPO와 같은 표준 오프더쇼프 강화 학습 알고리즘을 통해 에이전트 정책을 훈련하는 데 사용됩니다.
  • 이 방법은 경미한 가정에 의존합니다: 비안전 상태는 흡수 상태이며, 백업 정책은 초기 상태에서 높은 확률로 안전성을 보장합니다.
  • 간섭 메커니즘은 부분적이고 일반화된 방식이며, 오직 추정된 이점 함수에 의존하므로 매끄러움이나 정상성 가정이 필요하지 않습니다.

실험 결과

연구 질문

  • RQ1복잡한 제약 최적화에 의존하지 않고도 훈련 및 배포 중 안전성을 보장하는 안전 강화 학습 알고리즘을 설계할 수 있을까요?
  • RQ2어떻게 이점 함수를 활용해 정책 성능과 안정성을 유지하면서 안전한 간섭를 이끌 수 있을까요?
  • RQ3간섭 보상 감소의 크기가 훈련 중 안전성과 최종 정책 성능에 어떤 영향을 미치나요?
  • RQ4간섭 메커니즘의 모델 편향이 안전성과 학습 안정성에 어떤 영향을 미치나요?
  • RQ5표준 비제약 강화 학습 알고리즘을 사용하면서도 강력한 안전 보장을 달성할 수 있을까요?

주요 결과

  • SAILR는 표준 안전 강화 학습 및 제약 MDP 기반 방법에 비해 훈련 중 안전 위반 수를 수개월 단위로 줄였습니다.
  • 비편향 모델을 사용하는 경우에도 SAILR는 최소한의 제약 위반으로 높은 배포 성능을 달성합니다.
  • 간섭을 위한 비용 함수를 설계하면 안전 위반 수가 크게 감소하고 정책 최적화가 안정화되며, 특히 모델 편향 상황에서 두드러집니다.
  • 더 큰 간섭 보상 감소는 안전 행동의 빠른 학습과 향상된 배포 안전성을 이끌어내며, 이론적 경계와 일치합니다.
  • MPC 기반 간섭 규칙은 부분적이므로 비제로 보상 감소만 필요로 하지만, 히وري스틱 간섭은 유사한 안전성을 확보하기 위해 더 큰 보상 감소가 필요하므로, 이점 기반 접근이 더 높은 강건성을 보입니다.
  • SAILR의 이론적 보장은 경미한 가정 하에 성립합니다: 비안전 상태는 흡수 상태이며, 초기 상태에서 안전한 백업 정책이 존재합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.