[논문 리뷰] Robust Model Predictive Shielding for Safe Reinforcement Learning with Stochastic Dynamics
이 논문은 관측 가능한 확률적 비선형 시스템에서 강화학습의 안전성을 보장하기 위해 튜브 기반의 강건한 비선형 모델 예측 제어기(NMPC)를 백업으로 사용하는 Robust Model Predictive Shielding(RMPS) 프레임워크를 제안한다. 이는 샘플링된 궤적과 통계적 학습 이론을 활용하여 도달 가능한 영역에 대해 고확률 보장을 제공함으로써, 카트폴 및 비휴합성 시스템과 같은 환경에서 안전하고 높은 성능의 제어를 가능하게 한다.
This paper proposes a framework for safe reinforcement learning that can handle stochastic nonlinear dynamical systems. We focus on the setting where the nominal dynamics are known, and are subject to additive stochastic disturbances with known distribution. Our goal is to ensure the safety of a control policy trained using reinforcement learning, e.g., in a simulated environment. We build on the idea of model predictive shielding (MPS), where a backup controller is used to override the learned policy as needed to ensure safety. The key challenge is how to compute a backup policy in the context of stochastic dynamics. We propose to use a tube-based robust NMPC controller as the backup controller. We estimate the tubes using sampled trajectories, leveraging ideas from statistical learning theory to obtain high-probability guarantees. We empirically demonstrate that our approach can ensure safety in stochastic systems, including cart-pole and a non-holonomic particle with random obstacles.
연구 동기 및 목표
- 역동성이 알려져 있지만 추가적인 확률적 외란에 노출된 확률적 비선형 동적 시스템에 대해 강화학습 정책의 안전성을 보장하는 데 도전한다.
- 기존의 보호 프레임워크가 결정론적 역동성 또는 선형 시스템을 가정하기 때문에 복잡한 로봇 작업에 적용 가능성이 제한됨을 극복한다.
- 고차원, 비선형, 확률적 제어 환경에서 안전성을 이론적으로 기반하여 검증할 수 있는 확장 가능한 방법을 개발한다.
- 필요에 따라 증명 가능하게 안전한 백업 제어기를 동적으로 활성화함으로써 블랙박스 딥 강화학습 정책의 안전한 구현을 가능하게 한다.
- 통계적 학습 이론을 활용하여 샘플 수가 유한한 경우에 대해 백업 제어기의 도달 가능한 영역 크기에 대한 고확률 보장을 제공한다.
제안 방법
- 확률적 외란을 다루고 비선형 시스템에서의 안전성을 보장하기 위해 튜브 기반의 강건한 NMPC를 백업 제어기로 사용한다.
- 확률적 역동성에서의 샘플링된 궤적을 통해 백업 제어기의 전방 도달 가능한 영역을 추정한다.
- 통계적 학습 이론(예: VC 차원 경계)을 적용하여 명시적 궤적 주변의 추정된 튜브 크기에 대한 고확률 신뢰구간을 유도한다.
- 학습된 정책이 안전하게 실행될 수 있는지 동적으로 검사하는 모델 예측 보호(MPS) 프레임워크와 통합한다.
- 각 시간 단계에서 현재 상태가 추정된 안전 튜브 내부에 있는지 확인하고, 그렇지 않으면 백업 NMPC 제어기를 활성화한다.
- 확률적 강건한 복구 조건을 사용하여 정책이 이탈하더라도 시스템이 높은 확률로 안전 영역으로 되돌아올 수 있도록 보장한다.
실험 결과
연구 질문
- RQ1이론적 안전 보장을 유지하면서 보호 프레임워크를 확률적 비선형 시스템으로 확장할 수 있는가?
- RQ2확률적 외란이 존재하는 상황에서 강건한 NMPC 제어기의 도달 가능한 영역에 대해 유한 샘플 확률 보장을 어떻게 확립할 수 있는가?
- RQ3비선형 역동성을 고려할 경우 선형 근사에 비해 얼마나 더 적은 보수성(conservatism)을 보일 수 있는가?
- RQ4샘플 기반 튜브 추정 방법이 고차원 시스템에서 계산 가능성을 유지하면서도 강력한 이론적 보장을 제공할 수 있는가?
- RQ5확률적 환경에서 강건한 NMPC 백업을 사용할 경우와 선형 MPC 백업을 사용할 경우 학습된 정책의 성능는 어떻게 비교되는가?
주요 결과
- RMPS는 카트폴 및 무작위 장애물이 있는 비휴합성 입자와 같은 확률적 비선형 시스템에서 안전성을 보장하며, 고확률 안전 보장을 달성한다.
- 실험 결과에서 LRMPS에 비해 더 적은 백업 제어기 활성화 수를 보이며, 더 낮은 보수성을 보이며 정책 성능 향상을 입증한다.
- 카트폴 환경에서 RMPS는 LRMPS보다 더 많은 초기 $(\theta, \omega)$ 상태에서 팔을 안정화시키며, 더 높은 강건성과 성능을 보여준다.
- 이론적 분석 결과, 시스템은 $1 - (T+1)\epsilon$ 확률로 강건하게 복구 가능하며, 이때 $\epsilon$는 통계적 학습 경계에서 유도된다.
- 샘플 기반 튜브 추정 방법은 도달 가능한 영역에 대해 유한 샘플 확률 보장을 제공하여 실용적 구현에 이론적 근거를 제공한다.
- 실험 결과는 RMPS가 안전성을 유지하면서도 높은 성능을 유지하며, 커버리지와 백업 사용 빈도 측면에서 LRMPS를 능가함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.