[논문 리뷰] Towards Safe Reinforcement Learning Using NMPC and Policy Gradients: Part II - Deterministic Case
이 논문은 결정론적 정책 기울기와 강건한 모델 예측 제어(MPC)를 조합하여 시스템 안전성에 대한 딱딱한 제약 조건을 강제하는 안전한 강화 학습 프레임워크를 제안한다. 강건한 선형 MPC에서 매개변수 최적화를 통해 안전성을 통합하고, 내부점 방법을 사용하여 탐색 왜곡을 보정함으로써 학습 중에도 안전성을 확보하면서 정책 기울기 업데이트를 통해 성능 향상을 가능하게 한다.
In this paper, we present a methodology to deploy the deterministic policy gradient method, using actor-critic techniques, when the optimal policy is approximated using a parametric optimization problem, where safety is enforced via hard constraints. For continuous input space, imposing safety restrictions on the exploration needed to deploying the deterministic policy gradient method poses some technical difficulties, which we address here. We will investigate in particular policy approximations based on robust Nonlinear Model Predictive Control (NMPC), where safety can be treated explicitly. For the sake of brevity, we will detail the construction of the safe scheme in the robust linear MPC context only. The extension to the nonlinear case is possible but more complex. We will additionally present a technique to maintain the system safety throughout the learning process in the context of robust linear MPC. This paper has a companion paper treating the stochastic policy gradient case.
연구 동기 및 목표
- 학습 중 시스템 행동에 대한 딱딱한 제약 조건을 강제하는 안전한 강화 학습 프레임워크를 개발하기 위해.
- 결정론적 정책 기울기 방법을 사용할 때 제약 조건이 있는 정책 근사에서 탐색 통계의 왜곡이 발생하는 기술적 과제를 해결하기 위해.
- 학습 가능한 매개변수를 가진 강건한 선형 모델 예측 제어(MPC)를 안전한 정책 근사 메커니즘으로 통합하기 위해.
- 제약 조건 최적화와 매개변수 감도 분석을 통해 전체 학습 과정 동안 시스템 안전성을 유지하기 위해.
- 내부점 기법을 사용해 딱딱한 제약 조건 하에서 정책 기울기 추정을 계산적으로 효율적으로 수행할 수 있는 방법을 제공하기 위해.
제안 방법
- 안전 제약 조건을 정책 근사에 직접 통합하기 위해 강건한 선형 MPC를 매개변수 최적화 문제로 사용한다.
- 정책 매개변수 θ에 대한 닫힌 루프 성능의 기울기를 추정함으로써 결정론적 정책 기울기 방법을 적용해 θ를 업데이트한다.
- 내부점 방법을 사용해 효율적인 기울기 계산을 수행함으로써 딱딱한 제약 조건으로 인한 탐색 왜곡을 보정한다.
- 모든 정책 업데이트가 MPC 최적화의 안전 집합 내에 유지되도록 보장하는 제약 조건이 있는 강화 학습 단계(식 84)를 통해 학습 중 안전성을 확보한다.
- 탐색을 정책의 스토케스틱 편향을 통해 수행하고, 기울기 추정의 통계 일관성을 유지하기 위해 보정을 적용하는 배치 기반 학습 체계를 사용한다.
- 노멀 모델과 편향 매개변수를 학습 가능한 구성 요소로 사용하여, RL 알고리즘이 실제 시스템 동역학에 맞게 모델을 적응시키되 안전성을 해치지 않도록 한다.
실험 결과
연구 질문
- RQ1정책이 딱딱한 안전 한계로 제약받을 때 결정론적 정책 기울기 방법을 어떻게 정확히 적용할 수 있는가?
- RQ2하나의 제약 조건이 있는 매개변수 최적화로 인해 탐색이 제한될 경우 정책 기울기 추정 과정에서 어떤 보정이 필요한가?
- RQ3강건한 선형 MPC가 정책 기울기 방법과 함께 엔드 투 엔드 학습을 지원하는 안전한 정책 근사 프레임워크로 사용될 수 있는가?
- RQ4학습 과정 전반에 걸쳐 탐색 중에도 시스템 안전성이 어떻게 유지될 수 있는가?
- RQ5어떤 계산 기법이 안전한 강화 학습을 위한 제약 조건이 있는 정책 최적화에서 기울기 계산을 효율적으로 수행하는가?
주요 결과
- 모의 실험에서 100개의 RL 단계 동안 성능 비용 J가 단조롭게 감소함으로써 제안된 방법이 닫힌 루프 성능을 성공적으로 향상시켰음을 확인했다.
- 시스템 궤적은 안전 제약 조건 ‖x‖² ≤ 1 내에서 유지되면서 기준 상태에 더 가까워졌으며, 그는 그림 5에서 확인할 수 있다.
- RL 알고리즘이 진짜 시스템 동역학을 단순히 식별하지는 않으며, 노멀 MPC 모델이 실제 시스템에 수렴하지 않음으로써 시스템 식별이 아닌 성능 기반 적응임을 나타낸다.
- 모델 편향의 산산이 흩어진 집합이 시간이 지남에 따라 특히 상태 제약 조건 근처의 가장 중요한 영역에서 내부로 수축하며 안전성을 위반하지 않으면서 성능 향상을 이룬다.
- MPC의 피드백 이득 K는 거의 조정되지 않아 성능 향상이 주로 노멀 모델과 편향 매개변수의 적응을 통해 달성됨을 나타낸다.
- 제약 조건이 있는 RL 단계(84)는 위험한 정책 업데이트를 성공적으로 방지하여, 모든 학습된 정책이 MPC 제약 조건에 의해 정의된 안전 집합 내에 유지됨을 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.