[논문 리뷰] Constrained Variational Policy Optimization for Safe Reinforcement Learning
이 논문은 기댓값-최대화 프레임워크를 사용하여 안전 강화학습을 확률적 추론 문제로 공식화하는 새로운 안전 강화학습 알고리즘인 제약 조건이 있는 변분 정책 최적화(CVPO)를 제안한다. E단계에서는 볼록 최적화를 통해 닫힌 형태의 해를 갖는 비모수적 변분 분포를 계산하고, M단계에서는 신뢰영역 정규화된 지도학습을 통해 정책을 향상시킴으로써 CVPO는 안정적이고 샘플 효율적인 학습을 달성하며, 보장된 최적성과 제약 조건 이행 성능을 확보한다. 이는 기존의 온정책 기반 방법 대비 샘플 효율성이 최대 1000배 향상된다.
Safe reinforcement learning (RL) aims to learn policies that satisfy certain constraints before deploying them to safety-critical applications. Previous primal-dual style approaches suffer from instability issues and lack optimality guarantees. This paper overcomes the issues from the perspective of probabilistic inference. We introduce a novel Expectation-Maximization approach to naturally incorporate constraints during the policy learning: 1) a provable optimal non-parametric variational distribution could be computed in closed form after a convex optimization (E-step); 2) the policy parameter is improved within the trust region based on the optimal variational distribution (M-step). The proposed algorithm decomposes the safe RL problem into a convex optimization phase and a supervised learning phase, which yields a more stable training performance. A wide range of experiments on continuous robotic tasks shows that the proposed method achieves significantly better constraint satisfaction performance and better sample efficiency than baselines. The code is available at https://github.com/liuzuxin/cvpo-safe-rl.
연구 동기 및 목표
- 기존의 원시-이중 접근 방식에서의 불안정성과 최적성 보장의 부재 문제를 해결하기 위해.
- 제약 조건 이행을 보장하면서도 높은 샘플 효율성을 유지하는 안전 강화학습 방법을 개발하기 위해.
- 확률적 추론을 활용하여 제약 조건이 있는 강화학습을 볼록 최적화와 지도학습 문제로 재정의하기 위해.
- 제약 위반 한계와 정책 향상에 대한 강건성에 대한 이론적 보장을 제공하기 위해.
- 연속 제어 과제에서 샘플 효율성을 향상시키기 위해 오프정책 학습을 효과적으로 통합하기 위해.
제안 방법
- 안전 강화학습을 확률적 추론 문제로 공식화하여 제약 조건을 변분 추론 목표로 전환한다.
- 기대-최대화 프레임워크를 도입: E단계에서는 볼록 최적화를 통해 닫힌 형태의 해를 갖는 최적의 비모수적 변분 분포를 계산한다.
- M단계에서는 최적의 변분 분포에 대한 지도학습을 통해 신뢰영역 정책 향상을 수행하며, 이는 오프정책 업데이트를 가능하게 한다.
- 안전 제약 조건을 정책 최적화 중에 이행하기 위해 라그랑주 승수를 사용한 이중 변수 공식화를 적용한다.
- 효율적인 볼록 E단계 최적화 문제 해결을 위해 입자 기반 샘플링과 SLSQP를 사용한다.
- 훈련 안정성과 분포 이탈에 대한 강건성을 확보하기 위해 M단계에서 폴리악 평균화와 KL 제약 조건을 적용한다.
실험 결과
연구 질문
- RQ1안전 강화학습을 확률적 추론 문제로 재정의함으로써 더 뛰어난 안정성과 최적성 달성을 이룰 수 있는가?
- RQ2볼록 E단계와 지도학습 기반 M단계를 가진 이중 단계의 EM 스타일 알고리즘이 제약 조건 이행 성능과 샘플 효율성을 향상시킬 수 있는가?
- RQ3E단계의 닫힌 형태 해가 표준 가정 하에 최적성과 유일성을 보장하는가?
- RQ4강건성 보장을 갖는 제약 조건 기반 정책 최적화에 오프정책 학습을 효과적으로 통합할 수 있는가?
- RQ5제안된 방법은 온정책 및 오프정책 기반 방법 대비 제약 위반과 샘플 효율성 측면에서 어떻게 비교되는가?
주요 결과
- CVPO는 연속 제어 과제 전반에서 기존의 온정책 기반 방법 대비 최대 1000배 뛰어난 샘플 효율성을 달성한다.
- 기존의 원시-이중 접근 방식과 정책 기반 강화학습 방법 대비 훨씬 더 안정적인 학습 동역학을 보여준다.
- CVPO는 더 뛰어난 제약 조건 이행 성능을 보이며, 수렴 시 누적 비용이 기준 기반 방법보다 일관되게 낮게 유지된다.
- E단계의 닫힌 형태 해는 이중 문제의 엄격한 볼록성 덕분에 보장된 최적성과 유일성을 갖는다.
- 신뢰영역 M단계는 최악의 경우 제약 위반 한계를 제공하며, 훈련 불안정성에 대한 강건성을 확보한다.
- 실험 결과에 따르면, CVPO는 보상, 제약 조건 이행 성능, 학습 안정성 측면에서 모두 온정책 및 오프정책 기반 방법을 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.