Skip to main content
QUICK REVIEW

[논문 리뷰] CUP: A Conservative Update Policy Algorithm for Safe Reinforcement Learning

Long Yang, Jiaming Ji|arXiv (Cornell University)|2022. 02. 15.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

CUP은 안전 강화학습을 위한 보수적 업데이트 정책 알고리즘으로, 더 날카운 성능 경계와 일반화된 이득 추정(GAE)을 근거로 한 서면 함수를 활용하여 이론적 안전 보장을 제공한다. 비볼록이고 일阶 최적화를 가능하게 하며, 볼록 근사 없이도 상태최고 수준의 방법들보다 안전성을 유지하면서 수익을 향상시킨다. 연속 제어 과제에서 성능이 뛰어나다.

ABSTRACT

Safe reinforcement learning (RL) is still very challenging since it requires the agent to consider both return maximization and safe exploration. In this paper, we propose CUP, a Conservative Update Policy algorithm with a theoretical safety guarantee. We derive the CUP based on the new proposed performance bounds and surrogate functions. Although using bounds as surrogate functions to design safe RL algorithms have appeared in some existing works, we develop them at least three aspects: (i) We provide a rigorous theoretical analysis to extend the surrogate functions to generalized advantage estimator (GAE). GAE significantly reduces variance empirically while maintaining a tolerable level of bias, which is an efficient step for us to design CUP; (ii) The proposed bounds are tighter than existing works, i.e., using the proposed bounds as surrogate functions are better local approximations to the objective and safety constraints. (iii) The proposed CUP provides a non-convex implementation via first-order optimizers, which does not depend on any convex approximation. Finally, extensive experiments show the effectiveness of CUP where the agent satisfies safe constraints. We have opened the source code of CUP at https://github.com/RL-boxes/Safe-RL.

연구 동기 및 목표

  • 수익 극대화와 제약 조건 이행을 동시에 보장함으로써 안전 탐색 문제를 해결하기 위해.
  • 비볼록 목적 함수와 제약 조건의 볼록 근사에 의존하는 것을 제거하여 오차와 계산 오버헤드를 줄이기 위해.
  • 효율적이고 고차원 문제에 스케일이 잘 되는 샘플 기반의 안전 RL의 이론적 기반을 마련하기 위해.
  • 이전 연구보다 더 날카운 성능 경계를 제공하여 진짜 목적 함수와 제약 조건에 대한 더 나은 局부 근사치를 가능하게 하기 위해.
  • 정책 투영을 통해 안전성을 유지하면서 수익의 단조적 향상을 보장하는 실용적인 알고리즘을 설계하기 위해.

제안 방법

  • 일반화된 이득 추정기(GAE)를 사용하여 정책 간의 새로운 일반화된 차이 경계를 유도함으로써 분산을 줄이고 편향 제어를 유지한다.
  • 이전 연구보다 더 날카운 성능 경계를 제안하여 목적 함수와 제약 조건의 국소 근사 품질을 향상시킨다.
  • 두 단계로 구성된 CUP 업데이트: 첫째로 기울기 상승을 통한 정책 개선, 둘째로 안전 정책 영역에 투영하여 제약 조건을 강제 적용.
  • 유도된 경계를 기반으로 한 서면 함수를 사용하여 최적화 과정에서 원래 목적 함수와 제약 조건을 대체한다.
  • 고비용의 피셔 정보 매트릭스 역행렬 계산을 피하기 위해 비볼록 최적화를 일阶 방법을 통해 가능하게 한다.
  • 반복적 개선과 제약 위반에 대한 이론적 경계를 제공하는 라그랑주 승수 방법을 사용하며, 적응형 ν를 활용해 수익과 안전성을 균형 잡는다.

실험 결과

연구 질문

  • RQ1GAE를 통해 유도된 더 날카운 성능 경계가 제약 조건이 있는 강화학습에서 정책 업데이트의 안전성과 안정성 향상에 기여하는가?
  • RQ2이 경계를 기반으로 한 서면 함수는 볼록 근사 없이도 안전한 정책 최적화를 가능하게 하는가?
  • RQ3제안된 CUP 알고리즘이 기존의 안전 RL 기준선보다 안전성을 유지하면서 수익을 극대화하는 데 얼마나 뛰어난가?
  • RQ4제안된 보수적 업데이트 프레임워크에서 정책 개선과 제약 위반에 대한 이론적 보장은 무엇인가?
  • RQ5CUP 알고리즘은 일阶 최적화를 사용해 고차원 연속 제어 환경에서 효율적으로 구현 가능한가?

주요 결과

  • CUP은 이전 연구보다 더 날카운 경계를 유도함으로써 이론적 안전 보장을 달성하여 진짜 목적 함수와 제약 조건에 대한 더 나은 국소 근사치를 가능하게 한다.
  • MuJoCo 로봇과 같은 안전 기반 환경(속도 제한, 원형 제약 조건 포함)에서 개선된 성능을 보이며, 안전 제약 조건을 일관되게 이행한다.
  • CPO, PCPO, FOCOPS, PPO-L과 같은 최신 기준선 방법들보다 다수의 벤치마크에서 수익 극대화와 제약 이행 측면에서 뛰어난 성능을 보인다.
  • 이론적 경계에 GAE를 사용함으로써 정책 업데이트의 분산이 감소하여 편향 제어를 유지하면서도 더 안정적이고 효율적인 학습이 가능해졌다.
  • 일阶 최적화기를 통한 비볼록 구현으로 고차원 피셔 매트릭스 역행렬 계산이 필요 없어져 계산 비용이 크게 감소하였다.
  • 실험 결과 CUP는 복잡한 환경(예: 원형 작업)에서도 복잡한 금지 영역을 피하면서 안전한 행동을 유지함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.