Skip to main content
QUICK REVIEW

[논문 리뷰] Reachability Constrained Reinforcement Learning

Dongjie Yu, Haitong Ma|arXiv (Cornell University)|2022. 05. 16.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 도달 가능성 제약 강화학습(RCRL)을 제안한다. 이는 해밀턴-자비 도달 가능성 분석을 사용하여 안전 제약 조건을 지속적으로 만족시킬 수 있는 상태의 최대 부분집합인 가장 큰 타당 영역을 식별하는 새로운 CRL 방법이다. 타당 영역을 안전성 가치 함수로 모델링하고 도달 가능성에 의해 자기 일관성을 강제함으로써 RCRL는 국소적으로 최적의 정책으로 수렴하면서도 제약 조건을 보장하며, Safe-Control-Gym 및 Safety-Gym과 같은 벤치마크에서 CRL 및 안전 제어 기반 방법보다 안전성과 성능 면에서 뛰어나다.

ABSTRACT

Constrained reinforcement learning (CRL) has gained significant interest recently, since safety constraints satisfaction is critical for real-world problems. However, existing CRL methods constraining discounted cumulative costs generally lack rigorous definition and guarantee of safety. In contrast, in the safe control research, safety is defined as persistently satisfying certain state constraints. Such persistent safety is possible only on a subset of the state space, called feasible set, where an optimal largest feasible set exists for a given environment. Recent studies incorporate feasible sets into CRL with energy-based methods such as control barrier function (CBF), safety index (SI), and leverage prior conservative estimations of feasible sets, which harms the performance of the learned policy. To deal with this problem, this paper proposes the reachability CRL (RCRL) method by using reachability analysis to establish the novel self-consistency condition and characterize the feasible sets. The feasible sets are represented by the safety value function, which is used as the constraint in CRL. We use the multi-time scale stochastic approximation theory to prove that the proposed algorithm converges to a local optimum, where the largest feasible set can be guaranteed. Empirical results on different benchmarks validate the learned feasible set, the policy performance, and constraint satisfaction of RCRL, compared to CRL and safe control baselines.

연구 동기 및 목표

  • 기존의 제약 강화학습(CRL)이 할인 누적 비용의 기대값에 의존하여 지속적인 상태 제약 조건 만족을 보장하지 못하는 데서 비롯된 엄밀한 안전 보장을 부족하게 하는 문제를 해결하기 위해.
  • 기존의 CBF 및 SI와 같은 안전 제어 방법이 사전에 정의된 에너지 함수에 의존하여 타당 영역를 축소시키는 과도한 보수성 문제를 해결하기 위해.
  • 모델리스 강화학습에 도달 가능성 분석을 통합하여 이론적으로 가장 큰 타당 영역를 식별함으로써, 보수성이 낮고 성능이 뛰어난 정책을 가능하게 하기 위해.
  • 도달 가능성 분석을 통한 자기 일관성 조건을 수립하여 안전성 가치 함수가 타당 영역를 정확히 표현함을 보장하기 위해.
  • 제안된 알고리즘이 전체 가장 큰 타당 영역에서 지속적인 안전성을 유지하는 국소적으로 최적의 정책으로 수렴함을 증명하기 위해.

제안 방법

  • 타당 영역를 정의하기 위해 시간에 따라 누적되는 최악의 제약 위반을 특징짓는 안전성 가치 함수를 도입하며, 이 함수의 음수 수준 집합이 타당 영역를 정의한다.
  • 해밀턴-자비 도달 가능성 분석에 기반한 새로운 자기 일관성 조건을 제안하여, 안전성 가치 함수가 실제 도달 가능한 집합과 일관되도록 보장한다.
  • 기존의 비용 기반 제약 조건을 대체하여 안전성 가치 함수를 사용해 타당 영역를 CRL 프레임워크에 통합한다.
  • 정책과 안전성 가치 함수를 동시에 최적화하기 위해 다중 시간 스케일 확률적 근사 알고리즘을 사용하며, 이론적 수렴 보장을 제공한다.
  • 오프-폴리시 리플레이 버퍼와 함수 근사 기법을 사용해 알고리즘을 학습시키며, 안전성 가치 함수는 도달 가능성 기반의 타당성 반영을 위해 업데이트된다.

실험 결과

연구 질문

  • RQ1모델리스 강화학습에 도달 가능성 분석을 효과적으로 통합하여 안전 제어를 위한 정확하고 최대한의 타당 영역를 정의할 수 있는가?
  • RQ2어떻게 하면 안전성 가치 함수를 구성할 수 있을까? 그 음수 수준 집합이 안전성이 지속적으로 유지될 수 있는 상태의 최대 집합과 일치하도록 할 수 있는가?
  • RQ3도달 가능성 분석에서 유도된 자기 일관성 조건을 강제 적용하면 CBF 및 SI 기반 방법 대비 더 넓은 허용 영역와 높은 성능을 보이는 정책를 얻을 수 있는가?
  • RQ4제안된 알고리즘이 전체 가장 큰 타당 영역에서 제약 조건을 보장하는 국소적으로 최적의 정책으로 수렴할 수 있는가?
  • RQ5복잡하고 고차원적인 환경에서 RCRL의 성능과 안전성은 표준 CRL 및 안전 제어 기반 방법과 비교해 어떻게 다른가?

주요 결과

  • RCRL는 도달 가능성 분석을 통해 가장 큰 타당 영역를 성공적으로 식별하여, CBF 및 SI와 같은 이전의 에너지 기반 방법의 보수성을 피한다.
  • RCRL가 학습한 안전성 가치 함수는 타당 영역를 정확히 표현하며, 상태 공간 투영에 대한 실증적 검증을 통해 올바른 음수 수준 집합을 보여준다.
  • Safe-Control-Gym의 큐드로터 작업에서 RCRL는 모든 평가 런에서 제약 위반률 0.0%를 기록하며, SAC-CBF 및 SAC-SI를 모두 초월한다.
  • Safety-Gym 벤치마크에서 RCRL는 CRL 기반 방법보다 높은 평균 수익을 달성하면서도 완벽한 제약 조건 만족도를 유지한다.
  • 이론적 분석을 통해 다중 시간 스케일 확률적 근사 프레임워크 하에서 국소적으로 최적의 정책으로 수렴함을 확인하였으며, 전체 타당 영역에서 지속적인 안전성이 보장된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.