Skip to main content
QUICK REVIEW

[논문 리뷰] Safety-Critical Modular Deep Reinforcement Learning with Temporal Logic through Gaussian Processes and Control Barrier Functions

Mingyu Cai, Cristian-Ioan Vasile|arXiv (Cornell University)|2021. 09. 07.
Advanced Control Systems Optimization참고 문헌 55인용 수 4
한 줄 요약

이 논문은 연속 상태 및 행동 공간에서 복잡한 작업의 고확률 만족과 안전한 탐색을 보장하기 위해 선형 시간논리(LTL) 사양, 가우시안 프로세스를 통한 불확실성 모델링, 지수 제어 장벽 함수(ECBFs)를 통합한 안전 중심의 모odu lar 딥 강화학습 프레임워크를 제안한다. 이 방법은 로봇 환경에서 훈련 중에 거의 완벽한 성공률과 강력한 안전 보장을 달성한다.

ABSTRACT

Reinforcement learning (RL) is a promising approach and has limited success towards real-world applications, because ensuring safe exploration or facilitating adequate exploitation is a challenges for controlling robotic systems with unknown models and measurement uncertainties. Such a learning problem becomes even more intractable for complex tasks over continuous space (state-space and action-space). In this paper, we propose a learning-based control framework consisting of several aspects: (1) linear temporal logic (LTL) is leveraged to facilitate complex tasks over an infinite horizons which can be translated to a novel automaton structure; (2) we propose an innovative reward scheme for RL-agent with the formal guarantee such that global optimal policies maximize the probability of satisfying the LTL specifications; (3) based on a reward shaping technique, we develop a modular policy-gradient architecture utilizing the benefits of automaton structures to decompose overall tasks and facilitate the performance of learned controllers; (4) by incorporating Gaussian Processes (GPs) to estimate the uncertain dynamic systems, we synthesize a model-based safeguard using Exponential Control Barrier Functions (ECBFs) to address problems with high-order relative degrees. In addition, we utilize the properties of LTL automatons and ECBFs to construct a guiding process to further improve the efficiency of exploration. Finally, we demonstrate the effectiveness of the framework via several robotic environments. And we show such an ECBF-based modular deep RL algorithm achieves near-perfect success rates and guard safety with a high probability confidence during training.

연구 동기 및 목표

  • 알 수 없는 동역학과 측정 불확실성이 존재하는 로봇 시스템을 위한 딥 강화학습에서 안전한 탐색과 이용의 과제를 해결하기 위해.
  • 연속 공간에서 장기적인, 복잡한 작업을 선형 시간논리(LTL) 사양을 사용하여 형식화함으로써 가능하게 하기 위해.
  • 새로운 오토마타 기반 구조를 통해 LTL 사양을 만족시키는 데 있어 전역 최적성을 보장하는 보상 형태 조정 메커니즘을 개발하기 위해.
  • 고차 상대 차수를 가진 시스템을 위한 모델 기반 안전성 통합을 위해 가우시안 프로세스와 지수 제어 장벽 함수(ECBFs)를 통합하기 위해.
  • LTL 오토마타 구조와 ECBF 제약 조건에 따라 안내되는 모듈러 피드백 기반 정책-기울기 아키텍처를 통해 샘플 효율성과 정책 성능을 향상시키기 위해.

제안 방법

  • 복잡한 무한 시간할당 작업을 표현하고, 정책 학습을 위해 새로운 오토마타 구조로 변환하기 위해 선형 시간논리(LTL)를 활용한다.
  • 최적 정책이 LTL 사양을 만족시키는 확률을 최대화함을 공식적으로 보장하는 보상 형태 조정 기법을 설계한다.
  • 오토마타 구조를 사용해 전체 작업을 분해함으로써 학습 효율성과 제어기 성능을 향상시키는 모듈러 피드백 기반 정책-기울기 아키텍처를 개발한다.
  • 실시간으로 모델 불확실성을 추정하기 위해 불확실한 시스템 동역학을 모델링하기 위해 가우시안 프로세스(GPs)를 활용한다.
  • 고차 상대 차수를 가진 시스템을 위한 모델 기반 안전 레이어를 합성하기 위해 지수 제어 장벽 함수(ECBFs)를 도입한다.
  • LTL 오토마타 성질과 ECBF 제약 조건을 기반으로 한 가이드 프로세스를 구성하여 안전한 탐색을 가속화하고 샘플 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1어떻게 LTL 사양을 효과적으로 인코딩하고, 연속 상태 및 행동 공간에서 딥 강화학습을 안내하는 데 활용할 수 있는가?
  • RQ2최적 정책이 LTL 사양을 만족시키는 확률을 최대화함을 공식적으로 보장할 수 있는 보상 형태 조정 기법을 설계할 수 있는가?
  • RQ3어떻게 모듈러 피드백 기반 정책-기울기 아키텍처가 복잡한 로봇 제어 과제에서 학습 성능과 확장성을 향상시킬 수 있는가?
  • RQ4어떤 방식으로 가우시안 프로세스와 지수 제어 장벽 함수가 고차 상대 차수를 가진 시스템의 안전성을 공동으로 보장할 수 있는가?
  • RQ5LTL 오토마타 구조와 ECBF 제약 조건의 통합이 딥 강화학습에서 탐색의 효율성과 안전성에 얼마나 기여하는가?

주요 결과

  • 제안된 프레임워크는 다양한 로봇 제어 환경에서 거의 완벽한 성공률를 달성하여 작업 완수의 높은 신뢰성을 입증한다.
  • ECBFs와 가우시안 프로세스의 통합은 훈련 중에 높은 확률 신뢰도로 안전한 탐색과 제약 조건 만족을 보장한다.
  • 모듈러 피드백 기반 정책-기울기 아키텍처는 비모듈러 기반 대비 뛰어난 학습 효율성과 성능 향상을 보였다.
  • 보상 형태 조정 기법은 전역 최적 정책이 LTL 사양을 만족시키는 확률을 최대화함을 공식적으로 보장한다.
  • LTL 오토마타와 ECBF 성질에 기반한 가이드 프로세스는 수렴 속도를 가속화하고 샘플 효율성을 향상시켰다.
  • 이 프레임워크는 이전의 안전 강화학습 방법에서 다루지 못한 고차 상대 차수를 가진 시스템을 성공적으로 처리했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.