[논문 리뷰] Actor-Critic Reinforcement Learning for Control with Stability Guarantee
이 논문은 라플라스 안정성 이론을 크리틱 구성요소에 통합함으로써 로봇 제어 과제에서 닫힌 루프 안정성을 보장하는 새로운 액터-크리틱 강화학습 프레임워크를 제안한다. 단일 기대 부등식을 요구하는 데이터 기반 안정성 조건을 정식화함으로써, 이 방법은 안정된 정책의 샘플 효율적인 학습을 가능하게 하며, 여러 제어 벤치마크에서 외부 교란 및 파rameter 변화에 대한 강건성에서 최첨단 기법들을 능가한다.
Reinforcement Learning (RL) and its integration with deep learning have achieved impressive performance in various robotic control tasks, ranging from motion planning and navigation to end-to-end visual manipulation. However, stability is not guaranteed in model-free RL by solely using data. From a control-theoretic perspective, stability is the most important property for any control system, since it is closely related to safety, robustness, and reliability of robotic systems. In this paper, we propose an actor-critic RL framework for control which can guarantee closed-loop stability by employing the classic Lyapunov's method in control theory. First of all, a data-based stability theorem is proposed for stochastic nonlinear systems modeled by Markov decision process. Then we show that the stability condition could be exploited as the critic in the actor-critic RL to learn a controller/policy. At last, the effectiveness of our approach is evaluated on several well-known 3-dimensional robot control tasks and a synthetic biology gene network tracking task in three different popular physics simulation platforms. As an empirical evaluation on the advantage of stability, we show that the learned policies can enable the systems to recover to the equilibrium or way-points when interfered by uncertainties such as system parametric variations and external disturbances to a certain extent.
연구 동기 및 목표
- 모델-프리 딥 강화학습이 로봇 제어 시스템에 대해 안정성 보장을 갖추지 못하는 문제를 해결하기 위해.
- 제어 이론과 딥 RL을 융합하기 위해, 라플라스 방법을 데이터 기반 학습 프레임워크에 통합하기 위해.
- 학습 가능한 라플라스 크리틱을 통해 점점 안정성을 보장하는 샘플 효율적인 액터-크리틱 알고리즘을 개발하기 위해.
- 모델 불확실성과 외부 교란 하에서 학습된 정책의 강건성을 경험적으로 검증하기 위해.
- 비선형 및 확률적 제어 과제에서 미리 보지 못한 참조 신호에 대해 안정된 정책이 어떻게 일반화되는지 보여주기 위해.
제안 방법
- 스토케스틱 비선형 시스템을 마르코프 결정 과정으로 모델링하여, 무한한 라플라스 차분 조건을 상태 공간 위의 단일 기대 부등식으로 축소하는 데이터 기반 안정성 정리 제안.
- 딥 신경망을 사용해 라플라스 함수와 정책을 파arameter화하여, 크리틱이 안정성을 강제하는 엔드 투 엔드 학습을 가능하게 한다.
- 안정성 조건의 샘플 근사를 유도하여, 라플라스 함수의 기대 변화가 음수임을 보장하는 크리틱 손실 함수를 구성한다.
- 안정성 인식 크리틱을 액터-크리틱 RL 프레임워크에 통합하여, 액터는 제어 비용을 최소화하면서도 라플라스 조건을 만족하도록 업데이트된다.
- 유한 또는 무한 시간 영역에서 정의될 수 있는 라플라스 후보 함수를 사용하며, 무한 시간 영역의 경우 가치 함수와 동치이다.
- 오프-폴리시 리플레이와 기울기 기반 최적화를 활용해 액터와 라플라스 크리틱을 함께 훈련시켜, 훈련 및 추론 중 안정성을 보장한다.
실험 결과
연구 질문
- RQ1모델-프리 RL 환경에서 스토케스틱 비선형 시스템에 대해 데이터 기반 안정성 조건을 유도할 수 있는가?
- RQ2라플라스 안정성 조건을 액터-크리틱 RL 프레임워크의 크리틱으로 효과적으로 활용하여 닫힌 루프 안정성을 보장할 수 있는가?
- RQ3제안된 방법은 표준 RL 알고리즘보다 외부 교란 및 매개변수 불확실성에 더 강건한 정책을 도출하는가?
- RQ4학습된 정책은 비선형 제어 및 합성 생물학 과제에서 미리 보지 못한 참조 신호에 대해 일반화되는가?
- RQ5라플라스 후보 함수의 선택(예: 유한 vs. 무한 시간 영역)이 학습된 제어기의 강건성과 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 LAC(Lyapunov-regularized Actor-Critic) 방법은 카트폴과 GRN 과제에서 SAC 및 LQR보다 사망률과 누적 비용이 낮아, 더 뛰어난 안정성과 성능을 보여준다.
- HalfCheetah에서 LAC는 SAC가 강한 외부 힘에 의해 실패하는 상황에서도 더 큰 외부 교란에 대해 강건성을 유지한다.
- FetchReach에서 LAC와 SAC는 모두 모든 교란 수준에서 신뢰성 있게 작동하지만, LAC는 더 높은 일관성과 낮은 분산을 보인다.
- GRN 과제에서 LAC 정책은 주기 150, 400인 사인파 및 상수 8, 16와 같은 새로운 참조 신호를 낮은 분산과 높은 정확도로 추적하여 잘 일반화됨을 보였다.
- SAC는 특정 참조 신호(예: 주기 150인 사인파)를 추적하는 데 어려움을 겪고, LAC보다 더 높은 분산을 보였으며, 비슷한 신호로 훈련된 경우에도 마찬가지였다.
- 라플라스 후보의 선택은 강건성에 큰 영향을 미친다: 짧은 시간 영역(N=5–10)에서 훈련된 제어기는 더 긴 영역(N=15–20)에서 훈련된 것보다 충격적 외부 힘에 더 강건하며, LQR는 갑작스러운 힘에 대해 SAC보다 더 강건하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.