Skip to main content
QUICK REVIEW

[논문 리뷰] Off-Policy Risk-Sensitive Reinforcement Learning Based Constrained Robust Optimal Control

Cong Li, Fangzhou Liu|arXiv (Cornell University)|2020. 06. 10.
Adaptive Dynamic Programming Control참고 문헌 64인용 수 4
한 줄 요약

이 논문은 외부 교란, 입력 포화 및 상태 제약 조건이 존재하는 연속시간 비선형 시스템에 대한 제약 조건을 만족하는 강건 최적 제어를 해결하기 위해 단일 크리틱을 사용한 적응 동적 프rogramming(ADP)을 활용한 비정책 위험 민감 강화 학습 프레임워크를 제안한다. 원래 시스템을 위험 민감 페널티 항을 포함한 보조 시스템으로 변환함으로써, 제약 조건 이행과 강건 안정성을 보장하면서도 비정책 학습과 지속적인 자극 조건을 통해 크리틱 신경망 가중치의 수렴을 보장한다.

ABSTRACT

This paper proposes an off-policy risk-sensitive reinforcement learning based control framework for stabilization of a continuous-time nonlinear system that subjects to additive disturbances, input saturation, and state constraints. By introducing pseudo controls and risk-sensitive input and state penalty terms, the constrained robust stabilization problem of the original system is converted into an equivalent optimal control problem of an auxiliary system. Then, aiming at the transformed optimal control problem, we adopt adaptive dynamic programming (ADP) implemented as a single critic structure to get the approximate solution to the value function of the Hamilton-Jacobi-Bellman (HJB) equation, which results in the approximate optimal control policy that is able to satisfy both input and state constraints under disturbances. By replaying experience data to the off-policy weight update law of the critic artificial neural network, the weight convergence is guaranteed. Moreover, to get experience data to achieve a sufficient excitation required for the weight convergence, online and offline algorithms are developed to serve as principled ways to record informative experience data. The equivalence proof demonstrates that the optimal control strategy of the auxiliary system robustly stabilizes the original system without violating input and state constraints. The proofs of system stability and weight convergence are provided. Simulation results reveal the validity of the proposed control framework.

연구 동기 및 목표

  • 입력 포화 및 상태 제약 조건이 존재하는 안전 중심 시스템에 대해 전통적인 적응 동적 프로그래밍(ADP)에서 제약 조건 이행이 이루어지지 않는 문제를 해결하기 위해.
  • 가감성 교란과 모델 불확실성 하에서도 성능과 안정성을 유지하는 강건 제어 프레임워크를 개발하기 위해.
  • 액터-크리틱 상호작용에 의존하지 않고도 비정책 학습에서 크리틱 신경망 가중치의 수렴을 보장하기 위해.
  • 단일 크리틱 구조 하에서 시스템 안정성과 가중치 수렴에 대한 엄밀한 증명을 제공하기 위해.
  • 충분한 자극을 확보하기 위한 체계적인 온라인 및 오프라인 경험 데이터 수집을 통해 실용적 구현을 가능하게 하기 위해.

제안 방법

  • 입력 및 상태 제약 조건을 위해 의사 제어 및 위험 민감 페널티 항을 사용하여 원래의 제약 조건이 있는 강건 제어 문제를 보조 시스템의 등가 최적 제어 문제로 변환한다.
  • 해밀턴-자코비-벨리만(HJB) 방정식의 해를 근사하기 위해 적응 동적 프로그래밍(ADP)에 단일 크리틱 구조를 구현하며, 크리틱의 가치 함수를 직접적으로 제어 정책 유도에 활용한다.
  • 경험 재생을 사용한 비정책 가중치 업데이트 법칙을 도입하여 크리틱 신경망 가중치의 안정적이고 수렴 가능한 학습을 보장한다.
  • 온라인 및 오프라인 알고리즘을 통한 지속적인 자극(PE) 조건을 도입하여 가중치 수렴을 위한 정보성 있는 경험 데이터를 생성한다.
  • hyperbolic tangent 기반 제어 정책을 사용한 위험 민감 비용 함수를 도입하여 입력 포화를 처리하면서도 강건성을 유지한다.
  • 보조 시스템의 최적 제어 정책이 상태 또는 입력 제약 조건을 위반하지 않으면서 원래 시스템의 강건 안정화를 보장함을 증명한다.

실험 결과

연구 질문

  • RQ1가감성 교란과 입력/상태 제약 조건 하에서 연속시간 비선형 시스템을 강건하게 안정화할 수 있는 비정책 위험 민감 강화 학습 프레임워크를 설계할 수 있는가?
  • RQ2히우리틱 페널티 함수나 변수 변환에 의존하지 않고 ADP 기반 제어에서 제약 조건 이행을 어떻게 보장할 수 있는가?
  • RQ3비정책 학습 하에서 단일 크리틱 ADP 구조에서 크리틱 신경망 가중치의 수렴을 보장하는 조건는 무엇인가?
  • RQ4실제로 충분한 자극을 확보하기 위해 지속적인 자극 조건을 만족시키기 위해 어떤 방법을 사용할 수 있는가?
  • RQ5제안된 방법은 불확실성 하에서도 성능과 강건성을 유지하면서 엄격한 제약 조건 이행을 보장하는가?

주요 결과

  • 제안된 프레임워크는 원래 시스템을 보조 시스템의 등가 최적 제어 문제로 변환함으로써 교란, 입력 포화 및 상태 제약 조건 하에서도 강건 안정화를 보장한다.
  • 크리틱 신경망 가중치는 잔여 집합으로 수렴하며, 이 집합의 크기는 시스템 파라미터, 제어 범위 및 근사 오차에 의해 유계로 제한된다.
  • 수집된 데이터가 지속적인 자극 조건을 만족할 경우, 경험 재생을 통한 비정책 학습 하에서 가중치 수렴이 보장된다.
  • 가중치 오차가 임계값을 초과할 경우 시스템의 라플라스 함수 도함수는 음의 정부호가 되며, 이는 닫힌 루프 시스템의 점근적 안정성을 보장한다.
  • 시뮬레이션 결과는 제안된 방법이 교란 하에서도 제약 조건 이행과 강건 성능을 유지하는 데 효과적임을 검증한다.
  • 비용 함수에 위험 민감성과 제약 조건 페널티를 명시적으로 통합함으로써 성능와 안전성의 균형을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.