[논문 리뷰] Model-free optimal control of discrete-time systems with additive and multiplicative noises
이 논문은 시스템 행렬을 필요로 하지 않고, 배치 최소 제곱법과 수치 평균을 사용하여 가우시안 노이즈가 첨가된 이산 시간 시스템의 최적 제어를 위한 모델 프리 강화 학습 알고리즘을 제안한다. 이 알고리즘은 최적 제어 정책으로 수렴하며, 수치 실험에서 다른 정책 반복 알고리즘보다 뛰어난 성능을 보이며, 알려지지 않은 확률적 시스템에 대해 강건성과 실용성을 입증한다.
This paper investigates the optimal control problem for a class of discrete-time stochastic systems subject to additive and multiplicative noises. A stochastic Lyapunov equation and a stochastic algebra Riccati equation are established for the existence of the optimal admissible control policy. A model-free reinforcement learning algorithm is proposed to learn the optimal admissible control policy using the data of the system states and inputs without requiring any knowledge of the system matrices. It is proven that the learning algorithm converges to the optimal admissible control policy. The implementation of the model-free algorithm is based on batch least squares and numerical average. The proposed algorithm is illustrated through a numerical example, which shows our algorithm outperforms other policy iteration algorithms.
연구 동기 및 목표
- 시스템 행렬이 완전히 알려지지 않은 상태에서 가우시안 노이즈가 첨가된 이산 시간 확률적 시스템의 최적 제어 문제를 해결하기 위해.
- 시스템 동역학에 대한 사전 지식 없이 상태 및 입력 데이터만을 사용하여 최적 제어 정책을 학습하는 모델 프리 강화 학습 알고리즘을 개발하기 위해.
- 일반적인 확률적 시스템 조건 하에서 제안된 학습 알고리즘의 수렴 보장을 확립하기 위해.
- 측정 가능한 노이즈나 시스템 행렬의 부분적 지식과 같은 제약 조건을 제거하여 실용적 적용 가능성을 향상시키기 위해.
- 수치 예제를 통해 기존의 정책 반복 및 모델 프리 강화 학습 알고리즘과 비교하여 뛰어난 성능을 입증하기 위해.
제안 방법
- 유한한 비용 함수를 확보하기 위해 할인 무한 수렴 비용 함수를 사용하여 최적 제어 문제를 수식화한다.
- 알려진 시스템 행렬 조건 하에서 최적 제어 정책을 특성화하기 위해 확률적 대수 Riccati 방정식(SARE)과 확률적 르아프노프 방정식(SLE)을 유도한다.
- 행렬 갱신을 사용하여 SARE를 반복적으로 해결하는 오프라인 정책 반복(PI) 알고리즘을 제안하며, 수렴성이 증명된다.
- 배치 최소 제곱법(BLS)과 수치 평균을 사용하여 기대값을 근사함으로써 Q-함수 커널 행렬을 추정하는 온라인 모델 프리 강화 학습 알고리즘을 개발한다.
- 측정 가능한 노이즈 가정을 제거하고 데이터 기반 추정을 직접 사용함으로써 강건성과 적용 가능성을 향상시킨다.
- 기대값에 대해 경험적 평균을 사용하고 커널 행렬 추정에 BLS를 적용하여 신경망이나 모델 근사 없이 알고리즘을 구현한다.
실험 결과
연구 질문
- RQ1시스템 행렬을 알지 못하는 이산 시간 확률적 시스템에 대해 가우시안 노이즈가 첨가된 경우, 모델 프리 강화 학습 알고리즘을 설계할 수 있는가?
- RQ2일반적인 노이즈 조건 하에서 관측된 상태 및 입력 궤적만을 사용하여 최적 제어 정책을 어떻게 학습할 수 있는가?
- RQ3제안된 모델 프리 강화 학습 알고리즘이 진정한 최적 제어 정책으로 수렴하기 위한 조건은 무엇인가?
- RQ4수렴 속도와 정확도 측면에서 제안된 알고리즘은 기존의 정책 반복 및 모델 프리 강화 학습 방법과 어떻게 비교되는가?
- RQ5측정 가능한 노이즈를 가정하거나 신경망 기반 모델을 요구하지 않고도 알고리즘을 구현할 수 있는가?
주요 결과
- 제안된 모델 프리 강화 학습 알고리즘은 알려진 시스템 행렬 조건 하에서 오프라인 PI 알고리즘과 동치임을 증명함으로써 최적 제어 정책으로 수렴한다.
- 제어 이득 추정치는 $\hat{L} = [-0.9369\ -1.5772]$이며, 최적값인 $L^* = [-0.9319\ -1.5784]$와 매우 가까운 값을 기록한다.
- 추정된 최적 비용은 $\hat{V}(x_0) = 62.1118$이며, 진정한 최적 비용인 $V^*(x_0) = 62.0422$와 비교해 상대 오차가 0.11% 미만임을 보여준다.
- 수치 비교 결과, 제안된 알고리즘은 [2]의 PI 및 [29]의 PI보다 더 빠른 수렴 속도와 낮은 상대 비용 오차를 달성하며, MFLQv3와 유사한 성능을 보인다.
- 제어 이득 정확도와 수렴 속도 측면에서 다른 PI 기반 방법보다 뛰어나며, 수치 평균에 의한 미미한 변동 외에는 거의 영향을 받지 않는다.
- 측정 가능한 노이즈나 모델 신경망이 필요로 하지 않으며, 더 쉽게 구현할 수 있어 이전 연구에 비해 더 실용적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.