[논문 리뷰] Data-based approximate policy iteration for nonlinear continuous-time optimal control design
이 논문은 정확한 시스템 모델이 필요 없이 비선형 연속시간 최적 제어를 위한 데이터 기반 근사 정책 반복(※API) 방법을 제안한다. 액터-크리틱 신경망과 최소 제곱 가중 잔여법을 사용하여 실제 시스템 데이터로부터 해밀턴-자코비-벨리만 방정식의 해와 최적 제어 정책을 직접 학습하며, 제약이 없는 경우와 입력 제약이 있는 경우 모두 수렴성과 효과적인 제어를 달성한다. 엄격한 입력 제한 조건이 있는 비선형 벤치마크 시스템에서 검증되었다.
This paper addresses the model-free nonlinear optimal problem with generalized cost functional, and a data-based reinforcement learning technique is developed. It is known that the nonlinear optimal control problem relies on the solution of the Hamilton-Jacobi-Bellman (HJB) equation, which is a nonlinear partial differential equation that is generally impossible to be solved analytically. Even worse, most of practical systems are too complicated to establish their accurate mathematical model. To overcome these difficulties, we propose a data-based approximate policy iteration (API) method by using real system data rather than system model. Firstly, a model-free policy iteration algorithm is derived for constrained optimal control problem and its convergence is proved, which can learn the solution of HJB equation and optimal control policy without requiring any knowledge of system mathematical model. The implementation of the algorithm is based on the thought of actor-critic structure, where actor and critic neural networks (NNs) are employed to approximate the control policy and cost function, respectively. To update the weights of actor and critic NNs, a least-square approach is developed based on the method of weighted residuals. The whole data-based API method includes two parts, where the first part is implemented online to collect real system information, and the second part is conducting offline policy iteration to learn the solution of HJB equation and the control policy. Then, the data-based API algorithm is simplified for solving unconstrained optimal control problem of nonlinear and linear systems. Finally, we test the efficiency of the data-based API control design method on a simple nonlinear system, and further apply it to a rotational/translational actuator system. The simulation results demonstrate the effectiveness of the proposed method.
연구 동기 및 목표
- 정확한 시스템 모델이 제공되지 않는 비선형 연속시간 최적 제어 문제를 해결하기 위해.
- 시스템 데이터로부터 직접 최적 제어 정책을 학습하는 모델 프리 강화 학습 접근법을 개발하기 위해.
- 신경망 근사 기반으로 입력 제약 조건 하에서 정책 반복 알고리즘의 수렴성을 확보하기 위해.
- 입력 포화가 있는 복잡한 회전/선형 운동 액추에이터(RTAC) 벤치마크와 같은 복잡한 비선형 시스템에서도 효과성을 입증하기 위해.
- 伝통적인 모델 기반 최적 제어 설계의 실용적 대안을 제공하기 위해.
제안 방법
- 온라인 데이터 수집과 오프라인 정책 반복의 두 단계로 구성된 데이터 기반 근사 정책 반복(※API) 알고리즘을 개발하였다.
- 액터-크리틱 신경망 구조를 사용하여 크리틱이 비용-투-골 함수를 근사하고 액터가 제어 정책을 근사한다.
- 시스템 동역학을 요구하지 않는 가중 잔여법 기반 최소 제곱법을 사용하여 신경망 가중치를 갱신한다.
- 실제 시스템 궤적을 사용하여 비선형 편미분방정식(PDE)의 해석적 해를 구하지 않고도 일반화된 해밀턴-자코비-벨리만(GHJB) 방정식을 반복적으로 해결한다.
- 입력 제약 조건은 제어 입력의 비선형 변환을 통해 처리되며, 하이퍼볼릭 탄젠트 함수를 사용하여 범위를 강제로 제한한다.
- 제안된 데이터 기반 프레임워크 하에서 알고리즘의 수렴성이 이론적으로 증명되었다.
실험 결과
연구 질문
- RQ1시스템 모델이 필요 없이 모델 프리 정책 반복 방법이 비선형 연속시간 최적 제어 문제를 효과적으로 해결할 수 있는가?
- RQ2신경망을 사용하여 데이터 기반 최적 제어 설계에 입력 제약 조건을 어떻게 통합할 수 있는가?
- RQ3제안된 데이터 기반 ※API 방법이 실질적 시스템 데이터만으로 최적 해에 수렴하는가?
- RQ4입력 포화가 있는 복잡한 비선형 시스템, 예를 들어 RTAC 벤치마크에서 이 방법의 효과성은 어떠한가?
- RQ5시스템 동역학을 알지 못하는 상황에서 최소 제곱 가중 잔여법이 신경망 가중치를 정확하게 갱신할 수 있는가?
주요 결과
- 데이터 기반 ※API 알고리즘이 실질적 시스템 데이터만을 사용하여 제약이 없는 비선형 시스템과 제약이 있는 비선형 시스템 모두 최적 해에 성공적으로 수렴하였다.
- 입력 제약 조건 |u| ≤ 0.2가 있는 RTAC 시스템에서 최종 제어 정책이 제약 조건을 만족하였으며, 시뮬레이션 전반에 걸쳐 제어 입력이 범위 내에 유지되었다.
- 비용 함수 J(t)는 시간이 증가함에 따라 0.6781로 수렴하였으며, 이는 학습된 정책 하에서 효과적인 최적 성능를 나타내었다.
- 크리틱과 액터 신경망 가중치 벡터의 노름은 각각 8.1462와 31.7143로 수렴하여 안정적인 학습을 나타내었다.
- 그림 15~18에 나타낸 바와 같이, 첫 6개의 대표적 크리틱 및 액터 신경망 가중치가 반복 과정을 거쳐 수렴하였으며, 이는 학습 진행 상황을 확인할 수 있었다.
- 이 방법은 단순한 비선형 시스템과 복잡한 RTAC 벤치마크 시스템 양쪽 모두에서 뛰어난 성능을 보였으며, 실용적 적용 가능성은 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.