[논문 리뷰] On Time-Consistent Solution to Time-Inconsistent Linear-Quadratic Optimal Control of Discrete-Time Stochastic Systems
이 논문은 시간에 일관되지 않은 목적이 있는 이산시간 스토크라스틱 선형-제곱형 최적 제어 문제에 대해 시간에 일관된 해를 제안한다. 최대원리 유형의 필요 및 충분 조건을 통해 개방형 평형 제어와 선형 피드백 평형 전략을 도입하고, 일반화된 차분 리카티 방정식(GDREs)과 선형 차분 방정식(LDEs)의 가역성과의 등가성을 확립한다.
In this paper, we investigate a class of time-inconsistent discrete-time stochastic linear-quadratic optimal control problems, whose time-consistent solutions consist of an open-loop equilibrium control and a linear feedback equilibrium strategy. The open-loop equilibrium control is defined for a given initial pair, while the linear feedback equilibrium strategy is defined for all the initial pairs. Maximum-principle-type necessary and sufficient conditions containing stationary and convexity are derived for the existence of these two time-consistent solutions, respectively. Furthermore, for the case where the system matrices are independent of the initial time, we show that the existence of the open-loop equilibrium control for a given initial pair is equivalent to the solvability of a set of nonsymmetric generalized difference Riccati equations and a set of linear difference equations. Moreover, the existence of linear feedback equilibrium strategy is equivalent to the solvability of another set of symmetric generalized difference Riccati equations.
연구 동기 및 목표
- 표준 동적 프rogramming가 실패하는 이산시간 스토크라스틱 선형-제곱형(LQ) 최적 제어 문제에서 시간에 일관되지 않은 목표를 다루기.
- 개방형 평형 제어와 선형 피드백 평형 전략에 대한 시간에 일관된 프레임워크 개발.
- 최대원리 유형 기준을 사용한 평형 해 존재에 대한 필요 및 충분 조건 수립.
- 시스템 행렬이 시간 불변일 경우, 일반화된 차분 리카티 방정식(GDREs)과 선형 차분 방정식(LDEs)을 통한 해의 특성화.
- 실제 구현을 위한 스토크라스틱 제어 시스템에서 평형 전략을 계산하는 체계적 방법 제공.
제안 방법
- 주어진 초기 쌍에 대해 개방형 평형 제어를 정의하고, 모든 초기 쌍에 대해 선형 피드백 평형 전략을 정의한다.
- 평형 존재를 위한 정류성과 볼록성 조건을 포함하는 최대원리 유형의 필요 및 충분 조건을 유도한다.
- 시간 불변 시스템 행렬을 가질 경우, 개방형 평형 제어가 존재함과 동시에 비대칭 GDREs와 LDEs의 집합이 해를 가짐과 동치임을 증명한다.
- 선형 피드백 평형 전략이 존재함과 동시에 대칭 GDREs의 집합이 해를 가짐과 동치임을 보인다.
- 최적성 시스템에서 상태 및 쌍대 과정을 모델링하기 위해 정방향-역방향 스토크라스틱 차분 방정식(FBSDEs)을 사용한다.
- 역방향 재귀를 적용하여 GDREs와 LDEs를 풀어 피드백 이득과 평형 제어를 계산할 수 있도록 한다.
실험 결과
연구 질문
- RQ1어떤 조건에서 이산시간 스토크라스틱 LQ 문제의 주어진 초기 쌍에 대해 시간에 일관된 개방형 평형 제어가 존재하는가?
- RQ2모든 초기 쌍에 대해 유효한 선형 피드백 평형 전략이 존재하는 조건은 무엇인가?
- RQ3일반화된 차분 리카티 방정식(GDREs)과 선형 차분 방정식(LDEs)을 통해 평형 해 존재성을 어떻게 특성화할 수 있는가?
- RQ4시간에 일관되지 않은 LQ 문제와 대칭 및 비대칭 GDREs의 가역성 간의 관계는 무엇인가?
- RQ5제안된 프레임워크는 시간 변화 또는 마코프-모드된 매개변수를 가진 시스템으로 확장될 수 있는가?
주요 결과
- 주어진 초기 쌍에 대한 개방형 평형 제어의 존재는 비대칭 일반화된 차분 리카티 방정식(GDREs)의 집합과 선형 차분 방정식(LDEs)의 집합의 가역성과 동치이다.
- 선형 피드백 평형 전략의 존재는 대칭 일반화된 차분 리카티 방정식(GDREs)의 집합의 가역성과 동치이다.
- 수치 예제를 통해 유도된 GDREs와 LDEs의 가역성이 확인되었으며, 양의 정부호 행렬(예: $\widetilde{W}_{1,1} > 0$, $\widetilde{W}_{0,0} > 0$)이 조건을 검증한다.
- 예제 5.2와 5.3에서 명시적인 피드백 이득 행렬 $\Phi_0, \Phi_1, \Phi_2$ 및 $\Phi_0, \Phi_1$을 계산하여 평형 전략의 실용적 계산을 시연한다.
- 이 프레임워크는 비정규 행렬 및 심지어 음의 정부호 제어 가중치 행렬(예: $R_{0,0}$ 비정규, $R_{0,1}$ 음의 정부호)을 처리할 수 있어 기존 LQ 이론을 초월한다.
- 클래식한 동적 프로그래밍을 일반화하여, 벨만 원칙에 따라 최적 제어가 시간에 일관되지 않을 경우에도 시간에 일관된 해를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.