Skip to main content
QUICK REVIEW

[논문 리뷰] A Linear-Quadratic Optimal Control Problem for Mean-Field Stochastic Differential Equations in Infinite Horizon

Jianhui Huang, Xun Li|arXiv (Cornell University)|2012. 08. 27.
Stochastic processes and financial applications참고 문헌 5인용 수 6
한 줄 요약

이 논문은 무한 시간 영역에서 상수 계수를 가진 평균장 확률미분방정식에 대한 선형-이차 최적 제어 문제를 연구한다. 두 개의 대수 Riccati 방정식의 해를 통해 안정화 피드백 제어 법칙의 존재성을 확립하며, 최적 제어는 상태와 그 평균을 모두 포함하는 선형 상태 피드백 형태로 표현된다. 또한, 준정적 프로그래밍 방법을 사용하여 해의 존재성을 검증한다.

ABSTRACT

A linear-quadratic (LQ, for short) optimal control problem is considered for mean-field stochastic differential equations with constant coefficients in an infinite horizon. The stabilizability of the control system is studied followed by the discussion of the well-posedness of the LQ problem. The optimal control can be expressed as a linear state feedback involving the state and its mean, through the solutions of two algebraic Riccati equations. The solvability of such kind of Riccati equations is investigated by means of semi-definite programming method.

연구 동기 및 목표

  • 무한 시간 영역에서 평균장 확률미분방정식에 대한 선형-이차 최적 제어 문제의 안정가능성과 잘 정의됨을 조사한다.
  • 최적 제어 법칙을 상태와 그 평균을 모두 포함하는 피드백 형태로 유도한다.
  • 관련된 대수 Riccati 방정식의 해 존재성을 준정적 프로그래밍 기법을 사용하여 확립한다.
  • SDP 기반의 계산을 통한 수치적 검증을 제공한다. 이는 안정화 피드백 이득과 Riccati 해를 계산한다.

제안 방법

  • 상태와 제어 계수에 상태와 제어의 기대값이 포함된 제어된 평균장 SDE를 수립한다.
  • 상태, 그 평균, 제어, 제어 평균의 제곱항을 포함하는 무한 시간 영역 LQ 비용 기능을 정의한다.
  • 최적 제어를 선형 피드백 형태로 유도한다: $ u^*(t) = \Gamma^*(X^*(t) - \mathbb{E}[X^*(t)]) + \bar{\Gamma}^*\mathbb{E}[X^*(t)] $, 여기서 피드백 이득은 두 개의 대수 Riccati 방정식의 해로부터 유도된다.
  • 선형 행렬 부등식(LMI) 시스템의 타당성에 의해 MF-L² 안정가능성을 확립하며, 이를 준정적 프로그래밍(SDP) 문제로 재구성한다.
  • SDP 방법을 사용하여 연립 대수 Riccati 방정식(SARE)을 수치적으로 해결하여 최적 피드백 행렬을 구한다.
  • 5차원 시스템을 대상으로 한 수치 실험을 통해 접근법을 검증한다. MATLAB의 SDP 솔버를 사용하여 안정화 피드백 이득과 Riccati 해를 계산한다.

실험 결과

연구 질문

  • RQ1평균장 확률 제어 시스템이 무한 시간 영역에서 MF-L² 안정가능해지기 위한 조건은 무엇인가?
  • RQ2무한 시간 영역 LQ 문제의 최적 제어를 상태와 그 평균을 모두 포함하는 선형 피드백 형태로 표현할 수 있는가?
  • RQ3관련된 대수 Riccati 방정식을 효율적으로 해결하는 방법은 무엇이며, 그 해 존재성을 보장하는 조건은 무엇인가?
  • RQ4무엇인가 이러한 시스템의 안정가능성을 검증하고 최적 피드백 이득을 계산하는 데 사용할 수 있는 수치적 방법이 있는가?

주요 결과

  • 최적 제어는 두 개의 대수 Riccati 방정식의 해로부터 유도된 상태와 그 평균을 포함하는 선형 상태 피드백 형태로 명시적으로 표현된다.
  • MF-L² 안정가능성은 선형 행렬 부등식(LMI) 시스템의 타당성과 동치이며, 준정적 프로그래밍을 통해 검증된다.
  • 수치 실험을 통해 시스템의 안정가능성이 확인되었으며, SDP를 통해 타당한 행렬 $ \mathbb{X}, \bar{\mathbb{X}}, Y, \bar{Y} $ 가 계산되어 안정화 피드백 이득 $ K = Y\mathbb{X}^{-1} $ 과 $ \bar{K} = \bar{Y}\bar{\mathbb{X}}^{-1} $ 를 도출하였다.
  • 연립 대수 Riccati 방정식(SARE)의 해는 수치적으로 계산되었으며, 대칭 행렬 $ P $ 와 $ \Pi $ 가 도출되었으며, 이는 최적 제어 법칙에 필수적이다.
  • 피드백 이득 $ K $ 와 $ \bar{K} $ 는 각각 $ K \approx \begin{bmatrix}-0.3725 & 0.1843 & 0.3405 & -0.5390 & -0.1289 \\ 0.1689 & 0.5864 & 0.6700 & -0.8716 & -0.3709 \end{bmatrix} $ 과 $ \bar{K} \approx \begin{bmatrix}4.0644 & 1.2449 & -3.7655 & 1.9996 & -1.3936 \\ 4.2782 & 0.3405 & 0.6593 & 0.7858 & 0.2849 \end{bmatrix} $ 로 명시적으로 계산되었으며, 이는 시스템의 안정성을 보장한다.
  • SARE의 수치적 해는 $ P \approx \begin{bmatrix}0.4151 & 0.3890 & 0.2068 & 0.0162 & -0.4059 \\ 0.3890 & 2.7208 & 1.9097 & -2.6074 & -0.7756 \\ 0.2068 & 1.9097 & 1.8535 & -1.8330 & -0.8979 \\ 0.0162 & -2.6074 & -1.8330 & 4.2403 & -0.2665 \\ -0.4059 & -0.7756 & -0.8979 & -0.2665 & 2.1537 \end{bmatrix} $ 과 $ \Pi \approx \begin{bmatrix}0.6147 & 0.5721 & 0.2644 & -0.1455 & -0.6138 \\ 0.5721 & 4.2579 & 2.8706 & -4.4158 & -0.6536 \\ 0.2644 & 2.8706 & 2.6758 & -2.6653 & -1.0890 \\ -0.1455 & -4.4158 & -2.6653 & 6.8158 & -1.0674 \\ -0.6138 & -0.6536 & -1.0890 & -1.0674 & 3.1641 \end{bmatrix} $ 로 도출되었으며, 해의 존재성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.