[论文解读] Partially Observed Optimal Control for Mean-Field SDEs
本文建立了由非线性平均场SDE驱动的、受控制与状态分布依赖系数影响的、部分可观测的平均场类型随机最优控制问题的随机最大值原理,其中观测噪声可能进入状态,且观测系数依赖于控制及其分布。主要贡献在于通过Riccati方程和配方法,在线性二次设定下,对最优控制进行了对偶表征和显式状态反馈表示。
In this paper, we are concerned with a stochastic optimal control problem of mean-field type under partial observation, where the state equation is governed by the controlled nonlinear mean-field stochastic differential equation, moreover the observation noise is allowed to enter into the state equation and the observation coefficients may depend not only on the control process and but also on its probability distribution. Under standard assumptions on the coefficients, by dual analysis and convex variation, we establish the maximum principle for optimal control in a strong sense as well as a weak one, respectively. As an application, a partially observed linear quadratic control problem of mean-field type is studied detailed and the corresponding dual characterization and state feedback presentation of the partially observed optimal control are obtained by the stochastic maximum principles and the classic technique of completing squares.
研究动机与目标
- 解决在状态和观测动态依赖于控制分布的条件下,部分可观测的平均场类型随机最优控制问题。
- 将随机最大值原理扩展至具有不完全信息的平均场设定,允许观测噪声影响状态。
- 利用伴随方程和Girsanov定理,推导最优控制的对偶表征。
- 通过Riccati方程,在线性二次情形下提供最优控制的状态反馈表示。
- 在部分可观测条件下,建立最优控制与前向-后向平均场系统解之间的联系。
提出的方法
- 应用对偶分析和凸变分法,推导强形式与弱形式下的最优性必要条件。
- 利用Girsanov定理变换概率测度,以处理部分可观测设定。
- 为具有状态和观测对分布依赖的平均场类型问题,推导伴随的倒向随机微分方程(BSDEs)。
- 对成本泛函应用配方法,以获得最优控制的显式反馈形式。
- 在线性二次情形下,求解Riccati方程,以获得最优控制的状态反馈表示。
- 通过伴随过程的条件期望,建立最优控制的对偶表征。
实验结果
研究问题
- RQ1如何将随机最大值原理扩展至部分可观测条件下平均场类型的最优控制问题?
- RQ2当观测噪声影响状态且观测系数依赖于控制分布时,最优性的必要条件是什么?
- RQ3能否在部分可观测的平均场设定下推导出最优控制的对偶表征?
- RQ4在线性二次平均场问题中,如何在部分可观测条件下以状态反馈形式表示最优控制?
- RQ5Riccati方程在刻画线性二次情形下最优控制与成本方面起什么作用?
主要发现
- 最优控制具有对偶表示形式,涉及伴随过程的条件期望,该形式通过强形式与弱形式的最大值原理推导得出。
- 在线性二次情形下,最优控制通过两个Riccati方程的解显式给出状态反馈律。
- Riccati方程(4.20)和(4.21)分别控制反馈增益的演化,其终端条件分别为M₁和M₁+M₂。
- 最小成本由⟨Π(0)x, x⟩给出,其中Π(0)是第二个Riccati方程在时间零的解。
- 状态反馈表示式(4.18)将控制分为两部分:一部分依赖于给定观测下状态的条件期望,另一部分依赖于无条件期望。
- 推导依赖于成本泛函中的配方法,并应用Kallianpur-Striebel公式,以在部分可观测条件下最小化期望成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。