[论文解读] On optimal mean-field type control problems of stochastic systems with jump processes under partial information
本文在部分观测下,针对由跳跃过程驱动的前向随机系统,利用马利万微积分推导出显式伴随方程,建立了最优均场类型控制的最大值原理。关键贡献在于,通过滤波将均场项与部分信息相结合,提出了一个包含最优性必要条件的理论框架,并通过线性二次(LQ)示例验证了该理论,实现了显式反馈控制律的合成。
This paper considers the problem of partially observed optimal control for forward stochastic systems which are driven by Brownian motions and an independent Poisson random measure with a feature that the cost functional is of mean-field type. When all the system coefficients and the objective performance functionals are allowed to be random, possibly non-Markovian, Malliavin calculus is employed to derive a maximum principle for the optimal control of such a system where the adjointprocess is explicitly expressed. We also investigate the mean-field type optimal control problems for systems driven by mean-field type stochastic differential equations (SDEs in short) with jump processes, in which the coefficients contain not only the state process but also its marginal distribution under partially observed information. The maximum principle is established using convex variational technique with an illustrating example about linear-quadratic optimal control.
研究动机与目标
- 研究由布朗运动和泊松随机测度驱动的随机系统中的最优控制问题,其中状态仅部分可观测。
- 将最大值原理扩展至均场类型动力系统,其中系数依赖于状态过程的分布。
- 在成本泛函和状态动力学中引入随机且非马尔可夫系数,以扩大适用范围。
- 在部分信息条件下,利用马利万微 calculus 推导出控制适应于观测滤波的必要最优性条件。
- 通过线性二次(LQ)控制示例验证理论框架,给出显式反馈控制律。
提出的方法
- 将状态动力学表述为由布朗运动和独立泊松随机测度驱动的前向均场SDE(带跳跃)。
- 通过噪声信号过程 $ dY(t) = h(t,x^v(t))dt + dW_2(t) $ 建模部分观测,其中控制适应于观测滤波 $ \mathscr{F}_t^Y $。
- 应用马利万微积分推导伴随过程 $ (p,q,R) $,显式表达出协态变量的倒向SDE。
- 引入一个哈密顿函数 $ H $,其包含漂移、扩散、跳跃和观测项,系数依赖于状态、其期望值及控制。
- 通过凸变分技术推导最大值原理,得到一个涉及给定观测滤波的条件期望的必要条件。
- 通过推导反馈控制律 $ u(t) = -\frac{1}{\rho(t)O(t)} \mathbb{E}[C(t)p(t) + F(t)q(t) + \int R(t,z)I(t,z)\mu(dz) \mid \mathscr{F}_t^Y] + M(t) $,求解线性二次示例。
实验结果
研究问题
- RQ1如何在部分观测下,为具有跳跃扩散的均场类型控制问题推导最大值原理?
- RQ2在存在随机、非马尔可夫系数及部分信息的条件下,伴随过程的显式形式是什么?
- RQ3马利万微积分如何促进在此非马尔可夫、部分观测设定下必要最优性条件的推导?
- RQ4该理论最大值原理能否应用于求解具有均场和跳跃成分的线性二次(LQ)控制问题?
- RQ5在部分观测、均场跳跃系统中,最优控制相对于观测滤波的结构是怎样的?
主要发现
- 为在部分观测下具有跳跃过程的均场类型控制问题,推导出一个必要最优性条件,其表达为涉及哈密顿函数与伴随过程的条件期望。
- 伴随过程 $ (p,q,R) $ 通过一个包含均场项且依赖于观测过程的倒向SDE被显式刻画。
- 在线性二次示例中,证明最优控制为给定观测滤波下协态变量条件期望的线性反馈。
- 最优控制律为 $ u(t) = -\frac{1}{\rho(t)O(t)} \mathbb{E}[C(t)p(t) + F(t)q(t) + \int R(t,z)I(t,z)\mu(dz) \mid \mathscr{F}_t^Y] + M(t) $,在LQ设定下可显式计算。
- 即使系数为随机且非马尔可夫时,最大值原理依然有效,扩展了以往依赖马尔可夫或完全信息假设的研究结果。
- 马利万微积分的使用使得伴随过程的显式表达式得以推导,这对实际实现与最优性验证至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。