Skip to main content
QUICK REVIEW

[论文解读] Coupling and a generalised Policy Iteration Algorithm in continuous time

Saul Jacka, Aleksandar Mijatović|arXiv (Cornell University)|Jul 25, 2017
Advanced Control Systems Optimization参考文献 15被引用 3
一句话总结

本文提出了一种针对连续时间受控扩散过程的广义策略迭代算法,其漂移和扩散系数均可控。通过使用Lindvall和Rogers的镜像耦合方法,证明了收益函数的单调收敛以及策略的局部一致收敛至最优解,从而在模型数据满足可验证条件时,证明该算法定义良好且收敛于值函数。

ABSTRACT

We analyse a version of the policy iteration algorithm for the discounted infinite-horizon problem for controlled multidimensional diffusion processes, where both the drift and the diffusion coefficient can be controlled. We prove that, under assumptions on the problem data, the payoffs generated by the algorithm converge monotonically to the value function and an accumulation point of the sequence of policies is an optimal policy. The algorithm is stated and analysed in continuous time and state, with discretisation featuring neither in theorems nor the proofs. A key technical tool used to show that the algorithm is well-defined is the mirror coupling of Lindvall and Rogers.

研究动机与目标

  • 开发一种用于连续时间与连续状态空间中无限时域折扣控制问题的策略迭代算法。
  • 证明由该算法生成的收益序列单调收敛于值函数。
  • 建立策略序列的某个子序列局部一致收敛于最优策略。
  • 通过使用关联PDE的古典解而非Sobolev空间中的广义解,确保算法定义良好。
  • 利用镜像耦合作为核心技术工具,即使在标准耦合条件不成立时,也证明收敛性。

提出的方法

  • 该算法在连续时间中定义,无需离散化,依赖于一个带有任意正标度函数的广义策略迭代框架。
  • 利用Lindvall和Rogers的镜像耦合方法,证明局部Lipschitz连续的马尔可夫策略的收益函数在经典意义下满足Poisson方程。
  • 通过比较耦合扩散过程的时间改变距离过程与Bessel过程的路径,证明耦合以高概率成功。
  • 通过对角化论证和Arzela-Ascoli型紧致性结果,建立收益与策略的收敛性。
  • 证明值函数是收益序列的逐点极限,且极限策略被证明为最优。
  • 理论结果通过一个数值例子得到支持,表明算法在六次迭代以内即实现快速收敛。

实验结果

研究问题

  • RQ1广义策略迭代算法在连续时间受控扩散过程中是否单调收敛于值函数?
  • RQ2能否通过HJB方程的古典解而非Sobolev空间中的广义解,使策略迭代算法定义良好?
  • RQ3在何种条件下,镜像耦合可确保局部Lipschitz策略的收益函数是Poisson方程的古典解?
  • RQ4由该算法生成的策略序列是否可局部一致收敛于最优策略?
  • RQ5当漂移和扩散系数均可控时,该算法是否仍保持定义良好且收敛?

主要发现

  • 在模型数据满足可验证假设的条件下,策略迭代算法生成的收益序列单调收敛于值函数。
  • 该算法生成的策略序列的某个子序列局部一致收敛于一个局部Lipschitz的极限策略。
  • 极限策略被证明为最优策略,其值函数等于收益序列的逐点极限。
  • 镜像耦合技术确保了即使在标准耦合条件不成立时,局部Lipschitz马尔可夫策略的收益函数仍是Poisson方程的古典解。
  • 该算法在连续时间中定义良好,定理与证明中均无离散化,依赖于古典PDE解。
  • 数值例子表明算法收敛迅速,可在六次迭代以内找到最优策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。