Skip to main content
QUICK REVIEW

[论文解读] Value Function and Optimal Trajectories for Regional Control Problems via Dynamic Programming and Pontryagin Maximum Principles

Guy Barles, Ariela Briani|arXiv (Cornell University)|May 13, 2016
Optimization and Variational Analysis参考文献 41被引用 4
一句话总结

本文建立了在状态空间界面处具有不连续动力学和代价泛函的区域最优控制问题中,动态规划与庞特里亚金最大值原理之间的联系。在排除颤振(Zeno)行为的可数次切换假设下,推导出值函数并证明了混合最优控制框架下的新正则性结果。

ABSTRACT

In this paper we study the optimal trajectories for regional, deterministic optimal control problems, i.e., problems where the dynamics and the cost functional can be completely different in two regions of the state space and therefore present discontinuities at their interface. Our first aim is to prove the classical link between the study of optimality conditions and the Bell-man approach in this framework, and then exploit it to recover the value function under the assumption that optimal trajectories have only a countable number of switchings between the different regions. From an application point of view this is a very reasonable assumption because in practice one never implements chattering trajectories (i.e., enjoying the Zeno phenomenon). As a consequence of our description we obtain a new regularity result for the value function in the framework of hybrid optimal control problems.

研究动机与目标

  • 在具有不连续动力学和代价泛函的区域最优控制问题中,建立动态规划与庞特里亚金最大值原理之间的经典联系。
  • 分析在状态空间区域之间动力学和代价不同的混合系统中的最优轨迹。
  • 证明可数次切换的假设在物理上是合理的,从而排除颤振(Zeno)行为。
  • 在该切换假设下推导值函数,并证明其在混合最优控制设置下的正则性。
  • 为使用动态规划与最大值原理方法求解具有不连续性的区域控制问题提供理论基础。

提出的方法

  • 形式化定义在两个状态空间区域中具有不同动力学和代价泛函的区域最优控制问题。
  • 应用动态规划,推导在存在不连续性时值函数的哈密顿-雅可比-贝尔曼方程。
  • 应用庞特里亚金最大值原理,刻画穿越界面的轨迹的必要最优性条件。
  • 在可数次切换约束下,建立通过动态规划得到的值函数与通过最大值原理得到的最优代价之间的等价性。
  • 证明在仅存在可数次区域间切换的假设下,值函数是利普希茨连续的。
  • 利用问题的混合结构,分析值函数在界面处的正则性与连续性性质。

实验结果

研究问题

  • RQ1在具有不连续动力学的区域最优控制问题中,如何调和动态规划原理与庞特里亚金最大值原理?
  • RQ2在具有状态空间不连续性的混合最优控制系统中,何种条件可确保值函数的存在性与正则性?
  • RQ3在何种假设下可保证最优轨迹在区域之间仅有可数次切换?
  • RQ4颤振(Zeno)行为的缺失如何影响值函数的结构与正则性?
  • RQ5在此混合框架中,哈密顿-雅可比-贝尔曼方程与通过最大值原理导出的必要最优性条件之间存在何种理论联系?

主要发现

  • 在具有不连续动力学的区域最优控制问题中,严格建立了动态规划方法与庞特里亚金最大值原理之间的联系。
  • 在仅存在可数次区域间切换的假设下,证明了值函数是利普希茨连续的。
  • 通过排除颤振轨迹,本文证明了可数次切换假设在物理上的合理性。
  • 该分析得出了混合最优控制问题中值函数的新正则性结果,将经典结果扩展至不连续设置。
  • 在给定假设下,正式证明了通过动态规划推导出的值函数与通过最大值原理得到的最优代价之间的等价性。
  • 该框架为使用动态规划与最大值原理技术求解具有状态空间不连续性的区域控制问题提供了统一的理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。