Skip to main content
QUICK REVIEW

[论文解读] Value and Policy Iteration in Optimal Control and Adaptive Dynamic Programming

Dimitri P. Bertsekas|arXiv (Cornell University)|Jul 3, 2015
Adaptive Dynamic Programming Control参考文献 15被引用 4
一句话总结

本文证明了在具有终端集 $X_s$ 的离散时间无限时域最优控制问题中,最优代价函数 $J^*$ 是贝尔曼方程的最小解,且在一般条件下证明了值迭代(VI)与策略迭代(PI)的收敛性。关键贡献在于基于正则性的分析方法,确保了收敛性,而无需假设全局稳定控制器或有界代价函数。

ABSTRACT

In this paper, we consider discrete-time infinite horizon problems of optimal control to a terminal set of states. These are the problems that are often taken as the starting point for adaptive dynamic programming. Under very general assumptions, we establish the uniqueness of solution of Bellman's equation, and we provide convergence results for value and policy iteration.

研究动机与目标

  • 建立在具有终端集 $X_s$ 的无限时域最优控制问题中,最优代价函数 $J^*$ 作为贝尔曼方程最小解的唯一性。
  • 为具有非负、可能无穷的阶段代价的最优控制问题,提供值迭代(VI)与策略迭代(PI)算法的一般收敛条件。
  • 消除对全局稳定控制器假设的需求,使方法可更广泛地应用于具有无界或非光滑代价函数的问题。
  • 形式化 $S$-正则性在确保 VI 与 PI 收敛到最优代价函数 $J^*$ 中的作用,即使 $J^*$ 为扩展实值函数亦成立。
  • 通过抽象动态规划原理与正则性条件,为自适应动态规划提供理论基础。

提出的方法

  • 使用停止集 $X_s \subset X$,其中满足 $g(x,u) = 0$ 且 $f(x,u) = x$,确保对所有 $x \in X_s$ 有 $J^*(x) = 0$。
  • 定义集合 $X_f = \{x \in X \mid J^*(x) < \infty\}$ 为可渐近到达终端集 $X_s$ 的状态集合。
  • 引入策略-状态对 $(\pi, x_0)$ 的 $S$-正则性概念,其中 $J_\pi(x_0)$ 等于从任意 $J \in S$ 启动的 VI 的极限。
  • 应用正则性框架,证明 $J^*$ 是在集合 $\{J \in S \mid J \geq J^*\}$ 内贝尔曼方程的唯一解。
  • 通过 $J_{k+1}(x) = \inf_{u \in U(x)} \{g(x,u) + J_k(f(x,u))\}$ 实现值迭代,通过迭代策略评估与改进实现策略迭代。
  • 在较弱假设下(包括代价非负及最小化控制的存在性)建立 $J_k \to J^*$ 与 $J_{\mu^k} \to J^*$ 的逐点收敛。

实验结果

研究问题

  • RQ1在何种条件下,最优代价函数 $J^*$ 是贝尔曼方程在受限函数类中的唯一解?
  • RQ2在阶段代价可能无穷的条件下,值迭代何时收敛到最优代价函数 $J^*$?
  • RQ3策略迭代在何种条件下收敛到 $J^*$,并确保每一步中最小化控制的存在性?
  • RQ4如何在不假设全局稳定控制器存在的情况下,保证 VI 与 PI 的收敛性?
  • RQ5$S$-正则性条件在确保 $J^*$ 为唯一解以及 VI 收敛于 $J^*$ 的过程中起什么作用?

主要发现

  • 最优代价函数 $J^*$ 是在集合 $\{J \in S \mid J \geq J^*\}$ 内贝尔曼方程的唯一解,其中 $S$ 是满足正则性条件的函数集合。
  • 当策略-状态对为 $S$-正则且 $J^*$ 是终止策略下的最优代价时,对任意非负初始函数 $J_0$,值迭代均逐点收敛至 $J^*$。
  • 在相同的正则性与最小化控制存在性条件下,策略迭代也逐点收敛至 $J^*$,且满足 $J_{\mu^k} \to J^*$ 当 $k \to \infty$。
  • 本文建立的收敛性无需代价函数有界性或全局稳定控制器的存在性假设,从而扩大了对无界与非光滑问题的适用范围。
  • 结果适用于非折扣与折扣问题,且在折扣问题中由于折扣因子的存在,收敛性保证更强。
  • 理论框架基于抽象动态规划与正则性理论,为自适应动态规划与强化学习算法提供了统一的理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。