Skip to main content
QUICK REVIEW

[论文解读] Constrained Differential Dynamic Programming Revisited

Yuichiro Aoyama, George I. Boutselis|arXiv (Cornell University)|May 3, 2020
Reinforcement Learning in Robotics参考文献 18被引用 10
一句话总结

本文通过整合松弛变量与增广拉格朗日方法,提出了一种新颖的约束微分动态规划(DDP)框架,以提升轨迹优化中的收敛性与可行性。该方法引入了S-KKT与基于增广拉格朗日的算法,保持了二阶可微性,在机器人控制场景中处理状态与控制约束时,其速度、鲁棒性与约束处理能力均优于以往方法。

ABSTRACT

Differential Dynamic Programming (DDP) has become a well established method for unconstrained trajectory optimization. Despite its several applications in robotics and controls however, a widely successful constrained version of the algorithm has yet to be developed. This paper builds upon penalty methods and active-set approaches, towards designing a Dynamic Programming-based methodology for constrained optimal control. Regarding the former, our derivation employs a constrained version of Bellman's principle of optimality, by introducing a set of auxiliary slack variables in the backward pass. In parallel, we show how Augmented Lagrangian methods can be naturally incorporated within DDP, by utilizing a particular set of penalty-Lagrangian functions that preserve second-order differentiability. We demonstrate experimentally that our extensions (individually and combinations thereof) enhance significantly the convergence properties of the algorithm, and outperform previous approaches on a large number of simulated scenarios.

研究动机与目标

  • 解决机器人与控制领域中缺乏一种数值鲁棒、广泛适用的约束DDP算法的问题。
  • 克服现有惩罚法与活动集法在轨迹优化过程中处理状态与控制约束时的局限性。
  • 开发一种基于DDP的方法,保持二阶可微性,确保快速收敛并提升可行性。
  • 通过实证验证所提方法相较于SQP与以往DDP变体在多种机器人系统中的性能表现。
  • 结合松弛变量与增广拉格朗日方法,以提升数值性能。

提出的方法

  • 将松弛变量公式引入贝尔曼最优性原理,避免对活动约束的假设,从而实现基于KKT的DDP方法(S-KKT)。
  • 提出一种受增广拉格朗日启发的方法,采用惩罚-拉格朗日函数,保持二阶可微性,这对DDP收敛至关重要。
  • 通过在反向传播中引入辅助松弛变量,推导出贝尔曼原理的约束版本,实现在约束下的平滑优化。
  • 结合S-KKT与AL方法,以发挥两者优势:S-KKT确保可行性与鲁棒性,而AL实现快速初始收敛。
  • 采用高斯-牛顿近似进行海森矩阵估计与一阶动力学展开,保持计算效率。
  • 使用改进的惩罚函数,确保一阶导数连续且渐近收敛至精确的KKT解。

实验结果

研究问题

  • RQ1能否开发一种基于DDP的方法,在处理一般状态与控制约束的同时,保持二阶收敛性?
  • RQ2在贝尔曼方程中使用松弛变量,相较于活动集法或投影法,如何提升收敛性与可行性?
  • RQ3能否在DDP中集成增广拉格朗日方法,同时保持平滑性并实现快速收敛?
  • RQ4所提出的S-KKT与AL方法在性能与鲁棒性方面,相较于SQP与以往约束DDP方法表现如何?
  • RQ5S-KKT与AL的结合是否能通过互补各自弱点,实现更优的数值性能?

主要发现

  • 在H=200且时间预算限制下,2D小车系统中AL-S-KKT方法实现了最低成本(2.44)与最短时间(2.36秒),优于所有其他方法。
  • 在四旋翼飞行器系统中,AL-S-KKT方法在H=200时于5.91秒内实现成本7.48,显著优于SQP(成本2.43×10³,耗时6秒)与AL(在H=300时不可行)。
  • S-KKT在所有测试案例中均保持可行性(g与f的不可行性为0.0%),即使在时间预算紧张时亦然,而SQP与AL则未能收敛或违反约束。
  • S-KKT方法对初始轨迹条件表现出更强鲁棒性,即使从非最优点开始,仍能保持可行性与低成本。
  • AL方法在早期迭代中收敛迅速,但在接近约束时变慢,且偶有违反约束;而S-KKT以较慢的单次迭代时间为代价,确保了可行性。
  • S-KKT与AL的结合(AL-S-KKT)实现了最佳整体性能,平衡了速度与可行性,尤其在时间约束下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。