Skip to main content
QUICK REVIEW

[论文解读] Optimal and Learning Control for Autonomous Robots

Jonas Buchli, Farbod Farshidian|arXiv (Cornell University)|Aug 30, 2017
Advanced Control Systems Optimization参考文献 3被引用 8
一句话总结

本文提出了一套统一的自主机器人最优控制与学习控制框架,通过一致的符号体系整合了动态规划、随机最优控制与强化学习。该框架引入基于有限差分的策略梯度方法并辅以正则化,以在高维控制问题中实现高效的梯度估计,从而支持复杂机器人系统反馈策略的鲁棒学习。

ABSTRACT

Optimal and Learning Control for Autonomous Robots has been taught in the Robotics, Systems and Controls Masters at ETH Zurich with the aim to teach optimal control and reinforcement learning for closed loop control problems from a unified point of view. The starting point is the formulation of of an optimal control problem and deriving the different types of solutions and algorithms from there. These lecture notes aim at supporting this unified view with a unified notation wherever possible, and a bit of a translation help to compare the terminology and notation in the different fields. The course assumes basic knowledge of Control Theory, Linear Algebra and Stochastic Calculus.

研究动机与目标

  • 在机器人控制中,将最优控制与强化学习统一于单一的理论与符号框架之下。
  • 通过带正则化的有限差分方法,实现在高维控制问题中的高效策略梯度估计。
  • 通过迭代线性二次与路径积分方法,支持反馈控制器的设计。
  • 为研究生层次的机器人教育提供兼具理论与实用算法的教科书资源。
  • 通过统一术语、符号与算法结构,弥合经典最优控制与现代强化学习之间的鸿沟。

提出的方法

  • 利用向后搜索与代价到目标函数,推导确定性与随机系统的最优性原理及贝尔曼方程。
  • 应用汉密尔顿-雅可比-贝尔曼方程,推导有限与无限时域连续时间最优控制解。
  • 通过系统动态与代价函数的局部线性二次近似,实现迭代线性二次控制(ILQC)。
  • 引入基于随机扰动的有限差分策略梯度估计,以及线性系统的伪逆解:$[\nabla J(\theta); J(\theta)] = (\Delta\Theta^T\Delta\Theta + \lambda I)^{-1}\Delta\Theta^T R$。
  • 在伪逆中引入正则化($\lambda I$),以提高数值稳定性并降低梯度估计的方差。
  • 采用基于滚动回溯的回报估计与广义有限差分法进行参数更新的梯度下降算法。

实验结果

研究问题

  • RQ1如何在单一理论与符号框架下统一最优控制与强化学习?
  • RQ2在无需解析梯度的情况下,估计高维连续控制问题中的策略梯度的最有效方法是什么?
  • RQ3正则化如何提升有限差分策略梯度估计的鲁棒性与准确性?
  • RQ4代价到目标函数在实现高效向后动态规划与反馈策略综合中起什么作用?
  • RQ5如何利用迭代线性二次与路径积分方法求解机器人中的复杂非线性最优控制问题?

主要发现

  • 带正则化的有限差分策略梯度方法为高维控制问题中的梯度估计提供了数值稳定且准确的途径。
  • 在伪逆中引入正则化可显著降低梯度估计的方差,即使扰动数量超过参数维度亦然。
  • 代价到目标函数支持最优策略的高效向后计算,构成动态规划与值迭代的基础。
  • ILQC算法通过迭代线性化系统并求解一系列LQR问题,收敛至局部最优反馈策略。
  • 路径积分方法在特定假设下可实现基于采样的最优控制,并获得闭式解,从而实现高效的策略学习。
  • 广义有限差分法可适用于有限与无限时域问题,仅需对回报函数进行适当调整。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。