Skip to main content
QUICK REVIEW

[论文解读] Learning Locomotion Controllers for Walking Using Deep FBSDE

Bolun Dai, Virinchi Roy Surabhi|arXiv (Cornell University)|Jul 16, 2021
Robotic Locomotion and Control参考文献 17被引用 4
一句话总结

该论文提出了一种基于LSTM神经网络的深度前向-后向随机微分方程(FBSDE)控制器,用于求解机器人行走的最优控制问题,特别应用于具有状态约束的线性倒立摆模型(LIPM)。该方法实现了实时、高频控制,计算速度比基于CVX的优化方法快6.67倍,可在噪声和约束条件下实现20多步的稳定周期性行走。

ABSTRACT

In this paper, we propose a deep forward-backward stochastic differential equation (FBSDE) based control algorithm for locomotion tasks. We also include state constraints in the FBSDE formulation to impose stable walking solutions or other constraints that one may want to consider (e.g., energy). Our approach utilizes a deep neural network (i.e., LSTM) to solve, in general, high-dimensional Hamilton-Jacobi-Bellman (HJB) equation resulting from the stated optimal control problem. As compared to traditional methods, our proposed method provides a higher computational efficiency in real-time; thus yielding higher frequency implementation of the closed-loop controllers. The efficacy of our approach is shown on a linear inverted pendulum model (LIPM) for walking. Even though we are deploying a simplified model of walking, the methodology is applicable to generalized and complex models for walking and other control/optimization tasks in robotic systems. Simulation studies have been provided to show the effectiveness of the proposed methodology.

研究动机与目标

  • 开发一种计算高效、适用于机器人行走任务的实时控制方法,结合深度学习技术。
  • 将深度FBSDE扩展至处理如行走机器人等具有离散跃迁(如脚部切换)的混合动力系统。
  • 在FBSDE框架中引入状态约束(如最小质心速度),以实现期望的动力学行为。
  • 通过在局部足部附着坐标系中重新初始化状态,实现从单步策略到多步行走的泛化。
  • 在高维设置下,与传统基于优化的方法(如CVX)相比,展示出显著的计算效率优势。

提出的方法

  • 将行走控制问题建模为随机最优控制任务,导出汉密尔顿-雅可比-贝尔曼(HJB)方程。
  • 使用深度神经网络(LSTM)近似求解HJB方程,实现价值函数与最优控制策略的端到端学习。
  • 采用前向-后向随机微分方程(FBSDE)框架,将状态动力学与伴随(协态)动力学耦合,支持时间反向传播。
  • 通过基于惩罚的方法将状态约束引入FBSDE公式,以约束质心速度范围,确保鲁棒性与稳定性。
  • 通过在每一步将状态重新初始化至局部坐标系,实现对多步行走的策略适应,并基于终端速度动态调整步长。
  • 在仿真中仅对单步行走进行训练,并通过状态重映射与基于速度的步长调整,将策略泛化至更长序列。

实验结果

研究问题

  • RQ1深度FBSDE能否有效应用于具有离散步态跃迁的混合动力系统(如双足行走)?
  • RQ2在实时控制场景中,所提出的深度FBSDE控制器相比传统优化求解器(如CVX)在计算效率上表现如何?
  • RQ3能否有效将状态约束(如最小质心速度)嵌入FBSDE框架,以引导期望的行走行为?
  • RQ4通过状态重初始化与动态步长调整,单步策略在多步行走中的泛化能力达到何种程度?
  • RQ5在LIPM框架下,该学习到的控制器在过程噪声与模型不确定性下的鲁棒性如何?

主要发现

  • 与基于CVX的优化相比,深度FBSDE控制器在控制计算上实现了6.67倍的速度提升,且方差更低,适用于高频实时控制。
  • 在无噪声与有噪声的LIPM仿真中,控制器均能保持20多步的稳定周期性行走,终端速度收敛至接近标称值的狭窄区间。
  • 该方法成功实现了最小质心速度1.0 m/s的约束,64条采样轨迹在约束条件下全部保持在边界内,而无约束情况下则频繁违反该限制。
  • 通过在每一步将状态重新初始化至局部足部附着坐标系,学习到的策略能有效泛化至多步行走,实现基于终端速度的动态步长调整。
  • 控制器对噪声表现出强鲁棒性:即使在噪声条件下,终端速度仍紧密聚集在标称值附近,表明对扰动具有强适应能力。
  • 该方法具有良好的计算可扩展性,相较于传统求解器,在高维系统与更长预测时域下,性能提升更为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。