Skip to main content
QUICK REVIEW

[论文解读] GPU Based Path Integral Control with Learned Dynamics

Grady Williams, Eric Rombokas|arXiv (Cornell University)|Mar 1, 2015
Robotic Path Planning Algorithms参考文献 9被引用 11
一句话总结

本文提出了一种基于GPU加速的、滚动时域路径积分控制算法,该算法将学习到的概率动力学模型(通过LWPR实现)与不确定性感知规划相结合。通过在GPU上对数千条轨迹进行采样,并根据代价和模型不确定性进行加权,该方法实现了在障碍物密集环境中的实时、安全导航,其一致性与安全性优于简单的学习模型和解析动力学模型。

ABSTRACT

We present an algorithm which combines recent advances in model based path integral control with machine learning approaches to learning forward dynamics models. We take advantage of the parallel computing power of a GPU to quickly take a massive number of samples from a learned probabilistic dynamics model, which we use to approximate the path integral form of the optimal control. The resulting algorithm runs in a receding-horizon fashion in realtime, and is subject to no restrictive assumptions about costs, constraints, or dynamics. A simple change to the path integral control formulation allows the algorithm to take model uncertainty into account during planning, and we demonstrate its performance on a quadrotor navigation task. In addition to this novel adaptation of path integral control, this is the first time that a receding-horizon implementation of iterative path integral control has been run on a real system.

研究动机与目标

  • 开发一种实时、滚动时域最优控制框架,结合基于模型的路径积分控制与学习到的动力学模型。
  • 通过在控制规划过程中引入模型不确定性,解决学习动力学模型中的偏差问题。
  • 利用概率动力学模型实现在复杂环境中数据高效、自主的任务学习。
  • 首次在真实物理机器人上实现滚动时域PI²的实机部署。
  • 证明通过不确定性感知规划实现的隐式方差最小化可提升在障碍物密集任务中的安全性与一致性。

提出的方法

  • 该算法使用局部加权投影回归(LWPR)学习具有均值和方差预测的概率前向动力学模型。
  • 通过从学习到的动力学模型的完整预测分布中采样轨迹,对PI²-RH公式进行改进,以整合模型不确定性。
  • 在GPU上进行大规模轨迹并行采样,以高效逼近实时路径积分解。
  • 通过控制动作的加权平均计算控制策略,其中权重由负代价到目标的指数函数确定,并按温度参数λ的倒数进行缩放。
  • 通过优先选择低不确定性、安全路径,该方法在障碍物密集环境中隐式最小化轨迹方差。
  • 系统以滚动时域方式运行,每一步时间均使用当前状态估计和学习到的模型重新规划。

实验结果

研究问题

  • RQ1基于GPU加速的路径积分控制框架能否在实时机器人控制中有效处理带有不确定性的学习动力学模型?
  • RQ2在路径积分控制公式中引入模型不确定性,如何提升障碍物导航中的安全性和一致性?
  • RQ3在真实世界导航任务中,学习到的动力学模型能否在鲁棒性和性能上超越解析模型?
  • RQ4该算法是否在代价函数中未显式包含方差项的情况下,隐式最小化轨迹方差?
  • RQ5子轨迹数对规划安全性、计算成本和任务成功率有何影响?

主要发现

  • 该算法在除M = 1外的所有设置中均成功完成避障任务,M = 1时仅使用均值预测,共7次试验中成功4次。
  • 使用M = 4个子轨迹时整体性能最佳,在所有指标上均优于解析模型:平均总代价(5868.72 vs. 6943.27)、每秒代价(168.22 vs. 186.93)以及平均最近通过距离(0.30m vs. 0.23m)。
  • M = 1设置在成功试验中平均总代价最低(5733.55),但表现出高风险与不一致性,凸显忽略模型不确定性所带来的危险性。
  • 随着子轨迹数增加,LWPR加速度预测的平均方差从M=1时的1.39降至M=32时的1.14,表明预测置信度提高。
  • 该算法在障碍物密集环境中隐式最小化轨迹方差,而无需在代价函数中显式加入方差惩罚项,优先选择更安全、更确定的路径。
  • 系统实现了实时性能,平均优化时间在34.91ms(M=4)至52.13ms(M=32)之间,证明了其在真实世界部署中的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。