Skip to main content
QUICK REVIEW

[论文解读] Entropy Regularized Motion Planning via Stein Variational Inference

Alexander Lambert, Byron Boots|arXiv (Cornell University)|Jul 11, 2021
Reinforcement Learning in Robotics参考文献 20被引用 4
一句话总结

该论文提出了一种基于粒子的运动规划算法,通过使用带熵正则化的史坦变分推断(Stein Variational Inference),为高自由度系统生成多样化、低成本且无碰撞的轨迹。通过将轨迹优化表述为概率推理,并利用高斯-牛顿海森矩阵近似,该方法能够高效地从轨迹的多模态后验分布中采样,从而实现鲁棒的规划与值函数估计,适用于模仿学习和强化学习。

ABSTRACT

Many Imitation and Reinforcement Learning approaches rely on the availability of expert-generated demonstrations for learning policies or value functions from data. Obtaining a reliable distribution of trajectories from motion planners is non-trivial, since it must broadly cover the space of states likely to be encountered during execution while also satisfying task-based constraints. We propose a sampling strategy based on variational inference to generate distributions of feasible, low-cost trajectories for high-dof motion planning tasks. This includes a distributed, particle-based motion planning algorithm which leverages a structured graphical representations for inference over multi-modal posterior distributions. We also make explicit connections to both approximate inference for trajectory optimization and entropy-regularized reinforcement learning.

研究动机与目标

  • 为高自由度运动规划任务生成多样化、低成本的可行轨迹分布。
  • 解决在任务约束和避障条件下轨迹后验分布的多模态性挑战。
  • 通过提供丰富且类专家的轨迹分布,实现高效的模仿学习与强化学习。
  • 通过变分推断引入不确定性与熵正则化,改进现有轨迹优化方法。
  • 开发一种可扩展的基于粒子的推理框架,利用结构化图模型与曲率信息,实现高效采样。

提出的方法

  • 将运动规划表述为轨迹上的贝叶斯后验推断,其中最优性通过一个二值指示变量编码,代价函数则建模为似然函数。
  • 在轨迹参数上使用高斯过程先验以保证平滑性,并实现从稀疏支持状态的高效插值。
  • 应用带各向异性核与基于海森矩阵的度量的史坦变分梯度下降(SVG-D),通过迭代更新粒子位置,以最小化与目标后验之间的KL散度。
  • 采用稀疏高斯-牛顿法近似海森矩阵,以降低计算成本,同时保持问题的稀疏性与结构特征。
  • 基于经验后验分布推导出基于粒子的值函数估计,使其可用于基于模型的强化学习与模仿学习。
  • 通过粒子间平均海森矩阵实现曲率感知更新,提升在高维轨迹空间中的收敛性与探索效率。

实验结果

研究问题

  • RQ1如何在高维运动规划中高效地从低成本、无碰撞轨迹的多模态后验分布中采样?
  • RQ2熵正则化在提升模仿学习中轨迹分布多样性与鲁棒性方面起到何种作用?
  • RQ3与标准轨迹优化方法相比,基于海森矩阵度量的史坦变分推断是否能在收敛性与分布质量方面表现更优?
  • RQ4如何利用结构化图模型与稀疏线性代数,将概率运动规划扩展至高自由度系统?
  • RQ5基于粒子的后验近似在多大程度上可改善基于模型的强化学习中的值函数估计?

主要发现

  • 所提方法在7自由度操作任务中成功生成了多样化、低成本且无碰撞的轨迹,如可视化结果与补充视频所示。
  • 基于粒子的后验近似能够准确估计最优值函数,其中式(25)提供了可微且可扩展的估计方法。
  • 将平均海森矩阵用作预条件矩阵可提升收敛性,并在高维轨迹空间中实现高效、曲率感知的更新。
  • 在单粒子极限下,该算法可恢复GPMP2方法,验证了其与现有成熟方法的一致性。
  • 即使在单一同伦类内,该方法也能有效探索多模态轨迹分布,如定性结果所示。
  • 通过使用稀疏线性求解器与结构化海森矩阵近似,显著提升了计算速度,尤其在长时域规划中效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。