Skip to main content
QUICK REVIEW

[论文解读] Probably Approximately Correct Vision-Based Planning using Motion Primitives

Sushant Veer, Anirudha Majumdar|arXiv (Cornell University)|Feb 28, 2020
Robotic Path Planning Algorithms被引用 5
一句话总结

本文提出了一种基于PAC-Bayes的框架,用于训练视觉引导的运动规划器,在新环境中的泛化性能具有可证明的保证。通过结合进化策略进行先验学习与PAC-Bayes界优化的凸优化方法,该方法训练出的深度神经网络策略在未见过的障碍物场和复杂地形上实现了75–80%的成功率,并提供了高置信度的性能证书。

ABSTRACT

This paper presents an approach for learning vision-based planners that provably generalize to novel environments (i.e., environments unseen during training). We leverage the Probably Approximately Correct (PAC)-Bayes framework to obtain an upper bound on the expected cost of policies across all environments. Minimizing the PAC-Bayes upper bound thus trains policies that are accompanied by a certificate of performance on novel environments. The training pipeline we propose provides strong generalization guarantees for deep neural network policies by (a) obtaining a good prior distribution on the space of policies using Evolutionary Strategies (ES) followed by (b) formulating the PAC-Bayes optimization as an efficiently-solvable parametric convex optimization problem. We demonstrate the efficacy of our approach for producing strong generalization guarantees for learned vision-based motion planners through two simulated examples: (1) an Unmanned Aerial Vehicle (UAV) navigating obstacle fields with an onboard vision sensor, and (2) a dynamic quadrupedal robot traversing rough terrains with proprioceptive and exteroceptive sensors.

研究动机与目标

  • 开发一种视觉引导的规划框架,为新环境提供明确且可证明的泛化保证。
  • 解决基于深度学习的视觉规划器在安全性要求高的机器人应用中缺乏性能边界的问题。
  • 实现深度神经网络策略的训练,使其在之前未见过的环境中具备预期性能的证书。
  • 将运动基元与PAC-Bayes理论相结合,提升视觉控制中的样本效率与泛化能力。
  • 通过模拟无人机和四足机器人运动任务,展示该框架的有效性,并提供可量化的性能边界。

提出的方法

  • 利用PAC-Bayes框架推导出所有环境中策略期望代价的上界,从而实现性能认证。
  • 采用进化策略(ES)在PAC-Bayes优化之前,学习策略空间上的高质量先验分布。
  • 通过相对熵规划(REP)将PAC-Bayes优化形式化为参数化的凸问题,从而实现高效求解。
  • 使用运动基元库对复杂运动进行分解,提升训练稳定性,并支持多样化行为的组合。
  • 设计一个深度神经网络策略,将视觉观测(如RGB-D)和本体感知反馈映射到基元库中的一个运动基元。
  • 在训练过程中直接优化PAC-Bayes界,确保所得到的策略在未见过的环境中具有保证的性能水平。

实验结果

研究问题

  • RQ1能否为新环境中的视觉引导运动规划器训练出具有可证明泛化保证的策略?
  • RQ2PAC-Bayes理论如何与运动基元和深度学习有效结合,以支持视觉引导规划?
  • RQ3能否利用进化策略学习一个强先验,以提升高维策略空间中PAC-Bayes界边界的紧致性?
  • RQ4在使用所提框架时,能在未见过的环境中保证多高的性能水平?
  • RQ5在泛化界紧致性方面,该框架随训练环境数量增加的扩展性如何?

主要发现

  • 在无人机导航任务中,该方法保证规划器在99%置信度下可成功穿越75–80%的未见过的障碍物场。
  • 在四足机器人运动任务中,PAC-Bayes界认证了机器人平均可成功穿越79.27%的未见过的复杂地形,置信度为99%。
  • 两阶段训练流程——先使用ES学习先验,再通过REP进行PAC-Bayes优化——得到了更紧致且更可靠的泛化界。
  • 该框架在无需显式几何世界模型或专家示范的情况下,实现了强大的泛化性能。
  • PAC-Bayes优化过程计算效率高,每次迭代求解REP子问题仅需约1秒。
  • 该方法提供了在训练与测试环境来自同一基础分布的假设下成立的性能证书。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。