Skip to main content
QUICK REVIEW

[论文解读] Continuous Relaxation of Symbolic Planner for One-Shot Imitation Learning

De-An Huang, Danfei Xu|arXiv (Cornell University)|Aug 16, 2019
Multimodal Machine Learning Applications参考文献 31被引用 12
一句话总结

本文提出了一种符号规划的连续松弛方法,用于一次性模仿学习,通过在概率符号定位输出上操作,实现了从单次示范中稳健执行任务。通过将跨任务泛化与策略执行解耦,并在低数据场景下处理不确定性,该方法在极少元训练数据下实现了最先进性能,优于基线方法且无需人工启发式规则。

ABSTRACT

We address one-shot imitation learning, where the goal is to execute a previously unseen task based on a single demonstration. While there has been exciting progress in this direction, most of the approaches still require a few hundred tasks for meta-training, which limits the scalability of the approaches. Our main contribution is to formulate one-shot imitation learning as a symbolic planning problem along with the symbol grounding problem. This formulation disentangles the policy execution from the inter-task generalization and leads to better data efficiency. The key technical challenge is that the symbol grounding is prone to error with limited training data and leads to subsequent symbolic planning failures. We address this challenge by proposing a continuous relaxation of the discrete symbolic planner that directly plans on the probabilistic outputs of the symbol grounding model. Our continuous relaxation of the planner can still leverage the information contained in the probabilistic symbol grounding and significantly improve over the baseline planner for the one-shot imitation learning tasks without using large training data.

研究动机与目标

  • 解决现有单次模仿学习方法数据效率低下的问题,这些方法通常需要数百个元训练任务。
  • 通过将模仿学习建模为符号规划问题,实现跨任务泛化与策略执行的解耦。
  • 在符号定位易出错且可能导致不一致符号状态的低数据场景下,提升方法的鲁棒性。
  • 在概率符号表示而非离散、易错的符号分配上进行规划。
  • 在无需人工规则或启发式方法的前提下,实现对未见任务和替代解法路径的强泛化能力。

提出的方法

  • 将单次模仿学习建模为符号规划问题,将策略执行与跨任务泛化分离。
  • 引入模块化符号定位网络(SGN),将连续状态(如物体位姿、图像)映射为符号状态,并通过参数共享实现数据效率。
  • 提出符号规划的连续松弛方法,使其在符号状态的概率分布上操作,而非离散集合。
  • 用概率推理替代符号规划中的集合运算,以处理不确定性并避免无效状态转移。
  • 将SGN的连续输出作为规划器的输入,使其能够对模糊或噪声较大的符号预测进行推理。
  • 采用端到端训练方式,每项任务仅依赖一次示范,依赖规划器对不确定性的推理能力。

实验结果

研究问题

  • RQ1符号规划能否被适配于单次模仿学习,通过将泛化与策略执行解耦来提升数据效率?
  • RQ2当符号定位在低数据场景下产生不一致或概率性状态预测时,规划器如何实现稳健运行?
  • RQ3符号规划的连续松弛能否在处理不完美符号定位带来的不确定性方面优于离散符号规划器?
  • RQ4所提方法是否能在无需人工启发式规则的前提下,泛化到未见任务和替代解法路径?
  • RQ5该方法能否显著减少元训练任务数量,相比以往方法大幅降低所需任务数?

主要发现

  • 连续规划器在SGN产生不一致离散符号输出时仍能成功完成任务,优于符号规划器基线。
  • 仅使用8个元训练任务,连续规划器在物体分类任务中达到100%成功率,而符号规划器和NTG基线即使使用15个任务也未能达到100%。
  • 连续规划器在无需任何手工规则修正无效状态的情况下,性能与人工启发式基线相当。
  • 该方法显著减少了所需元训练任务数量——在远少于以往工作所需的400–1000个任务下,实现了强泛化能力。
  • 在积木堆叠任务中,由于离散符号分配错误,符号规划器失败,而连续规划器成功,展现出对定位错误的鲁棒性。
  • 连续松弛使系统能够在概率符号分布上有效规划,即使在离散定位失败时,也能推断出正确的目标状态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。