Skip to main content
QUICK REVIEW

[论文解读] Learning Deep Parameterized Skills from Demonstration for Re-targetable Visuomotor Control

Jonathan Chang, Nishanth Kumar|arXiv (Cornell University)|Oct 23, 2019
Advanced Vision and Imaging参考文献 29被引用 5
一句话总结

本文提出一种端到端的深度学习方法,通过演示训练参数化视觉-运动策略,仅使用部分训练目标,即可实现对未见过的目标的零样本泛化。通过条件化目标参数并利用视觉辅助控制架构,该模型在仅训练33%可能目标的情况下,于仿真和真实机器人实验中均实现了超过90%的成功率。

ABSTRACT

Robots need to learn skills that can not only generalize across similar problems but also be directed to a specific goal. Previous methods either train a new skill for every different goal or do not infer the specific target in the presence of multiple goals from visual data. We introduce an end-to-end method that represents targetable visuomotor skills as a goal-parameterized neural network policy. By training on an informative subset of available goals with the associated target parameters, we are able to learn a policy that can zero-shot generalize to previously unseen goals. We evaluate our method in a representative 2D simulation of a button-grid and on both button-pressing and peg-insertion tasks on two different physical arms. We demonstrate that our model trained on 33% of the possible goals is able to generalize to more than 90% of the targets in the scene for both simulation and robot experiments. We also successfully learn a mapping from target pixel coordinates to a robot policy to complete a specified goal.

研究动机与目标

  • 解决现有视觉-运动策略在单一场景中无法泛化到多个未见目标的局限性。
  • 使物理机器人能够学习可指向的目标技能,可针对特定目标进行控制而无需重新训练。
  • 开发一种样本高效的方法,仅使用部分训练目标即可实现对新型目标参数的零样本泛化。
  • 研究目标参数表示方式对跨视觉变化的泛化性能的影响。
  • 在仿真和真实机器人任务中展示鲁棒的泛化能力,包括精确操作如插销插入。

提出的方法

  • 训练一个包含三个模块的深度神经网络:视觉编码器、辅助目标位姿预测头和控制策略头。
  • 将策略条件化于指定目标的参数向量 τ(例如,行/列索引或像素位置)。
  • 使用具有多样化目标参数的专家演示进行端到端模仿学习,训练单一、可重定向的策略。
  • 引入一个视觉模块,处理RGB和深度图像,以提取用于目标定位的视觉特征。
  • 训练辅助任务模块,从视觉特征和目标参数 τ 预测末端执行器的最终位姿。
  • 利用预测的位姿和视觉特征,在控制模块中生成控制动作(速度指令)。

实验结果

研究问题

  • RQ1在仅使用部分目标进行训练后,单一深度视觉-运动策略是否能实现对未见过的目标参数的零样本泛化?
  • RQ2目标参数表示方式的选择(例如,像素位置与行/列索引)如何影响对视觉变化的泛化能力?
  • RQ3该模型在无需额外训练的情况下,能在多大程度上泛化到新型目标排列(例如,偏移、打乱、聚集的按钮)?
  • RQ4该方法是否能在需要高精度控制的真实机器人任务(如按键和插销插入)中实现高性能?
  • RQ5当视觉场景发生变化(例如,面板位置改变)时,模型性能是否因所用目标表示方式而下降?

主要发现

  • 在仅训练33%可能目标的情况下,该模型在2D仿真和真实实验中对未见目标的成功率均超过90%。
  • 当使用像素坐标作为目标参数 τ 时,实现了对截然不同的视觉场景(包括非网格布局)的零样本泛化,因为策略学习到了与视觉上下文无关的坐标到运动的映射。
  • 当使用行/列索引作为 τ 时,模型依赖视觉模块定位按钮面板,从而能泛化到偏移或随机放置的面板,但在打乱或聚集的布局中失败。
  • 在仅训练4个按钮(共9个)后,模型在仿真中成功泛化到所有9个可能的按钮位置,展示了强大的样本效率。
  • 仅使用200条总轨迹(每按钮50条),模型在仿真中即实现了对所有按钮位置和布局的完全泛化,性能达到或超过以往使用更多数据的方法。
  • 目标表示方式的选择对泛化性能具有决定性影响:基于像素的 τ 实现了对视觉变化的鲁棒性,而基于索引的 τ 需要视觉定位,且在非网格布局中失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。