Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Goal Inference for Visuomotor Learning and Planning

Annie Xie, Avi Singh|arXiv (Cornell University)|Sep 30, 2018
Robot Manipulation and Learning参考文献 50被引用 16
一句话总结

该论文提出了一种少样本目标推理框架,通过元学习分类器,使机器人仅需少量成功结果示例即可学习任务目标。通过利用元学习在多样化任务间实现泛化,该方法在视觉导航、绳索操作和真实世界物体重排任务中均实现了高性能,且仅需极少的人工监督。

ABSTRACT

Reinforcement learning and planning methods require an objective or reward function that encodes the desired behavior. Yet, in practice, there is a wide range of scenarios where an objective is difficult to provide programmatically, such as tasks with visual observations involving unknown object positions or deformable objects. In these cases, prior methods use engineered problem-specific solutions, e.g., by instrumenting the environment with additional sensors to measure a proxy for the objective. Such solutions require a significant engineering effort on a per-task basis, and make it impractical for robots to continuously learn complex skills outside of laboratory settings. We aim to find a more general and scalable solution for specifying goals for robot learning in unconstrained environments. To that end, we formulate the few-shot objective learning problem, where the goal is to learn a task objective from only a few example images of successful end states for that task. We propose a simple solution to this problem: meta-learn a classifier that can recognize new goals from a few examples. We show how this approach can be used with both model-free reinforcement learning and visual model-based planning and show results in three domains: rope manipulation from images in simulation, visual navigation in a simulated 3D environment, and object arrangement into user-specified configurations on a real robot.

研究动机与目标

  • 为解决真实世界机器人中难以手动设计奖励函数的任务目标指定问题。
  • 使机器人能够仅从少量成功任务结果的示例中推断目标,模仿人类的少样本泛化能力。
  • 开发一种可扩展的、与任务无关的框架,避免针对每项任务进行工程设计或环境改造。
  • 将学习到的目标分类器集成到无模型强化学习和视觉模型基规划中。
  • 实现在无需从头开始训练的情况下,泛化到新任务和全新物体配置的能力。

提出的方法

  • 在多样化任务上进行元训练,使用成功结果的正样本和负样本,以学习目标相关视觉特征中的不变性。
  • 利用元学习得到的分类器,仅凭新任务中目标状态的少量示例,推断出奖励函数。
  • 从分类器的置信度得分中提取奖励信号,以指导强化学习或规划算法。
  • 通过将分类器用作成功度量标准,将该框架应用于无模型强化学习(如DQN、PPO)和视觉模型基规划。
  • 利用预训练视觉主干网络的特征表示,提取与任务无关的视觉嵌入,用于目标比较。
  • 在元训练过程中使用对比学习目标,促使分类器关注任务相关因素(如物体间的相对位置)。

实验结果

研究问题

  • RQ1单一目标分类器是否能仅凭少量成功示例,在多样化视觉任务中实现泛化?
  • RQ2元学习得到的目标分类器在基于视觉的控制任务中,对强化学习和规划的支持效果如何?
  • RQ3该框架是否能学习到有意义的、抽象的目标(如物体间的相对位置),而非仅记忆特定图像?
  • RQ4在真实世界和仿真环境中,少样本目标推理与启发式距离度量(如像素距离或自编码器距离)相比表现如何?
  • RQ5该方法是否能在不重新训练的情况下,泛化到新型物体配置和未见过的任务组合?

主要发现

  • 所提出的FLO(少样本目标学习)方法在绳索操作任务中实现了0.27的中位数距离(四分位距:0.18–0.34),显著优于像素距离(0.54)和自编码器距离(0.59)。
  • 在DQN的视觉导航任务中,FLO实现了77.8%的成功率以到达目标物体,而像素距离为33.0%,自编码器距离为44.0%。
  • 该方法成功实现了Sawyer机器人在真实世界中对未见过物体的操作,泛化到了元训练期间未出现的新配置。
  • 元学习分类器能够泛化到抽象目标,如物体间的相对位置和可变形物体的形状,即使目标图像不完全匹配。
  • 该框架在三个领域均实现了有效的策略学习:基于仿真的绳索操作、3D视觉导航和真实世界物体重排。
  • 当分类器不准确时,强化学习仍能通过利用奖励信号取得成功,表明其对目标学习不完善具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。