Skip to main content
QUICK REVIEW

[论文解读] A Mobile Manipulation System for One-Shot Teaching of Complex Tasks in Homes

Max Bajracharya, James Borders|arXiv (Cornell University)|Sep 30, 2019
Robot Manipulation and Learning参考文献 43被引用 4
一句话总结

本文提出了一种移动操作机器人系统,通过一次虚拟现实(VR)示范,使机器人能够在真实家庭环境中学习复杂的人类级别任务。通过结合参数化混合控制、用于场景理解的有学习的密集视觉嵌入,以及任务图架构,该系统在涉及每项任务平均45种行为的60次端到端任务执行中实现了85%的成功率,展示了在无先验地图或物体模型情况下的环境变化鲁棒性。

ABSTRACT

We describe a mobile manipulation hardware and software system capable of autonomously performing complex human-level tasks in real homes, after being taught the task with a single demonstration from a person in virtual reality. This is enabled by a highly capable mobile manipulation robot, whole-body task space hybrid position/force control, teaching of parameterized primitives linked to a robust learned dense visual embeddings representation of the scene, and a task graph of the taught behaviors. We demonstrate the robustness of the approach by presenting results for performing a variety of tasks, under different environmental conditions, in multiple real homes. Our approach achieves 85% overall success rate on three tasks that consist of an average of 45 behaviors each.

研究动机与目标

  • 使通用移动操作机器人能够在无先验物体模型或地图的非结构化家庭环境中执行复杂的人类级别任务。
  • 开发一种系统,通过一次人类在虚拟现实中的示范学习新任务,最大限度减少新任务的工程工作量。
  • 在自然环境变化(如光照变化、杂乱和物体重新定位)下实现鲁棒执行。
  • 通过有学习的视觉嵌入将感知与行为解耦,实现模块化、可诊断的任务执行。
  • 在真实家庭环境中实现端到端任务成功,人类干预极少且容错能力高。

提出的方法

  • 系统使用高能力移动操作机器人,具备高末端执行器操作性及宽广的视野,以支持基于VR的教学。
  • 通过虚拟现实进行任务教学,用户使用参数化混合位置/力控制来示范行为,以确保鲁棒性并最小化参数调整。
  • 在教学过程中从关键帧提取有学习的密集像素级视觉嵌入,以实现在执行时对视角变化和光照变化具有鲁棒性的场景匹配。
  • 行为与视觉嵌入关联,并组织成具有明确定义的进入条件和基于成功结果的退出标准的动态任务图,支持行为的重用和链式执行。
  • 系统通过依赖视觉关键帧匹配和反应式路径跟踪来避免显式全局地图构建,实现导航和操作。
  • 故障检测与恢复机制集成于任务图中,使机器人能够检测并恢复99.6%的行为失败,从而减少灾难性故障。

实验结果

研究问题

  • RQ1移动操作机器人能否仅通过一次VR示范,在真实家庭环境中学习复杂、多步骤的任务,而无需先验物体模型或地图?
  • RQ2该系统对自然环境变化(如光照变化、杂乱和物体重新定位)的鲁棒性如何?
  • RQ3有学习的视觉嵌入在多大程度上能够实现在不同场景配置和视角下的准确行为执行?
  • RQ4任务图架构在支持复杂多行为任务执行过程中的重用与恢复方面有多有效?
  • RQ5在多样化和非结构化的现实家庭环境中,该系统的端到端成功率是多少?

主要发现

  • 在两个真实家庭中,系统在60次端到端任务执行中实现了85%的整体成功率,三项复杂任务平均各包含45种行为。
  • 系统对显著的环境变化表现出鲁棒性,包括光照变化、新增障碍物、物体重新定位,以及橱柜门状态变化(打开、关闭、半开)。
  • 行为失败仅发生在0.4%的案例中,主要原因是物体位姿估计不准确或关键帧匹配错误(例如,将半开的橱柜误判为关闭)。
  • 故障检测与恢复机制使99.6%的行为能够成功或恢复,测试期间未观察到灾难性故障。
  • 机器人执行任务的速度比人类慢10至100倍(平均慢20倍),表明性能优化仍有空间。
  • 使用有学习的密集视觉嵌入使系统在多样化视觉条件下(包括视角变化和场景杂乱)能够实现可靠的行为执行,而无需显式物体识别或分割。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。