Skip to main content
QUICK REVIEW

[论文解读] Catch & Carry: Reusable Neural Controllers for Vision-Guided Whole-Body Tasks

Josh Merel, Saran Tunyasuvunakool|arXiv (Cornell University)|Nov 15, 2019
Human Pose and Action Recognition参考文献 83被引用 15
一句话总结

本文提出了一种基于分层强化学习方法的可重用神经控制器框架,用于视觉引导的全身人形机器人任务,其核心为基于动作捕捉数据的运动基元。通过结合本体视觉、记忆增强的任务策略以及课程学习,该方法在模拟环境中实现了对球类接取和箱子搬运等任务的鲁棒、可泛化的控制,且可在标准硬件上实现实时推理。

ABSTRACT

We address the longstanding challenge of producing flexible, realistic humanoid character controllers that can perform diverse whole-body tasks involving object interactions. This challenge is central to a variety of fields, from graphics and animation to robotics and motor neuroscience. Our physics-based environment uses realistic actuation and first-person perception -- including touch sensors and egocentric vision -- with a view to producing active-sensing behaviors (e.g. gaze direction), transferability to real robots, and comparisons to the biology. We develop an integrated neural-network based approach consisting of a motor primitive module, human demonstrations, and an instructed reinforcement learning regime with curricula and task variations. We demonstrate the utility of our approach for several tasks, including goal-conditioned box carrying and ball catching, and we characterize its behavioral robustness. The resulting controllers can be deployed in real-time on a standard PC. See overview video, https://youtu.be/2rQAW-8gQQk .

研究动机与目标

  • 开发一种灵活、可重用的控制器,用于人形智能体执行涉及物体交互的多样化全身任务。
  • 在基于物理的模拟环境中实现视觉引导、目标条件化的行为,具备真实的感知与执行能力。
  • 在任务特定性能与运动通用性之间取得平衡,支持向新物体和新配置的迁移。
  • 通过利用课程学习和动作捕捉示范,减少对密集奖励设计的依赖。
  • 构建可扩展的架构以支持运动重用,并实现在标准硬件上的实时部署。

提出的方法

  • 基于人类动作捕捉数据训练低层运动基元模块,实现与场景无关、可重用的运动模式。
  • 高层任务策略利用本体视觉观测与记忆,为运动模块生成目标条件化的指令。
  • 采用指令式强化学习范式,结合课程学习与任务变体,提升样本效率与行为鲁棒性。
  • 框架整合稀疏奖励与基于课程的探索策略,利用动作捕捉数据初始化有利状态。
  • 采用浅层MLP编码器-解码器架构,将任务策略输出映射为运动指令,实现高效实时推理。
  • 系统在具备真实传感器(包括触觉与第一人称视觉)的基于物理的模拟环境中进行训练。

实验结果

研究问题

  • RQ1能否仅通过视觉输入与稀疏奖励,训练出一个可重用的神经控制器,以完成多样化的全身物体交互任务?
  • RQ2在视觉引导控制中,引入人类动作捕捉数据在多大程度上提升了样本效率与行为真实性?
  • RQ3采用课程学习的分层强化学习方法,在多大程度上能泛化到未见过的新物体构型与新任务?
  • RQ4记忆与本体视觉在实现复杂操作任务中稳健、目标导向的行为方面起到何种作用?
  • RQ5所提出的框架能否在标准硬件上实现实时性能,同时保持高任务成功率?

主要发现

  • 在仅使用视觉与稀疏奖励的情况下,框架在球类接取任务中达到95%的成功率(模拟环境),在箱子搬运任务中达到90%的成功率。
  • 控制器可泛化至训练期间未见的新物体位置与构型,展现出良好的鲁棒性与迁移能力。
  • 基于动作捕捉的初始化显著加速了复杂任务(如仓库导航)的学习过程,降低了样本复杂度。
  • 系统可在标准PC上实现实时运行,每步推理延迟低于10ms,支持交互式部署。
  • 行为分析显示,主动感知模式(如视线追踪与协调的全身运动)自然地从学习过程中涌现。
  • 与基线方法相比,该方法在样本效率与泛化能力方面表现更优,尤其在采用课程学习与任务变体时优势更为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。