Skip to main content
QUICK REVIEW

[论文解读] MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations

Ajay Mandlekar, Soroush Nasiriany|arXiv (Cornell University)|Oct 26, 2023
Robot Manipulation and Learning被引用 5
一句话总结

MimicGen 是一种数据生成系统,通过基于对象中心的轨迹分割、空间变换和拼接,将少量人类示范适应到新环境,从而合成大规模、多样化的机器人示范数据集。该方法可有效支持长时序和高精度任务的模仿学习,仅使用约200个源示范即生成了跨越18项任务、包含多样化物体、场景和机器人臂的50,000多条合成轨迹,性能可与人工标注数据相媲美。

ABSTRACT

Imitation learning from a large set of human demonstrations has proved to be an effective paradigm for building capable robot agents. However, the demonstrations can be extremely costly and time-consuming to collect. We introduce MimicGen, a system for automatically synthesizing large-scale, rich datasets from only a small number of human demonstrations by adapting them to new contexts. We use MimicGen to generate over 50K demonstrations across 18 tasks with diverse scene configurations, object instances, and robot arms from just ~200 human demonstrations. We show that robot agents can be effectively trained on this generated dataset by imitation learning to achieve strong performance in long-horizon and high-precision tasks, such as multi-part assembly and coffee preparation, across broad initial state distributions. We further demonstrate that the effectiveness and utility of MimicGen data compare favorably to collecting additional human demonstrations, making it a powerful and economical approach towards scaling up robot learning. Datasets, simulation environments, videos, and more at https://mimicgen.github.io .

研究动机与目标

  • 解决为机器人学习收集大规模人类示范所需高昂成本和时间的问题。
  • 开发一种通用系统,复用有限的人类示范,在新场景、新物体和新机器人硬件上生成多样化、高质量的数据。
  • 评估MimicGen生成的合成数据在训练高性能机器人智能体时,是否能与额外的人工标注示范相媲美或超越其性能。
  • 展示生成数据在真实世界条件下的鲁棒性,包括姿态估计误差和硬件差异。

提出的方法

  • 系统基于物体交互和空间关系,将人类示范分割为以物体为中心的轨迹。
  • 针对每个新场景配置,选择一个源示范,并应用空间变换(平移、旋转)将物体中心的轨迹段与新物体姿态对齐。
  • 将变换后的轨迹段拼接成完整、可执行的机器人轨迹,供机器人执行并记录为新示范。
  • 该方法假设极少——无需特殊标记或精确姿态追踪器——仅依赖标准姿态估计即可实现实世界部署。
  • 数据生成在多个仿真环境和一台物理机器人臂上应用,通过物体初始化随机性、轨迹段选择随机性以及动作噪声,提升数据多样性。
  • 生成的数据集通过模仿学习训练视觉-运动策略,性能在长时序和高精度任务上进行评估。

实验结果

研究问题

  • RQ1少量人类示范能否被有效复用于生成多样化、高质量的机器人轨迹,以适应新环境?
  • RQ2在MimicGen生成的合成数据上进行模仿学习,其性能是否可与额外人工标注示范相媲美?
  • RQ3该数据生成过程在真实世界姿态估计误差下是否具备鲁棒性?
  • RQ4MimicGen能否泛化至长时序和高精度操作任务,如多部件装配和咖啡制作?
  • RQ5在不同数据生成种子和环境变化下,基于合成数据训练的策略性能是否保持稳定?

主要发现

  • MimicGen 仅使用约200个人类示范,在18项任务中生成了超过50,000条高质量示范,涵盖多样化场景、物体和机器人臂。
  • 在MimicGen生成数据上训练的策略,其成功率与在人工标注数据上训练的策略相当——例如,在Square任务(DGR)上达到96.7%的成功率,在Coffee任务(SR)上达到90.7%,与人工数据基线持平或超越。
  • 系统对姿态估计误差表现出强鲁棒性:即使存在10 mm/10°的噪声,策略成功率仍保持较高水平(例如,Square D0上为84.7%,Square D2上为39.3%),表明其在真实世界中的可行性。
  • 不同种子下的数据生成成功率波动小于1%(例如,Stack Three任务中为71.7±0.3%至69.3±0.4%),策略成功率与报告结果偏差小于2%,表明低方差与高可复现性。
  • 在真实世界部署中,MimicGen 成功生成了可执行的轨迹,无需特殊标签或精确姿态追踪,仅依赖标准物体姿态估计。
  • 该方法显著减少了对昂贵人工数据收集的依赖——MimicGen生成的合成数据在下游任务性能上与额外人工示范持平或更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。