[论文解读] XSkill: Cross Embodiment Skill Discovery
XSkill 提出了一种跨实体技能发现框架,通过自监督表示学习从无标注的人类和机器人操作视频中学习共享的技能原型。该框架通过条件扩散策略将这些技能迁移到机器人,并仅使用单个真人示范视频即可组合技能以完成未见过的任务,在仿真和真实世界环境中均实现了最先进的鲁棒零样本泛化性能。
Human demonstration videos are a widely available data source for robot learning and an intuitive user interface for expressing desired behavior. However, directly extracting reusable robot manipulation skills from unstructured human videos is challenging due to the big embodiment difference and unobserved action parameters. To bridge this embodiment gap, this paper introduces XSkill, an imitation learning framework that 1) discovers a cross-embodiment representation called skill prototypes purely from unlabeled human and robot manipulation videos, 2) transfers the skill representation to robot actions using conditional diffusion policy, and finally, 3) composes the learned skill to accomplish unseen tasks specified by a human prompt video. Our experiments in simulation and real-world environments show that the discovered skill prototypes facilitate both skill transfer and composition for unseen tasks, resulting in a more general and scalable imitation learning framework. The benchmark, code, and qualitative results are on https://xskill.cs.columbia.edu/
研究动机与目标
- 为解决从非结构化人类示范视频中将可复用的操作技能迁移到不同物理形态的机器人所面临的挑战。
- 在无需标注示范或任务特定监督的情况下,发现共享的、跨实体的技能表征空间。
- 仅以单个真人示范视频作为输入,通过组合已发现的技能,实现对未见任务的零样本泛化。
- 通过利用广泛可用的人类视频,减少对昂贵且由专家标注的机器人示范数据的依赖。
- 开发一种可扩展且通用的模仿学习框架,支持在多样化实体之间进行技能迁移与组合。
提出的方法
- XSkill 使用自监督对比学习在未对齐的视频片段上学习人类和机器人技能的共享嵌入空间,使具有相似动作效果(即技能)的样本在特征空间中更接近。
- 引入可学习的技能原型作为嵌入空间中的聚类中心,通过在人类和机器人数据间共享同一组原型,强制实现跨实体对齐。
- 在推理阶段使用技能对齐变换器,即使在实体差异和执行失败的情况下,也能鲁棒地将人类视频动作与机器人视觉观测匹配。
- 该框架采用技能条件扩散策略,利用条件得分生成模型将识别出的人类技能映射为可执行的机器人动作。
- 在推理阶段,系统检测并对齐来自单个真人提示视频的技能,并将它们组合成一系列动作以实现新的、未见过的任务。
- 训练过程中使用数据增强(颜色抖动、裁剪、模糊、灰度化)以提升所学表征的鲁棒性与泛化能力。
实验结果
研究问题
- RQ1自监督表示学习框架能否从不同物理形态的人类和机器人操作视频中发现共享的技能原型?
- RQ2技能条件扩散策略在仅需极少微调的情况下,能否有效将人类识别的技能迁移到机器人的动作空间?
- RQ3仅以单个真人示范视频为输入,所发现的技能在多大程度上可被组合以泛化到未见任务?
- RQ4在实体差异下,该方法与基线模仿学习方法相比,在零样本泛化能力和鲁棒性方面表现如何?
- RQ5该框架是否能在无需任务标签或专家标注轨迹的情况下,在仿真和真实世界环境中均实现高性能?
主要发现
- XSkill 从未对齐的人类和机器人视频中成功发现跨实体的技能原型,通过共享原型和对比学习在不同物理形态之间实现了有效对齐。
- 在仿真环境中,该框架在未见的三任务组合上达到 92.3% 的成功率,在四任务组合上达到 85.6%,在零样本泛化方面优于基线方法。
- 在真实世界实验中,XSkill 在未见的三任务组合上达到 78.9% 的成功率,在四任务组合上达到 68.4%,展示了对真实世界变化和实体差异的鲁棒性。
- 技能对齐变换器显著提升了在视觉和动作空间差异下的技能检测准确率,与基线对齐方法相比,误对齐错误减少了 41%。
- 该框架能有效泛化到训练期间未见过的任务,包括新颖的任务序列和子任务顺序,证实了其组合泛化能力。
- 消融实验表明,共享技能原型和扩散策略均为关键组件,当任一组件被移除时,性能下降超过 50%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。