[论文解读] Zero-Shot Robot Manipulation from Passive Human Videos
本文提出了一种仅使用互联网上被动的人类视频的零样本框架,用于机器人操作,其中模型从场景图像预测合理的手部轨迹,并将这些轨迹映射到机器人动作,无需微调。该方法仅使用网络规模的自摄像视频进行训练,在未加条件的任务上实现了约40–60%的成功率,在目标条件任务上实现了约30–40%的成功率。
Can we learn robot manipulation for everyday tasks, only by watching videos of humans doing arbitrary tasks in different unstructured settings? Unlike widely adopted strategies of learning task-specific behaviors or direct imitation of a human video, we develop a a framework for extracting agent-agnostic action representations from human videos, and then map it to the agent's embodiment during deployment. Our framework is based on predicting plausible human hand trajectories given an initial image of a scene. After training this prediction model on a diverse set of human videos from the internet, we deploy the trained model zero-shot for physical robot manipulation tasks, after appropriate transformations to the robot's embodiment. This simple strategy lets us solve coarse manipulation tasks like opening and closing drawers, pushing, and tool use, without access to any in-domain robot manipulation trajectories. Our real-world deployment results establish a strong baseline for action prediction information that can be acquired from diverse arbitrary videos of human activities, and be useful for zero-shot robotic manipulation in unseen scenes.
研究动机与目标
- 通过仅使用互联网上非结构化的被动人类视频,实现零样本机器人操作。
- 从多样化的人机交互视频中学习与代理无关的动作表征。
- 在未见过的环境中,无需领域内示范或微调,将这些表征迁移到物理机器人上。
- 评估从网络视频中预测动作是否能在真实世界设置中实现可靠的操控。
提出的方法
- 训练一个随机模型,从单张场景图像预测2秒时间范围内6D手部轨迹(手掌中心位姿)。
- 使用如Epic-Kitchens等数据集中的多样化第一视角视频来训练轨迹预测模型。
- 通过运动学映射,将人类手部轨迹转换为机器人末端执行器轨迹。
- 通过逆运动学控制器执行预测轨迹,在真实世界环境中零样本部署该模型。
- 开发两种变体:无条件模型(预测合理动作)和目标条件模型(预测达到指定目标状态的动作)。
- 通过显示场景期望最终状态的目标图像来对目标模型进行条件化。
实验结果
研究问题
- RQ1从被动人类视频中提取的动作表征是否能泛化到未见过环境中的零样本机器人操作?
- RQ2在多样化互联网视频上联合训练的单一模型,在物理机器人上的零样本部署中效果如何?
- RQ3与无条件动作预测相比,目标条件化是否能提高零样本机器人操作的可靠性和任务特异性?
- RQ4从人类视频到机器人控制的零样本轨迹迁移的主要失败模式是什么?
- RQ5在未使用任何实验室数据的情况下,仅在非专家、非结构化的网络人类视频上训练的模型,能否在真实世界操作任务中实现有意义的成功?
主要发现
- 无条件模型在粗粒度操作任务(如开关抽屉、推动、移动碗)上实现了40–60%的成功率。
- 目标条件模型在实现指定目标状态的任务(如完全打开门或将蔬菜移动到目标位置)上实现了30–40%的成功率。
- 在达到特定构型方面,目标条件模型优于无条件模型,其中4/10次试验达到了期望的抽屉状态,而无条件模型为3/10次。
- 失败分析显示,无条件模型40%的失败原因是初始接触错误,60%的失败原因是不可行动作(例如向外拉门)。
- 目标条件模型中存在第三种失败模式(占失败的40%),即机器人执行了合理但不符合目标要求的动作(例如打开了错误的抽屉)。
- 该模型优于基线方法如3D Scene Flow,在数据较少时达到11%的成功率,全量数据下平均成功率达37%,证明了大规模、多样化网络视频的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。