[论文解读] Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
UMI 提出了一种便携式、低成本的框架,通过配备鱼眼镜头和 IMU 的手持夹持器,实现从真实世界中人类示范到可部署机器人策略的直接迁移。通过采用延迟匹配推理、相对轨迹动作表征以及扩散策略(Diffusion Policy),UMI 在多个机器人平台上实现了对多样化、动态、双臂操作及长时程任务的零样本泛化。
We present Universal Manipulation Interface (UMI) -- a data collection and policy learning framework that allows direct skill transfer from in-the-wild human demonstrations to deployable robot policies. UMI employs hand-held grippers coupled with careful interface design to enable portable, low-cost, and information-rich data collection for challenging bimanual and dynamic manipulation demonstrations. To facilitate deployable policy learning, UMI incorporates a carefully designed policy interface with inference-time latency matching and a relative-trajectory action representation. The resulting learned policies are hardware-agnostic and deployable across multiple robot platforms. Equipped with these features, UMI framework unlocks new robot manipulation capabilities, allowing zero-shot generalizable dynamic, bimanual, precise, and long-horizon behaviors, by only changing the training data for each task. We demonstrate UMI's versatility and efficacy with comprehensive real-world experiments, where policies learned via UMI zero-shot generalize to novel environments and objects when trained on diverse human demonstrations. UMI's hardware and software system is open-sourced at https://umi-gripper.github.io.
研究动机与目标
- 解决将复杂、现实世界中的人类操作技能迁移到机器人上,而无需依赖真实世界机器人硬件的挑战。
- 克服以往手持夹持器系统存在的局限,如视觉上下文不足、动作不精确、延迟不匹配以及策略表征不充分等问题。
- 通过低成本、直观的界面,实现可扩展的、去中心化的数据采集,支持非专家示范者参与。
- 开发一种与硬件无关的策略学习框架,实现在新环境和新物体上的零样本泛化。
提出的方法
- 使用配备 GoPro 摄像头(155° 鱼眼镜头)和侧镜的便携式夹持器,增强视觉上下文并实现隐式立体追踪。
- 利用 GoPro 的 IMU 和自研 SLAM 系统,从单目视频中恢复精确的 6-DOF 轨迹,降低尺度模糊性和运动模糊的影响。
- 在推理阶段实施延迟匹配,将录制的示范延迟与实际推理系统的延迟对齐。
- 将动作表示为相对轨迹而非绝对位姿,以实现策略学习与全局坐标精度的解耦。
- 应用扩散策略(Diffusion Policy)以建模多样化人类示范中固有的多模态动作分布。
- 对收集的数据进行运动学可行性过滤,以确保下游策略可在真实机器人上成功部署。
实验结果
研究问题
- RQ1仅配备最少传感器的低成本、便携式手持夹持器系统,能否实现对复杂操作任务的高保真动作恢复?
- RQ2如何缓解示范阶段与推理阶段之间的延迟不匹配,以确保策略在实时部署中的鲁棒性?
- RQ3与绝对位姿回归相比,相对轨迹动作表征在多大程度上能提升策略泛化能力?
- RQ4一个单一的策略架构,若在多样化的真实世界人类示范上进行训练,能否实现在新物体和新环境上的零样本泛化?
- RQ5广角鱼眼镜头与侧镜提供的视觉上下文,在多大程度上提升了动作恢复精度与策略性能?
主要发现
- UMI 的 SLAM 系统在位置上实现 6.1 mm 的平均绝对轨迹误差(ATE),在旋转上为 3.5°,两把夹持器之间的相对位姿误差为 10.1 mm 和 0.8°。
- 在杯子排列任务中,UMI 的数据采集速度比遥操作快 3 倍以上,且达到人类手部速度的 48%。
- 在动态投掷任务中,UMI 达到人类手部速度的 64%,而遥操作在 15 分钟内未能成功完成一次示范。
- 使用 UMI 训练的策略可实现零样本泛化至新环境与新物体,包括未见过的物体和布局,无需微调。
- 该框架支持部署复杂行为,如双臂折叠毛衣、动态物体投掷和精确洗碗,仅依赖人类示范数据。
- UMI 的数据采集具有可扩展性和可及性,所有数据存储于单一 MP4 文件中,支持地理上分布的非专家参与。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。