[论文解读] VideoDex: Learning Dexterity from Internet Videos
VideoDex 提出一种方法,利用互联网上的真人手部操作视频来训练灵巧机器人智能体,通过视觉、动作和物理先验来引导策略学习。通过结合预训练的视觉嵌入、来自视频的人体运动先验以及神经动力策略,VideoDex 在真实世界操作任务中实现了强大的零样本和少样本泛化能力,在仅需少量领域内示范的情况下,于七个任务上超越了最先进方法。
To build general robotic agents that can operate in many environments, it is often imperative for the robot to collect experience in the real world. However, this is often not feasible due to safety, time, and hardware restrictions. We thus propose leveraging the next best thing as real-world experience: internet videos of humans using their hands. Visual priors, such as visual features, are often learned from videos, but we believe that more information from videos can be utilized as a stronger prior. We build a learning algorithm, VideoDex, that leverages visual, action, and physical priors from human video datasets to guide robot behavior. These actions and physical priors in the neural network dictate the typical human behavior for a particular robot task. We test our approach on a robot arm and dexterous hand-based system and show strong results on various manipulation tasks, outperforming various state-of-the-art methods. Videos at https://video-dex.github.io
研究动机与目标
- 通过利用大规模互联网真人手部操作视频,解决真实世界机器人策略学习中的数据效率和安全性挑战。
- 超越视觉表征预训练,转而将真人视频作为动作和物理先验的来源,用于机器人策略学习。
- 在互联网视频预训练后,仅使用少量领域内示范,实现样本高效的现实世界适应。
- 通过整合三维人体姿态估计和手部重定向,提升高自由度机器人操作中的泛化能力和鲁棒性。
- 证明结合视觉、动作和物理先验相比仅使用视觉或动作先验的基线方法,能实现更优性能。
提出的方法
- 使用预训练的三维人体姿态估计模型(FrankMocap)从互联网视频中提取人体肢体轨迹,作为动作先验。
- 应用视频对比表示学习方法(Nair et al.)从真人视频中学习视觉特征,作为视觉先验。
- 整合神经动力策略(NDP)作为物理先验,以建模机器人的运动动力学,确保动作平滑且符合物理规律。
- 通过学习的能量函数将人体手部动作重定向至机器人手部,以对齐人体与机器人的运动学结构。
- 使用行为克隆训练单一开环策略,融合视觉、动作和物理先验,并仅在少量真实世界示范上进行微调。
- 采用双流架构以解耦手腕与手部运动控制,提升在多样化操作任务中的泛化能力。
实验结果
研究问题
- RQ1互联网上的真人手部操作视频能否作为训练样本高效机器人策略的强大先验,用于真实世界设置?
- RQ2结合来自真人视频的视觉、动作和物理先验,如何提升灵巧操作中的零样本和少样本泛化能力?
- RQ3动作先验与视觉先验在降低样本复杂度和提升成功率方面的相对贡献是什么?
- RQ4解耦手腕与手部运动控制如何影响策略性能和跨任务的泛化能力?
- RQ5仅在互联网视频和少量真实示范上训练的纯开环策略,能否泛化到未见过的物体和任务?
主要发现
- VideoDex 在完整数据设置下于放置任务中实现 90% 的成功率,在受限数据设置下(每种变体仅 10 次示范)仍达到 70%,优于所有基线方法。
- 仅使用每种变体 5 次示范,该方法即实现 80% 的成功率,展现出强大的少样本泛化能力。
- 动作先验的贡献显著高于视觉先验:VideoDex-MVP(含视觉先验)在相同任务中仅实现 40% 成功率,而 VideoDex 达到 90%。
- 双流架构(分离手腕与手部控制)使性能较单流策略提升 20%,其中 VideoDex-Single 仅实现 30% 成功率。
- 物理先验(NDP)显著提升性能,BC-NDP 在多数任务中优于 BC-RNN 和 BC-Open,仅在 BC-RNN 行为更保守导致抓取成功率更高的情况下例外。
- LEAP 手在所有任务上平均比 Allegro 手高出 7–12%,表明机器人硬件选择显著影响策略性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。