[论文解读] Learning Object Manipulation Skills via Approximate State Estimation from Real Videos
本文提出一种方法,通过利用可微分渲染和优化技术,从真实视频中估计2D视频中的粗略3D手部与物体状态,从而从真实视频中学习机器人物体操作技能。所估计的轨迹作为强化学习中的密集奖励信号,使策略能够在多种初始状态下泛化,并成功迁移到真实机器人上,其中多视频演示提升了在Something-Something数据集中9项动作的鲁棒性和成功率。
Humans are adept at learning new tasks by watching a few instructional videos. On the other hand, robots that learn new actions either require a lot of effort through trial and error, or use expert demonstrations that are challenging to obtain. In this paper, we explore a method that facilitates learning object manipulation skills directly from videos. Leveraging recent advances in 2D visual recognition and differentiable rendering, we develop an optimization based method to estimate a coarse 3D state representation for the hand and the manipulated object(s) without requiring any supervision. We use these trajectories as dense rewards for an agent that learns to mimic them through reinforcement learning. We evaluate our method on simple single- and two-object actions from the Something-Something dataset. Our approach allows an agent to learn actions from single videos, while watching multiple demonstrations makes the policy more robust. We show that policies learned in a simulated environment can be easily transferred to a real robot.
研究动机与目标
- 使机器人能够直接从非结构化的视频演示中学习物体操作技能,避免昂贵的专家遥控操作。
- 通过估计手部和物体的粗略3D状态表示,弥合2D视频观测与3D策略执行之间的差距。
- 开发一种可扩展的、自监督的方法,从真实视频中估计3D状态,而无需真实3D标注。
- 通过多视频演示和课程式领域随机化,实现鲁棒的模仿学习。
- 在模拟环境中训练的策略能够以最少的真实世界微调,成功迁移到真实世界机器人系统中。
提出的方法
- 提出Real2Sim,一种基于优化的方法,通过结合2D视觉识别(手/物体检测器、分割)与可微分渲染,估计粗略3D状态。
- 将手表示为圆柱体,物体表示为长方体,实现从2D视频帧高效重建3D结构。
- 使用感知损失和物理基损失优化3D状态轨迹,最小化渲染帧与观测帧之间的差异。
- 从估计的3D轨迹生成密集奖励信号,用于在模拟环境中训练强化学习策略。
- 应用自动领域随机化作为课程学习策略,通过变化物体尺寸和初始夹爪位置,提升策略泛化能力。
- 通过离线轨迹生成和数值逆运动学,将训练好的策略迁移到真实机器人上,受限于硬件条件,采用离散夹爪控制。
实验结果
研究问题
- RQ1机器人能否仅使用2D视频监督,从单个视频演示中学习单一物体操作技能?
- RQ2与单个演示相比,从多个视频演示中学习是否能提升策略的鲁棒性?
- RQ3基于物体尺寸和初始位置的领域随机化如何影响策略的泛化能力和成功率?
- RQ4在模拟环境中训练的策略能否在无需真实世界微调的情况下成功迁移到真实机器人上?
- RQ5粗略3D状态估计在指导复杂动作(如推动、拉动和放置物体)的模仿学习方面有多有效?
主要发现
- 在多视频上训练的策略相比单视频训练策略,成功率显著更高且更稳定,硬基准测试中中位数成功率从38%提升至83%。
- 所提出的多视频奖励函数优于基线方法(该基线方法最大化轨迹上的奖励),在'Put behind'任务中达到88%的成功率,而基线为82%。
- 在硬基准测试中,策略在'Push right to left'任务上达到72%的成功率,在'Push left to right'任务上达到85%,表明在不同初始状态下具有强大的泛化能力。
- 该方法成功将策略迁移到真实Franka Emika Panda机器人上,尽管实时控制受限,但通过离线轨迹生成和逆运动学实现了执行。
- 失败案例主要源于夹爪在接近阶段与物体发生碰撞,尤其是在初始位置较近时,表明需要更优的碰撞感知规划。
- 在硬基准测试中,单视频策略在全部9项动作上的平均成功率为56%,而多视频策略为73%,多演示带来17个百分点的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。