[论文解读] Learning to Imitate Object Interactions from Internet Videos
本文提出RHOV,一种基于优化的新方法,利用2D图像线索和时间平滑性约束,从互联网视频中重建4D手-物体轨迹。该方法可借助强化学习在物理模拟器中实现多样化物体交互的模仿,成功实现标准机械臂与夹爪的机器人模仿,即使在没有类人末端执行器的情况下亦可。
We study the problem of imitating object interactions from Internet videos. This requires understanding the hand-object interactions in 4D, spatially in 3D and over time, which is challenging due to mutual hand-object occlusions. In this paper we make two main contributions: (1) a novel reconstruction technique RHOV (Reconstructing Hands and Objects from Videos), which reconstructs 4D trajectories of both the hand and the object using 2D image cues and temporal smoothness constraints; (2) a system for imitating object interactions in a physics simulator with reinforcement learning. We apply our reconstruction technique to 100 challenging Internet videos. We further show that we can successfully imitate a range of different object interactions in a physics simulator. Our object-centric approach is not limited to human-like end-effectors and can learn to imitate object interactions using different embodiments, like a robotic arm with a parallel jaw gripper.
研究动机与目标
- 使机器人能够从无约束的互联网视频中学习物体交互,这些视频丰富且逼真,但因遮挡和缺乏标注而具有挑战性。
- 解决在存在相互遮挡的视频中进行4D重建(3D空间+时间)的困难,传统方法在此类场景下失效。
- 开发一种系统,不仅能重建轨迹,还能通过强化学习在物理模拟器中成功模仿这些轨迹。
- 通过聚焦于以物体为中心的运动而非人类手部运动学,实现对非人形形态(如具有平行颚夹爪的机械臂)的模仿。
提出的方法
- RHOV通过三个阶段重建4D手部和物体轨迹:2D手部关键点与掩码估计、结合2D掩码和深度约束的可微分渲染,以及利用3D和2D光流平滑性的时序优化。
- 该方法利用预训练实例分割(PointRend)生成2D物体掩码,并使用可微分渲染从2D监督中优化3D物体位姿。
- 通过光流和3D轨迹正则化实现时序平滑性,减少帧间抖动并解决对称性模糊问题。
- 从重建的4D轨迹构建密集奖励函数,整合位置、旋转和速度差异,以指导策略训练。
- 在物理模拟器(使用Franka机械臂)上训练强化学习策略,以匹配重建的物体轨迹,消融实验验证了奖励设计的有效性。
- 该方法以物体为中心,可轻松迁移至不同机器人形态,无需依赖类人末端执行器。
实验结果
研究问题
- RQ1能否在存在相互遮挡和有限监督的无约束互联网视频中,准确重建4D手-物体轨迹?
- RQ2如何仅利用2D线索和平滑性约束,在4D重建中强制实现时序一致性和几何合理性?
- RQ3能否通过强化学习在物理模拟器中成功模仿从互联网视频重建的4D轨迹?
- RQ4与仅物体重建相比,联合手-物体重建在多大程度上提升了物体轨迹的准确性?
- RQ5模仿奖励函数的不同组件(如旋转、速度、位置)对机器人策略学习成功率的影响如何?
主要发现
- RHOV成功重建了来自100 Days of Hands数据集的100段YouTube视频的4D轨迹,展示了对真实世界视频变化的鲁棒性。
- 时序优化减少了物体轨迹的抖动,并解决了由对称物体引起的朝向翻转问题,提升了重建稳定性。
- 使用理想2D掩码将物体重建误差从13.0 mm降低至9.3 mm,表明2D分割质量对3D重建有显著影响。
- 与独立优化相比,联合手-物体重建使物体精度提高了1.6 mm(14.6 vs. 13.0 mm),表明手部建模有助于物体恢复。
- 移除奖励函数的任一组件(如旋转、速度、位置)均导致模仿成功率显著下降,其中移除旋转损失导致0%成功率。
- 该系统在使用7自由度Franka机械臂和平行颚夹爪时,实现了79.3%的轨迹模仿成功率,证明了其在非人形形态上的有效泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。