[论文解读] Keypoints into the Future: Self-Supervised Correspondence in Model-Based Reinforcement Learning
论文引入自监督视觉对应作为模型基RL系统的潜在状态,通过MPC实现闭环控制,并展示强大的仿真到现实传输与视觉基础操控的类别级泛化。
Predictive models have been at the core of many robotic systems, from quadrotors to walking robots. However, it has been challenging to develop and apply such models to practical robotic manipulation due to high-dimensional sensory observations such as images. Previous approaches to learning models in the context of robotic manipulation have either learned whole image dynamics or used autoencoders to learn dynamics in a low-dimensional latent state. In this work, we introduce model-based prediction with self-supervised visual correspondence learning, and show that not only is this indeed possible, but demonstrate that these types of predictive models show compelling performance improvements over alternative methods for vision-based RL with autoencoder-type vision training. Through simulation experiments, we demonstrate that our models provide better generalization precision, particularly in 3D scenes, scenes involving occlusion, and in category-generalization. Additionally, we validate that our method effectively transfers to the real world through hardware experiments. Videos and supplementary materials available at https://sites.google.com/view/keypointsintothefuture
研究动机与目标
- 推动并实现使用高维观测的机器人操控的视觉基础模型学习。
- 提出由自监督密集视觉描述符跟踪的关键点形成的潜在状态。
- 在潜在关键点空间学习动力学并进行在线规划以实现闭环控制的MPC。
- 展示相较自编码器与迁移基线的更好泛化与真实世界传输。
- 展示在仿真与硬件实验中对遮挡和类别级变异的鲁棒性。
提出的方法
- 通过自监督视觉对应模型提取的关键点,利用密集视觉描述符学习潜在状态 z。
- 训练前向动力学模型 z_{t+1}=f(z_t, a_t) 以在时域 horizon H 内最小化多步预测误差(L_dynamics)。
- 使用变体从 y(关键点位置)构成 z:描述符集(DS)、空间描述符集(SDS)、加权描述符集(WDS),以及它们的组合(WSDS)。
- 使用可学习的映射 phi(y; α) 形成 z,对关键点进行凸权重以处理不可靠点(WDS)。
- 在动力学学习过程中保持密集对应网络固定。
- 使用基于MPPI的在线规划,在学习到的动力学下对一个时域 horizon (H) 进行最大化奖励,目标潜在状态 z*。
- 在仿真中分别在自上而下、倾斜、遮挡、杯子/类别等情景以及在硬件上使用Kuka机械手进行评估,动力学学习阶段使用10分钟交互数据,目标指定仅需一个演示。
实验结果
研究问题
- RQ1自监督密集视觉对应是否可以作为信息丰富且可迁移的潜在状态用于视觉基础的模型基强化学习?
- RQ2不同描述符基的潜在状态构造(DS、SDS、WDS、WSDS)在遮挡和类别变异条件下对动力学学习与闭环控制有何影响?
- RQ3在仿真与真实硬件中,该方法是否相较自编码器和迁移基线在部分遮挡和类别级泛化方面具有优势?
- RQ4在有限交互数据和单个演示的目标指定下,该方法是否能实现现实世界传输?
主要发现
- 基于密集视觉对应的潜在状态在仿真任务和硬件上均比基线更准确、样本效率更高的模型基RL。
- 在遮挡条件下,SDS/WDS/WSDS 因对被遮挡关键点的鲁棒性而优于 DS,提升动力学准确性与 MPC 性能。
- 在类别级杯子任务中,更多关键点的方法(DS/WDS)由于能捕捉形状变异而表现优于稀疏变体;SDS/WDS 仍保持鲁棒性。
- 与 Transporter 和自编码器基线相比,SDS/WDS 在各任务中的姿态/角度偏差更小,遮挡和杯子类别下收益最大。
- 硬件实验表明该方法在2秒的MPC时域与5 Hz的指令频率下实现长时序轨迹的稳定,使用约10分钟的交互数据和单个演示,在多条轨迹上均有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。