[论文解读] Multi-View Masked World Models for Visual Robotic Manipulation
本文提出多视角掩码世界模型(MV-MWM),一种强化学习框架,利用多视角掩码自编码器从多样化相机视角学习鲁棒的视觉表征,实现高效的视觉机器人操作。该方法在多视角与单视角控制任务中均达到最先进性能,无需相机标定即可泛化至真实世界部署,并在仿真与真实世界设置下均展现出对视角随机化的强鲁棒性。
Visual robotic manipulation research and applications often use multiple cameras, or views, to better perceive the world. How else can we utilize the richness of multi-view data? In this paper, we investigate how to learn good representations with multi-view data and utilize them for visual robotic manipulation. Specifically, we train a multi-view masked autoencoder which reconstructs pixels of randomly masked viewpoints and then learn a world model operating on the representations from the autoencoder. We demonstrate the effectiveness of our method in a range of scenarios, including multi-view control and single-view control with auxiliary cameras for representation learning. We also show that the multi-view masked autoencoder trained with multiple randomized viewpoints enables training a policy with strong viewpoint randomization and transferring the policy to solve real-robot tasks without camera calibration and an adaptation procedure. Video demonstrations are available at: https://sites.google.com/view/mv-mwm.
研究动机与目标
- 开发一种表征学习方法,有效利用多视角视觉数据进行视觉机器人操作,超越简单的输入融合。
- 解决现有对比学习方法的局限性,后者需要精心筛选正负样本对,并假设视角不变性。
- 仅通过多视角表征学习实现从仿真到真实世界机器人的鲁棒策略迁移,无需相机标定或适应。
- 探索视角随机化在表征学习中的有效性,以提升视觉伺服的鲁棒性。
- 在多样化的机器人操作设置下评估该方法,包括多视角控制、带辅助视角的单视角控制,以及视角鲁棒控制。
提出的方法
- 训练一个多视角掩码自编码器,随机掩码整个视角(相机视角),并利用所有视角间的视频自编码重建被掩码的像素。
- 使用视觉Transformer主干网络处理可变尺寸的多视角输入,并提取共享表征。
- 冻结自编码器后,在冻结的表征上训练世界模型,通过基于模型的强化学习生成想象轨迹以用于策略训练。
- 通过在多样化、随机选择的相机配置上进行训练,在表征学习过程中应用视角随机化。
- 在仅使用辅助相机的单视角控制设置中,将学习到的表征同时用于强化学习与行为克隆。
- 通过在仿真中使用随机视角训练策略并直接部署到真实机器人上,实现仿真到现实的迁移,无需微调或标定。
实验结果
研究问题
- RQ1使用随机视角掩码的多视角掩码自编码是否能学习到同时捕捉视图内与视图间信息的表征,从而有益于视觉控制?
- RQ2所提出的方法在多视角与单视角机器人操作任务中是否优于单视角与多视角对比表征学习基线?
- RQ3在未进行相机标定或领域自适应的情况下,使用视角鲁棒表征学习训练的策略是否能泛化至真实世界机器人操作?
- RQ4该方法在处理动态或不稳定的相机设置(如手持或抖动相机)时效果如何?
- RQ5所提出的表征学习方案是否在强化学习与模仿学习设置中均一致地提升性能?
主要发现
- 在RLBench仿真环境中,MV-MWM在所有任务中均优于单视角表征学习基线(如ViT、MoCo、SimCLR)以及多视角对比基线(Sermanet et al., 2018)。
- 在模仿学习中,该方法相比MWM基线提升14.35个百分点,证明了视图掩码在多视角表征学习中的优势。
- MV-MWM实现了策略在真实世界机器人操作任务中的成功仿真到现实迁移,无需相机标定或适应流程。
- 在视角随机化下训练的策略能稳健泛化至真实世界条件,包括手持或不稳定的相机设置,展现出强大的视觉伺服性能。
- 仅视图掩码机制本身在模仿学习中即带来6.56个百分点的性能提升(从57.92%提升至64.48%),证实其在表征学习中的有效性。
- 该框架支持多样化设置:多视角控制、带辅助相机的单视角控制,以及视角鲁棒控制,展现出广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。