[论文解读] MoVie: Visual Model-Based Policy Adaptation for View Generalization
MoVie 提出了一种用于视觉模型强化学习策略的测试时自适应方法,以在不修改训练过程的情况下实现视图泛化。通过将空间变换网络(STN)集成到浅层编码器层中,并利用冻结的动力学模型作为自监督信号,MoVie 在包括新视图、移动视图、抖动视图和改变视场角在内的挑战性视图泛化场景中,于18项任务上实现了最高达152%的相对性能提升。
Visual Reinforcement Learning (RL) agents trained on limited views face significant challenges in generalizing their learned abilities to unseen views. This inherent difficulty is known as the problem of $ extit{view generalization}$. In this work, we systematically categorize this fundamental problem into four distinct and highly challenging scenarios that closely resemble real-world situations. Subsequently, we propose a straightforward yet effective approach to enable successful adaptation of visual $ extbf{Mo}$del-based policies for $ extbf{Vie}$w generalization ($ extbf{MoVie}$) during test time, without any need for explicit reward signals and any modification during training time. Our method demonstrates substantial advancements across all four scenarios encompassing a total of $ extbf{18}$ tasks sourced from DMControl, xArm, and Adroit, with a relative improvement of $\mathbf{33}$%, $\mathbf{86}$%, and $\mathbf{152}$% respectively. The superior results highlight the immense potential of our approach for real-world robotics applications. Videos are available at https://yangsizhe.github.io/MoVie/ .
研究动机与目标
- 为解决视觉强化学习中视图泛化这一关键挑战,即在有限摄像头视角下训练的策略在真实机器人应用中面对未见视角时失效的问题。
- 系统性地将视图泛化划分为四种现实的测试时场景:新视图、移动视图、抖动视图以及新视场角(FOV)条件。
- 开发一种简单但高效的方法,使视觉模型基强化学习策略能够在推理阶段无需任何训练时修改或依赖奖励信号的情况下,适应未见视图。
- 通过在包括操作和运动控制任务在内的多样化机器人环境中使用类真实视图变化,验证该方法的有效性。
提出的方法
- MoVie 通过在视觉编码器的浅层中插入空间变换网络(STN),引入空间自适应编码器(SAE),以学习视图不变的表征。
- 该方法通过仅微调 SAE 而保持动力学模型(DM)冻结的方式实现测试时自适应,并利用 DM 的自监督动态预测目标作为学习信号。
- 动力学模型在训练阶段预先训练完成,并在自适应过程中保持固定,为适应后的编码器提供一致的监督,使其与新视图对齐。
- 该方法兼容任何视觉模型基强化学习算法,且仅需少量环境交互即可实现有效自适应。
- 该方法在自适应过程中无需任何奖励信号,因此在真实世界部署中更具鲁棒性和实用性。
实验结果
研究问题
- RQ1是否可以在不进行任何训练时修改的情况下,有效实现视觉模型基策略在测试时对未见摄像头视角的自适应?
- RQ2将空间变换网络(STN)集成到编码器中,在视觉强化学习中实现视图泛化方面是否有效?
- RQ3在测试时自适应过程中,使用冻结的动力学模型作为自监督信号,是否相比端到端微调或基线方法能带来更优性能?
- RQ4该方法在包括移动、抖动和新视场角条件在内的多样化且真实的视图泛化场景中表现如何?
主要发现
- 与强基线相比,MoVie 在 xArm 任务上实现了 86% 的相对性能提升,在 Adroit 任务上实现了高达 152% 的提升,证明了其在机器人操作任务中的有效性。
- 在 Cheetah 跑步运动任务中,MoVie 在所有设置下均实现了 12% 的性能提升,其中在具有挑战性的新视场角设置下达到 15% 的增益。
- 消融实验表明,在自适应过程中冻结动力学模型的性能优于端到端微调,凸显了稳定自监督信号的价值。
- 将 STN 与逆动力学模型(IDM)结合可进一步提升性能,验证了空间自适应机制的泛化能力。
- MoVie 在全部 18 项任务和 64 种配置中持续优于强基线,包括抖动视图和移动视图等多样化设置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。