[论文解读] Augmented World Models Facilitate Zero-Shot Dynamics Generalization From a Single Offline Environment
本文提出增强世界模型(Augmented World Models, AugWM),通过引入上下文感知的变换来增强学习到的动力学模型,从而提升离线强化学习中的零样本动力学泛化能力。通过在多样化增强动力学上训练策略,并在推理时通过自监督线性动力学建模来推断正确上下文,AugWM 显著优于最先进基线方法——在基线失败的情况下仍能取得成功——且无需在测试时使用环境奖励。
Reinforcement learning from large-scale offline datasets provides us with the ability to learn policies without potentially unsafe or impractical exploration. Significant progress has been made in the past few years in dealing with the challenge of correcting for differing behavior between the data collection and learned policies. However, little attention has been paid to potentially changing dynamics when transferring a policy to the online setting, where performance can be up to 90% reduced for existing methods. In this paper we address this problem with Augmented World Models (AugWM). We augment a learned dynamics model with simple transformations that seek to capture potential changes in physical properties of the robot, leading to more robust policies. We not only train our policy in this new setting, but also provide it with the sampled augmentation as a context, allowing it to adapt to changes in the environment. At test time we learn the context in a self-supervised fashion by approximating the augmentation which corresponds to the new environment. We rigorously evaluate our approach on over 100 different changed dynamics settings, and show that this simple approach can significantly improve the zero-shot generalization of a recent state-of-the-art baseline, often achieving successful policies where the baseline fails.
研究动机与目标
- 解决离线强化学习中的关键问题:尽管在单一离线数据集上进行训练,策略仍无法泛化到未见动力学。
- 在无需访问仿真器或动力学参数先验知识的情况下,实现对新物理环境的鲁棒零样本迁移。
- 通过在训练过程中增强动力学模型本身,而非观测空间,来提升策略鲁棒性。
- 开发一种自监督、无奖励的上下文自适应机制,使策略能在推理过程中实时适应。
- 证明在学习到的世界模型中进行动力学增强,可在多种分布外动力学设置下实现显著性能提升。
提出的方法
- 该方法从单一离线数据集学习世界模型,随后通过模拟物理属性(如质量、阻尼)变化的随机变换来增强动力学转移函数。
- 在策略训练期间,智能体基于增强上下文进行条件控制,从而学习在多样化模拟动力学下具备鲁棒性的行为。
- 在测试时,通过在真实环境交互数据上训练自监督线性动力学模型,来推断当前的动力学增强上下文。
- 将推断出的上下文输入至测试时的策略,使其能够在单个episode内自适应行为,而无需奖励信号。
- 该方法完全基于模型强化学习框架,采用不确定性正则化更新以稳定训练过程。
- 该方法应用于标准MuJoCo环境,并在广泛分布外动力学变化条件下进行评估。
实验结果
研究问题
- RQ1在无法访问仿真器或环境参数的情况下,是否能从单一离线数据集训练出的策略泛化到未见动力学?
- RQ2与观测空间增强相比,增强动力学模型是否能带来更好的离线强化学习零样本泛化性能?
- RQ3自监督、无奖励的上下文推断机制是否能在推理过程中实现有效的上下文自适应?
- RQ4在物理属性变化的鲁棒性方面,动力学增强与观测级增强相比表现如何?
- RQ5在未见动力学设置下,基于增强动力学训练的上下文感知策略在多大程度上能超越最先进离线强化学习方法?
主要发现
- AugWM在100多种不同的动力学设置下显著提升了零样本动力学泛化能力,在几乎所有情况下均优于最先进基线方法(MOPO)。
- 在HalfCheetah环境中,无论质量还是阻尼缩放变化,AugWM的累积回报均高于MOPO,且在上下文推断后性能得以恢复。
- 在Walker2d环境中,AugWM在质量与阻尼变化下保持稳定性能,而MOPO在多个设置下完全失败。
- 在残肢Ant环境中,MOPO智能体翻倒并失败,而AugWM智能体成功适应并完成任务。
- 该方法在真实世界类似动力学变化中成功部署了策略,且无需测试时奖励或环境访问。
- 自监督上下文推断机制实现了单episode内的有效适应,证明了对动力学分布偏移的强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。