[论文解读] Uncertainty-aware Model-based Policy Optimization
本文提出了一种不确定性感知的基于模型的策略优化(MBPO)框架,该框架联合学习一个不确定性感知的动力学模型,并通过可微分规划优化策略。通过将基于模型的规划与通过自动微分实现的策略梯度学习相结合,MBPO在MuJoCo连续控制基准测试中实现了比当前最先进模型自由和基于模型的基线方法更优的样本效率和具有竞争力的渐近性能。
Model-based reinforcement learning has the potential to be more sample efficient than model-free approaches. However, existing model-based methods are vulnerable to model bias, which leads to poor generalization and asymptotic performance compared to model-free counterparts. In addition, they are typically based on the model predictive control (MPC) framework, which not only is computationally inefficient at decision time but also does not enable policy transfer due to the lack of an explicit policy representation. In this paper, we propose a novel uncertainty-aware model-based policy optimization framework which solves those issues. In this framework, the agent simultaneously learns an uncertainty-aware dynamics model and optimizes the policy according to these learned models. In the optimization step, the policy gradient is computed by automatic differentiation through the models. With respect to sample efficiency alone, our approach shows promising results on challenging continuous control benchmarks with competitive asymptotic performance and significantly lower sample complexity than state-of-the-art baselines.
研究动机与目标
- 解决现实世界控制设置中模型自由强化学习的高样本复杂度问题。
- 通过显式建模动力学预测中的不确定性,克服基于模型强化学习中的模型偏差。
- 通过用显式策略表示替代模型预测控制(MPC),实现高效、低延迟的策略推理。
- 通过支持在相似任务间复用已学习的动力学模型和策略,实现迁移学习。
- 在保持与模型自由方法相当的渐近性能的同时,实现高样本效率。
提出的方法
- 使用集成方法训练深度神经网络动力学模型,以估计预测不确定性,并通过自助采样实现可扩展的不确定性量化。
- 利用自动微分计算通过动力学模型的策略梯度,实现端到端的策略优化。
- 用显式策略网络替代传统MPC,实现直接的策略评估和可迁移性。
- 在每次环境交互后进行在线策略更新,利用离策略数据实现高效学习。
- 将不确定性估计整合到规划目标中,以减少长时域上的误差累积。
- 通过在价值函数估计中加权不确定性,实现风险敏感规划,提升鲁棒性。
实验结果
研究问题
- RQ1不确定性感知的动力学建模是否能减少模型偏差,并改善基于模型强化学习中的长时域规划?
- RQ2通过学习到的动力学模型实现可微分策略优化,是否能比基于MPC的方法带来更高的样本效率?
- RQ3所提出的框架是否能支持在相关任务间对动力学模型和策略的迁移学习?
- RQ4所提出方法在连续控制基准测试中的样本效率与当前最先进模型自由和基于模型算法相比如何?
- RQ5不确定性量化对渐近性能和训练稳定性有何影响?
主要发现
- 在Pendulum-v0、Swimmer-v2和HalfCheetah-v2上,MBPO的样本复杂度显著低于SOTA基线方法,包括PPO、DDPG、SAC和STEVE。
- 尽管环境交互次数远少于其他方法,MBPO仍实现了与SAC和PPO等模型自由方法相当或更优的渐近性能。
- 通过合理的不确定性量化,模型误差和误差累积效应得到有效缓解,表现为随着规划时域增加,价值函数估计误差降低。
- 显式策略表示支持迁移学习,使智能体能够从相似环境中已有的策略和动力学模型中快速启动。
- 尽管性能表现强劲,MBPO的结果对随机种子表现出敏感性,表明由于采用激进的在线更新策略且缺乏初始随机探索,训练动态可能存在不稳定性。
- 该框架表明,当不确定性被恰当建模并整合到策略优化中时,基于模型的强化学习可同时实现高样本效率和强渐近性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。