[论文解读] Neural Network Dynamics for Model-Based Deep Reinforcement Learning with Model-Free Fine-Tuning
该论文提出了一种混合模型预测与模型无关的强化学习方法,利用仅通过70万次随机动作步骤训练的神经网络动力学模型,实现对运动控制任务的快速、样本高效的策略学习。通过使用基于模型的策略初始化模型无关学习器,该方法在MuJoCo基准测试(如swimmer、cheetah、hopper和ant)中实现了3–5倍的样本效率提升,同时仅需极少数据即可实现实时轨迹跟踪。
Model-free deep reinforcement learning algorithms have been shown to be capable of learning a wide range of robotic skills, but typically require a very large number of samples to achieve good performance. Model-based algorithms, in principle, can provide for much more efficient learning, but have proven difficult to extend to expressive, high-capacity models such as deep neural networks. In this work, we demonstrate that medium-sized neural network models can in fact be combined with model predictive control (MPC) to achieve excellent sample complexity in a model-based reinforcement learning algorithm, producing stable and plausible gaits to accomplish various complex locomotion tasks. We also propose using deep neural network dynamics models to initialize a model-free learner, in order to combine the sample efficiency of model-based approaches with the high task-specific performance of model-free methods. We empirically demonstrate on MuJoCo locomotion tasks that our pure model-based approach trained on just random action data can follow arbitrary trajectories with excellent sample efficiency, and that our hybrid algorithm can accelerate model-free learning on high-speed benchmark tasks, achieving sample efficiency gains of 3-5x on swimmer, cheetah, hopper, and ant agents. Videos can be found at https://sites.google.com/view/mbmf
研究动机与目标
- 解决纯模型无关深度强化学习在机器人控制中样本复杂度过高的问题。
- 利用神经网络动力学模型,在复杂、高维的运动控制任务中实现样本高效的策略学习。
- 结合基于模型学习的样本效率与模型无关方法的高最终性能。
- 通过仅使用最小量的非策略数据训练动力学模型,证明其在真实世界部署的可行性。
- 为仿真环境与真实世界场景中学习鲁棒运动步态提供一种实用且数据高效的解决方案。
提出的方法
- 使用仅通过非策略方式收集的随机动作轨迹,训练一个多层前馈神经网络以建模环境动力学。
- 推理阶段采用随机射击法的模型预测控制(MPC),基于学习到的动力学模型生成控制动作。
- 通过在MPC控制器生成的轨迹上进行监督预训练,利用基于模型的策略初始化模型无关策略。
- 随后使用模型无关强化学习方法(如策略梯度)对初始化后的策略进行微调,以提升最终性能。
- 在训练过程中应用数据聚合技术,以提升动力学模型的泛化能力与稳定性。
- 该方法在MuJoCo运动控制基准测试(包括swimmer、half-cheetah、hopper和ant)上进行了评估。
实验结果
研究问题
- RQ1仅通过随机、非策略数据训练的神经网络动力学模型,能否在复杂运动控制任务中实现有效的基于模型控制?
- RQ2在高维控制任务中,所提出的基于模型方法相较于纯模型无关方法,其样本效率如何?
- RQ3基于模型的策略能否有效初始化模型无关学习器,以加速收敛同时保持高最终性能?
- RQ4设计选择(如数据聚合与MPC公式)对神经网络动力学模型在基于模型强化学习中的性能影响有多大?
- RQ5单个动力学模型在无需重新训练的情况下,能在多少种轨迹跟踪任务中复用?
主要发现
- 仅使用四小时以内的随机动作数据(7e5步)即可实现基于模型方法的有效步态学习,从而在多种任务中实现轨迹跟踪。
- 在MuJoCo基准测试的swimmer、cheetah、hopper和ant智能体上,混合Mb-Mf方法相较于纯模型无关学习实现了3–5倍的样本效率提升。
- 对于ant智能体,基于模型的方法仅使用纯模型无关方法所需数据的14%就达到了稳定行走步态。
- 在随机数据上训练的动力学模型,可在测试阶段无需重新训练即可泛化至任意轨迹跟踪任务。
- 仅基于模型的控制器可快速学习稳定步态,但因模型偏差导致性能停滞,该问题通过模型无关方法的微调得以克服。
- 由于其低数据需求及能够从非策略轨迹中学习,该方法展示了在真实世界机器人部署中的实际可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。