[论文解读] Multi-task learning with deep model based reinforcement learning
本文提出预测性强化学习(PRL),一种基于模型的深度强化学习方法,通过从观测和动作中预测未来奖励变化,同时学习多个Atari游戏。与基于价值的方法不同,PRL将世界建模与策略学习解耦,实现了卓越的多任务性能——在Breakout、Pong和Demon Attack三款游戏中同时超越人类表现,且从随机操作示范中展现出强大的泛化能力。
In recent years, model-free methods that use deep learning have achieved great success in many different reinforcement learning environments. Most successful approaches focus on solving a single task, while multi-task reinforcement learning remains an open problem. In this paper, we present a model based approach to deep reinforcement learning which we use to solve different tasks simultaneously. We show that our approach not only does not degrade but actually benefits from learning multiple tasks. For our model, we also present a new kind of recurrent neural network inspired by residual networks that decouples memory from computation allowing to model complex environments that do not require lots of memory.
研究动机与目标
- 为解决模型自由深度Q-learning在多任务强化学习中任务数量增加时性能下降的局限性。
- 开发一种基于模型的方法,利用奖励作为监督信号,学习环境动态的预测表征。
- 实现在不降低性能的前提下同时学习多个任务,并探索多任务设置下的迁移学习优势。
- 设计一种新型循环神经网络架构,显式解耦记忆与计算,以实现对复杂环境的高效建模。
提出的方法
- 该方法使用一个预测模型,将当前观测和一系列未来动作作为输入,预测k步内的累积未来奖励。
- 通过预测与实际奖励变化之间的交叉熵损失,以完全监督的方式训练模型。
- 引入一种基于残差的新型循环网络架构,显式解耦记忆与计算,以提升训练稳定性和效率。
- 通过使用多样化策略(包括随机操作)在多个游戏中并行生成训练数据,并通过加权采样迭代微调模型,优先考虑近期数据。
- 该方法将环境理解与策略执行分离,使模型能够泛化到训练数据中未见的策略。
- 通过在模拟中并行运行多个游戏,加速数据生成和模型训练。
实验结果
研究问题
- RQ1基于模型的深度强化学习方法是否能在多任务学习场景中超越模型自由方法?
- RQ2同时学习多个任务是否会降低性能,还是能带来迁移学习的优势?
- RQ3在多样化行为上训练的预测模型,是否能泛化到高性能策略,而无需对最优动作进行直接监督?
- RQ4一种解耦记忆与计算的基于残差的循环网络架构,在复杂、长时程控制任务中是否具有高效性?
主要发现
- 多任务PRL智能体在三款游戏——Breakout、Pong和Demon Attack——中同时超越人类表现,其中Breakout相比单独训练有显著提升。
- 与单任务训练相比,Pong和Demon Attack的表现保持稳定或有所提升,表明多任务学习未造成性能下降。
- 仅在随机操作数据上训练一次迭代后,PRL模型在Demon Attack上得分达到1220,超过随机操作(152)七倍以上,展现出强大的泛化能力。
- 模型能有效泛化到训练期间未见过的策略,表现为其能仅从完全随机的演示数据中学习到高性能策略。
- 由于罕见事件(如游戏结束)导致的遗忘,训练过程显示出不稳定的迹象,特别是在死亡频率较低时,表现为得分波动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。