[论文解读] Multi-task Learning for Continuous Control
本文提出并评估了在多个MuJoCo环境中使用共享策略和价值网络的连续控制任务的多任务强化学习方法。结果表明,原始的多任务学习方法优于单任务训练和知识蒸馏,以更少的训练步数实现更优性能,并减少灾难性遗忘。
Reliable and effective multi-task learning is a prerequisite for the development of robotic agents that can quickly learn to accomplish related, everyday tasks. However, in the reinforcement learning domain, multi-task learning has not exhibited the same level of success as in other domains, such as computer vision. In addition, most reinforcement learning research on multi-task learning has been focused on discrete action spaces, which are not used for robotic control in the real-world. In this work, we apply multi-task learning methods to continuous action spaces and benchmark their performance on a series of simulated continuous control tasks. Most notably, we show that multi-task learning outperforms our baselines and alternative knowledge sharing methods.
研究动机与目标
- 通过在相关任务间实现知识迁移,解决现实世界机器人控制中强化学习的样本效率低下问题。
- 探究在计算机视觉和离散动作空间中有效的多任务学习方法是否可推广至连续控制任务。
- 在连续动作空间环境中,将原始多任务学习与知识蒸馏方法与单任务训练进行基准对比。
- 评估多任务强化学习中训练速度、性能稳定性与灾难性遗忘之间的权衡。
- 为未来在MuJoCo环境中开展多任务连续控制研究提供可复现的基准。
提出的方法
- 在六个MuJoCo环境中训练一个六头演员-critic网络,共享隐藏层并为每个任务设置特定输出头,通过循环切换环境,每个头训练100万帧。
- 采用优势演员-评论家(A2C)算法,使用在线策略轨迹和n步回报来更新策略和价值函数参数。
- 通过知识蒸馏方法,训练学生网络以模仿预训练教师网络的行为,同时使用策略回归和特征回归损失。
- 采用熵正则化以促进探索,防止过早收敛至次优的确定性策略。
- 对预训练网络在新环境中进行微调,以评估灾难性遗忘,初始化权重来自原始策略并仅更新最后几层。
- 通过20次轨迹的累积奖励评估性能,比较不同任务和训练策略下的均值与标准差。
实验结果
研究问题
- RQ1与单任务训练相比,连续控制环境中多任务学习是否能提高样本效率和最终性能?
- RQ2在连续控制任务中,原始多任务学习与知识蒸馏在训练速度、性能和方差方面有何差异?
- RQ3在新环境中微调预训练策略在多大程度上会导致原始任务上的灾难性遗忘?
- RQ4在多个相关任务间共享表征是否能加快收敛速度并提升泛化能力?
- RQ5知识蒸馏是否能稳定多任务连续控制设置中的训练过程或降低方差?
主要发现
- 原始多任务学习优于单任务训练,在仅100万帧的训练中即可达到单任务训练300万帧的性能水平。
- 原始多任务智能体在所有环境中的平均累积奖励均高于单任务和蒸馏基线方法。
- 知识蒸馏可缩短训练时间,蒸馏智能体比原始智能体更快达到1000分的奖励,但性能方差更大。
- 在HalfCheetahBigTorso和HalfCheetahSmallThigh环境中,蒸馏智能体的性能标准差显著高于原始智能体,表明学习过程更不稳定。
- 对预训练网络进行微调会导致灾难性遗忘,尽管在目标任务上性能有所提升,但在原始环境中的表现却下降。
- 采用共享表征的多任务学习显著减少了从头开始重新训练的需求,并实现了相关任务间的更快收敛。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。