[论文解读] Self-organization of action hierarchy and compositionality by reinforcement learning with recurrent neural networks
本文提出 ReMASTER,一种具有随机动力学的循环多时间尺度演员-评论家框架,使强化学习智能体能够自主组织动作层次结构与组合性技能。通过在神经动力学和奖励折扣中引入多时间尺度,智能体发展出抽象子目标和低层次动作基元,从而在重新组合先前学习的技能以应对新任务时实现更快的再学习。
Recurrent neural networks (RNNs) for reinforcement learning (RL) have shown distinct advantages, e.g., solving memory-dependent tasks and meta-learning. However, little effort has been spent on improving RNN architectures and on understanding the underlying neural mechanisms for performance gain. In this paper, we propose a novel, multiple-timescale, stochastic RNN for RL. Empirical results show that the network can autonomously learn to abstract sub-goals and can self-develop an action hierarchy using internal dynamics in a challenging continuous control task. Furthermore, we show that the self-developed compositionality of the network enhances faster re-learning when adapting to a new task that is a re-composition of previously learned sub-goals, than when starting from scratch. We also found that improved performance can be achieved when neural activities are subject to stochastic rather than deterministic dynamics.
研究动机与目标
- 探究具有多时间尺度的循环神经网络是否能在无先验任务分解的情况下,自主发展强化学习中的层次化动作结构。
- 考察自学习的组合性在重新组合先前学习的子目标以适应新任务时,如何提升再学习效率。
- 探索随机神经动力学在提升强化学习中的学习性能与层次化抽象能力方面的作用。
- 评估多时间尺度奖励折扣是否能在单一框架中支持长期规划与短期技能执行的出现。
- 证明通过内部神经动力学实现的层次化控制,相较于从零开始学习,能实现对重新组合任务的更快适应。
提出的方法
- 提出 ReMASTER,一种新颖的离策略演员-评论家算法,其神经激活动力学与奖励折扣均具有多时间尺度。
- 在所有网络层引入随机性以模拟生物神经噪声,提升探索能力与鲁棒性。
- 为不同时间尺度分配不同的折扣因子:低层次动作采用较快的折扣,高层次子目标采用较慢的折扣。
- 采用分层 RNN 架构,通过快速上下文神经元与慢速上下文神经元分别表示详细运动技能与抽象动作序列。
- 应用带随机采样的经验回放,以提升训练过程中的泛化能力与稳定性。
- 设计一个顺序组合控制任务,要求子目标按顺序达成,且不提供显式的子目标信号。
实验结果
研究问题
- RQ1具有多时间尺度 RNN 的强化学习智能体是否能在无先验任务分解的情况下,自主发展内部动作层次结构?
- RQ2当任务通过重新组合新目标序列而重构时,自组织的子目标组合性是否能提升再学习速度?
- RQ3随机神经动力学如何促进强化学习中层次化控制的出现与性能提升?
- RQ4神经动力学与奖励折扣之间的时间尺度对齐对层次化技能获取有何影响?
- RQ5智能体能否通过重新组合先前学习的子目标来泛化至新任务?与从零开始学习相比表现如何?
主要发现
- ReMASTER 框架成功使智能体自主组织动作层次结构,其中慢速上下文神经元表示抽象子目标,快速上下文神经元编码低层次动作基元。
- 当适应涉及重新组合先前学习子目标的新任务时,网络表现出显著更快的再学习速度,优于从零开始训练。
- 当高低层次组件的时间尺度被互换时,性能出现下降,表明正确的时间尺度对齐对有效层次结构形成至关重要。
- 随机神经动力学提升了学习性能,并增强了层次化技能发展的鲁棒性,优于确定性动力学。
- 自学习的组合性使智能体能够通过重新组合学习到的子目标,灵活重构其控制策略以适应新任务目标。
- 该框架在子目标不可见的顺序组合控制任务中实现了卓越性能,证明了对任务结构的内部表征能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。