[论文解读] Universal Successor Features for Transfer Reinforcement Learning
本文提出通用后继表示(USR)作为强化学习中可迁移的知识表征,通过将后继表示泛化至目标,实现对新任务的快速适应。通过训练深度神经网络以基于目标预测后继特征,USR使智能体能够显著加快策略学习的初始化速度,相较于随机初始化,在网格世界环境的未见目标上实现了优异的零样本迁移性能。
Transfer in Reinforcement Learning (RL) refers to the idea of applying knowledge gained from previous tasks to solving related tasks. Learning a universal value function (Schaul et al., 2015), which generalizes over goals and states, has previously been shown to be useful for transfer. However, successor features are believed to be more suitable than values for transfer (Dayan, 1993; Barreto et al.,2017), even though they cannot directly generalize to new goals. In this paper, we propose (1) Universal Successor Features (USFs) to capture the underlying dynamics of the environment while allowing generalization to unseen goals and (2) a flexible end-to-end model of USFs that can be trained by interacting with the environment. We show that learning USFs is compatible with any RL algorithm that learns state values using a temporal difference method. Our experiments in a simple gridworld and with two MuJoCo environments show that USFs can greatly accelerate training when learning multiple tasks and can effectively transfer knowledge to new tasks.
研究动机与目标
- 解决在具有不同目标和奖励函数的多样化强化学习任务之间迁移知识的挑战。
- 克服通用价值函数在同时泛化动力学和奖励函数方面存在的局限性。
- 开发一种仅对转移动力学进行泛化的后继表示框架,以实现更稳定和高效的迁移。
- 设计一种深度学习架构,通过离策略经验端到端近似USR。
- 证明USR初始化相比随机初始化能显著加快新任务的收敛速度。
提出的方法
- 将环境的奖励函数分解为状态-动作-状态特征与权重向量的线性组合:$ r(s_t,a_t,s_{t+1}) = \mathbf{\phi}(s_t,a_t,s_{t+1})^\top \mathbf{w} $。
- 将后继表示 $ \mathbf{\psi}^\pi(s, \text{goal}) $ 定义为在策略下,从某一状态出发,对目标条件下的特征期望折扣和。
- 使用时序差分损失训练深度神经网络以预测 $ \mathbf{\psi}(s, g; \theta_\psi) $:$ L_\psi = \| \mathbf{\phi}(s_t) + \gamma_t \mathbf{\psi}(s_{t+1}, g; \theta_\psi) - \mathbf{\psi}(s_t, g; \theta_\psi) \|_2^2 $。
- 通过梯度下降法同时训练奖励权重向量 $ \mathbf{w}(g; \theta_w) $,以最小化奖励预测误差:$ L_w = [r_t - \mathbf{\phi}(s_{t+1})^\top \mathbf{w}(g; \theta_w)]^2 $。
- 利用预测的后继特征和奖励权重,通过演员-评论家更新计算优势信号以改进策略。
- 在初始化策略于先前未见过的目标之前,先在一组源目标上训练USR模型。
实验结果
研究问题
- RQ1后继表示能否在目标上进行泛化,以实现在强化学习中的有效迁移学习?
- RQ2仅对动力学进行泛化的通用后继表示,其迁移性能是否优于通用价值函数?
- RQ3在部分目标上训练的USR模型,是否能相比随机策略初始化,实现对新未见目标的更快学习?
- RQ4在具有原始像素观测的视觉网格世界环境中,USR在目标间的泛化能力如何?
- RQ5USR-based初始化在下游策略学习中能在多大程度上降低样本复杂度?
主要发现
- USR模型成功实现了在目标之间的后继表示泛化,使智能体在四房间网格世界环境中能够有效实现对未见目标的零样本迁移。
- 在仅用64个目标中的48个目标训练的USR初始化下,智能体在剩余16个未见目标上的学习速度显著快于随机初始化。
- USR模型在未见目标上表现出强大的泛化性能,策略学习收敛更快且样本效率更高。
- 所提出的联合优化奖励特征与后继表示的训练算法实现了稳定且高效的策略学习。
- 使用USR作为归纳偏置,显著加快了智能体对新任务的适应速度,证实了其作为强化学习中可迁移知识表征的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。