[论文解读] Synthetic Returns for Long-Term Credit Assignment
本文提出状态关联学习(SA)以通过建模过去状态与遥远未来奖励之间的直接关联,改善强化学习中的长期信用分配问题,从而计算出‘合成回报’(SR),用于估计某一状态对未来奖励的贡献。当与标准时序差分学习结合时,SR增强型智能体在Atari Skiing任务上的学习速度比之前最先进方法快25倍,展现出在延迟奖励环境中的卓越样本效率与可解释性。
Since the earliest days of reinforcement learning, the workhorse method for assigning credit to actions over time has been temporal-difference (TD) learning, which propagates credit backward timestep-by-timestep. This approach suffers when delays between actions and rewards are long and when intervening unrelated events contribute variance to long-term returns. We propose state-associative (SA) learning, where the agent learns associations between states and arbitrarily distant future rewards, then propagates credit directly between the two. In this work, we use SA-learning to model the contribution of past states to the current reward. With this model we can predict each state's contribution to the far future, a quantity we call "synthetic returns". TD-learning can then be applied to select actions that maximize these synthetic returns (SRs). We demonstrate the effectiveness of augmenting agents with SRs across a range of tasks on which TD-learning alone fails. We show that the learned SRs are interpretable: they spike for states that occur after critical actions are taken. Finally, we show that our IMPALA-based SR agent solves Atari Skiing -- a game with a lengthy reward delay that posed a major hurdle to deep-RL agents -- 25 times faster than the published state-of-the-art.
研究动机与目标
- 解决强化学习中长期延迟奖励的挑战,因为标准时序差分(TD)学习在长序列中因方差高且信用分配差而表现不佳。
- 克服TD学习在存在无关事件干扰时难以传播奖励信号的局限性。
- 开发一种方法,直接将未来奖励的信用分配给过去的状态,即使中间存在长时间延迟和无关事件。
- 使深度强化学习智能体能够高效学习稀疏且延迟的奖励任务,如Atari Skiing。
- 提升深度强化学习中信用分配的样本效率与可解释性。
提出的方法
- 使用门控循环结构学习一个记忆贡献函数 c(s_t),以建模过去状态对未来奖励的影响。
- 训练一个模型,将当前时间步的奖励预测为基线 b(s_t) 与过去状态贡献 c(s_t) 的总和,从而形成合成回报估计。
- 将回报信号分解为各个过去状态的贡献,实现无需逐层反向传播的直接信用分配。
- 通过将合成回报(SR)作为策略优化的代理回报信号,将其整合到标准TD学习中。
- 使用情景记忆存储状态表征,并在信用分配过程中实现对过去状态的召回。
- 将合成回报增强现有智能体(如IMPALA),在不改变网络架构的前提下提升其在长时序任务中的性能。
实验结果
研究问题
- RQ1状态关联学习能否有效将信用分配给与未来奖励相隔长时间延迟且中间存在无关事件的过去状态?
- RQ2使用合成回报是否能提升深度强化学习智能体在延迟奖励任务中的样本效率?
- RQ3所学习的合成回报是否可解释为状态重要性的有意义指标,特别是在关键动作发生前后?
- RQ4SR增强型智能体在Atari Skiing任务上的学习速度与性能,与Agent57等最先进智能体相比如何?
- RQ5该方法在Atari Skiing以外的多样化长信用分配任务中,其泛化能力如何?
主要发现
- SR增强型IMPALA智能体在Atari Skiing上达到人类水平性能,而未使用合成回报的基线IMPALA智能体则无法学习。
- SR增强型智能体在Atari Skiing任务上使用的环境交互步数仅为之前发表的最先进方法Agent57的1/25。
- 合成回报在关键动作发生后的状态处出现显著峰值,体现出良好的可解释性与有意义的信用分配。
- 该方法即使在中间事件无关或嘈杂的情况下,仍能成功实现长延迟下的信用分配。
- 该方法在不改变底层强化学习智能体架构的前提下提升了样本效率,显示出与现有深度强化学习框架的强兼容性。
- 尽管性能表现优异,该方法仍表现出明显的随机种子差异与超参数敏感性,表明在鲁棒性方面仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。