Skip to main content
QUICK REVIEW

[论文解读] Integrating Episodic Memory into a Reinforcement Learning Agent using Reservoir Sampling

Kenny Young, Richard S. Sutton|arXiv (Cornell University)|Jun 1, 2018
Neural Networks and Reservoir Computing参考文献 15被引用 6
一句话总结

该论文提出了一种新颖的强化学习算法,通过使用水库采样将情景记忆整合进来,以实现长期依赖关系的高效在线学习。通过存储过去的状态并赋予可学习的重要性权重,并利用基于水库采样的梯度估计,智能体能够在不通过时间反向传播的情况下学习优先利用有用的记忆,在具有显著长期依赖关系的任务上实现了近乎完美的性能。

ABSTRACT

Episodic memory is a psychology term which refers to the ability to recall specific events from the past. We suggest one advantage of this particular type of memory is the ability to easily assign credit to a specific state when remembered information is found to be useful. Inspired by this idea, and the increasing popularity of external memory mechanisms to handle long-term dependencies in deep learning systems, we propose a novel algorithm which uses a reservoir sampling procedure to maintain an external memory consisting of a fixed number of past states. The algorithm allows a deep reinforcement learning agent to learn online to preferentially remember those states which are found to be useful to recall later on. Critically this method allows for efficient online computation of gradient estimates with respect to the write process of the external memory. Thus unlike most prior mechanisms for external memory it is feasible to use in an online reinforcement learning setting.

研究动机与目标

  • 解决在非马尔可夫强化学习环境中学习长期依赖关系的挑战,其中马尔可夫性质不成立。
  • 通过避免时间反向传播,实现在外部记忆支持下的智能体高效在线训练。
  • 开发一种记忆机制,使智能体能够基于未来效用对过去状态进行信用分配,而无需完整追踪历史记录。
  • 设计一种可微分且可扩展的记忆系统,以固定大小存储过去的状态,并赋予可学习的重要性权重。
  • 证明基于水库采样的情景记忆能够实现稳定且高性能的学习,适用于具有显著长期依赖关系的任务。

提出的方法

  • 智能体维护一个固定大小为 n 的外部记忆,存储过去的状态,并附带通过可微写入过程学习到的重要性权重。
  • 采用水库采样程序以随机方式选择保留哪些过去的状态,确保记忆集合能够代表按其效用加权的状态分布。
  • 每个状态的写入权重通过使用来自水库采样机制的梯度估计,利用随机梯度下降进行学习,从而实现在线学习。
  • 策略网络通过查询网络计算当前状态与存储状态之间的相似度来查询记忆,输出结果用于调节动作策略。
  • 价值网络和策略网络通过优势演员评论家方法,利用记忆中的经验进行训练,整个系统通过标准随机梯度下降进行端到端优化。
  • 一个关键创新是推导出不依赖时间反向传播的写入过程梯度估计,使在线训练成为可能。

实验结果

研究问题

  • RQ1强化学习智能体能否在非马尔可夫环境中学会优先保留对决策最有用的过去状态?
  • RQ2是否可能在不依赖时间反向传播的情况下在线训练外部记忆系统?
  • RQ3基于水库采样的情景记忆与循环神经网络架构相比,在学习长期依赖关系方面表现如何?
  • RQ4在流式在线设置中,能否高效地对记忆写入过程进行梯度估计?
  • RQ5所提出的方法是否能在需要显著长期信用分配的任务上实现稳定且高性能的学习?

主要发现

  • 情景记忆智能体在1-决策和2-决策链环境中实现了近乎完美的平均回报,表明其有效学习了长期依赖关系。
  • 智能体成功将无信息量状态的写入权重降至接近零,同时保持了信息量丰富状态的高写入权重,展示了有效的记忆选择能力。
  • 与循环基线相比,该方法无需使用折扣因子或熵正则化即可避免灾难性循环,后者则需要这些手段以实现稳定训练。
  • 当环境长度从25,000集增加到50,000集时,收敛时间大致翻倍,但各次训练运行均保持稳定。
  • 基于水库采样的记忆系统实现了恒定内存和计算成本的在线训练,且与历史长度无关,具备良好的可扩展性。
  • 循环基线需要使用RMSProp和超参数调优(如γ=0.9,熵权重0.0005)才能实现稳定学习,而情景记忆智能体则使用标准SGD且无需此类调整即可表现良好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。