Skip to main content
QUICK REVIEW

[论文解读] Interval timing in deep reinforcement learning agents

Ben Deverett, Ryan Faulkner|arXiv (Cornell University)|May 31, 2019
Neuroscience and Music Perception参考文献 31被引用 7
一句话总结

本文通过一种受神经科学启发的任务,研究了深度强化学习智能体在区间时间感知方面的能力,该任务要求智能体重现一个样本时间间隔以获得奖励。循环(LSTM)和前馈智能体均成功学习了该任务,其中循环智能体在LSTM单元中使用内部计数器,而前馈智能体则发展出类似自组织的策略,类似于生物时间机制。

ABSTRACT

The measurement of time is central to intelligent behavior. We know that both animals and artificial agents can successfully use temporal dependencies to select actions. In artificial agents, little work has directly addressed (1) which architectural components are necessary for successful development of this ability, (2) how this timing ability comes to be represented in the units and actions of the agent, and (3) whether the resulting behavior of the system converges on solutions similar to those of biology. Here we studied interval timing abilities in deep reinforcement learning agents trained end-to-end on an interval reproduction paradigm inspired by experimental literature on mechanisms of timing. We characterize the strategies developed by recurrent and feedforward agents, which both succeed at temporal reproduction using distinct mechanisms, some of which bear specific and intriguing similarities to biological systems. These findings advance our understanding of how agents come to represent time, and they highlight the value of experimentally inspired approaches to characterizing agent abilities.

研究动机与目标

  • 研究深度强化学习智能体在受控的、实验启发的环境中如何发展出区间时间感知能力。
  • 确定哪些网络结构组件(循环与前馈)对于成功的时间重现是必要的。
  • 比较人工智能体所涌现的时间策略与动物中已知的生物机制之间的异同。
  • 评估端到端训练的智能体是否收敛到与生物系统观察到的解决方案相似的解。
  • 探索通过时间反向传播和信用分配在学习时间依赖性中的作用。

提出的方法

  • 智能体在PsychLab环境中端到端训练,任务为模拟神经科学研究实验的区间重现任务。
  • 任务要求智能体注视中心十字,等待'Set'提示后的样本时间间隔,随后凝视'Go'目标以完成试验。
  • 性能根据'Set'到'Go'凝视的时间(即输出间隔)是否在容差范围内匹配样本间隔来评估。
  • 循环智能体使用LSTM控制器并结合通过时间的反向传播;前馈智能体使用非循环网络,依赖策略梯度更新。
  • 进行了网络结构消融实验,包括冻结LSTM权重、截断反向传播(10步强化学习),以及替换为普通RNN、GRU和RMC。
  • 通过隐藏单元激活、动作轨迹以及跨时间间隔的泛化能力分析策略。

实验结果

研究问题

  • RQ1循环和前馈深度强化学习智能体是否发展出用于区间时间感知的截然不同的策略?
  • RQ2架构选择(如循环性、通过时间的反向传播)如何影响时间表征的出现?
  • RQ3人工智能体的时间策略在多大程度上与动物中观察到的机制相似?
  • RQ4前馈智能体能否在没有显式循环记忆的情况下学习区间时间感知,而仅依赖策略信用分配?
  • RQ5当架构发生改变(如冻结权重或截断学习更新)时,区间时间感知性能的鲁棒性如何?

主要发现

  • 循环(LSTM)和前馈深度强化学习智能体均以端到端方式成功解决了区间重现任务。
  • 循环智能体发展出类似计数器的内部时间机制,LSTM隐藏单元中表现出与已过去时间相对应的显著激活模式。
  • 前馈智能体采用了类似自组织的策略,时间感知源于累积的动作模式而非显式记忆,与动物中的心理物理学发现相似。
  • 冻结LSTM权重的智能体性能与可训练LSTM相当,表明即使内部权重不可训练,学习仍可发生。
  • 在截断反向传播(10步强化学习)下,循环智能体保持了强劲性能,而前馈智能体则严重受损,凸显了在非循环网络中时间信用分配的重要性。
  • 性能对架构变化具有鲁棒性,包括替换为普通RNN、GRU和RMC,尽管部分模型表现出性能偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。