[论文解读] A learning gap between neuroscience and reinforcement learning
本文通过展示最先进强化学习(RL)算法在测试基于信念的推理与模糊性解决能力的神经科学启发T型迷宫环境时表现失败,揭示了神经科学与强化学习之间存在的关键学习鸿沟。作者将Friston等人(2016)提出的抽象T型迷宫重新实现为基于像素、类游戏的环境(E-maze),并表明即使最先进的算法如PPO、DQN、Rainbow和Dreamer也无法可靠解决该任务,凸显了需要基于认知神经科学原则设计的强化学习基准,以推动更具生物合理性的智能发展。
Historically, artificial intelligence has drawn much inspiration from neuroscience to fuel advances in the field. However, current progress in reinforcement learning is largely focused on benchmark problems that fail to capture many of the aspects that are of interest in neuroscience today. We illustrate this point by extending a T-maze task from neuroscience for use with reinforcement learning algorithms, and show that state-of-the-art algorithms are not capable of solving this problem. Finally, we point out where insights from neuroscience could help explain some of the issues encountered.
研究动机与目标
- 识别当前强化学习(RL)基准与神经科学研究的核心认知挑战(如模糊性、记忆与信念形成)之间的脱节。
- 证明尽管概念上简单,最先进的RL算法在设计用于测试基于信念决策的T型迷宫环境中仍表现不佳。
- 提出未来RL基准应基于已确立的神经科学任务,以促进受生物认知启发的算法发展。
- 提供实证证据表明,当前RL方法缺乏实现需要持久信念状态任务所必需的表征与推理能力。
提出的方法
- 将Friston等人(2016)提出的抽象T型迷宫重新实现为基于像素、类游戏的环境(E-maze),支持连续移动与视觉观测。
- 将环境设定为198度视野,并将最大步数限制在250步,以控制稀疏性并支持复杂导航。
- 采用标准深度RL算法——DQN、Rainbow、PPO与Dreamer——并使用来自Atari 2600基准的标准化超参数进行训练。
- 通过ICM与RND引入内在探索奖励,以在稀疏奖励环境中促进探索,并将其整合到外在奖励信号中。
- 将观测值预处理为84×84灰度图像,以匹配Atari基准标准,确保与现有RL基线的公平比较。
- 使用标准PPO训练智能体,采用权重初始化与探索调度策略,并在性能达到20%后关闭内在奖励。
实验结果
研究问题
- RQ1最先进深度强化学习算法能否解决需要在模糊性下进行基于信念推理的神经科学启发T型迷宫任务?
- RQ2为何当前RL算法在此任务上失败,尽管其在Atari及其他游戏环境中的表现优异?
- RQ3内在探索方法(如ICM与RND)在该模糊、稀疏奖励环境中对学习起到了何种作用?
- RQ4模型无偏与模型有偏RL方法(如PPO与Dreamer)在通过信念形成解决不确定性方面,其成功程度如何?
- RQ5如何通过神经科学启发的环境改进更具认知合理性的RL算法发展?
主要发现
- 所有测试的最先进RL算法——DQN、Rainbow、PPO与Dreamer——均未在E-maze环境中实现可靠性能,即使经过大量超参数调优。
- 即使引入ICM与RND的内在探索奖励,PPO智能体的性能仍无法突破20%,表明其在信念空间中的探索能力严重不足。
- 该环境的设计要求持久的信念状态并依赖线索解决模糊性,暴露了当前RL架构的根本局限。
- 模型无偏方法(如PPO与DQN)的表现与随机基线无显著差异,表明其缺乏随时间维持与更新信念的机制。
- 作为模型有偏智能体的Dreamer也失败,进一步表明世界模型学习本身不足以支持信念表征,除非具备显式机制。
- 结果表明,当前RL算法无法自然支持生物智能体所表现出的概率推理与依赖记忆的推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。