Skip to main content
QUICK REVIEW

[论文解读] Giving Up Control: Neurons as Reinforcement Learning Agents

Jordan Ott|arXiv (Cornell University)|Mar 17, 2020
Reinforcement Learning in Robotics参考文献 30被引用 4
一句话总结

本文提出将单个神经元建模为独立的强化学习智能体,使其在神经网络内部通过竞争与合作实现自我利益最大化。通过引入生物启发式奖励(如任务表现、稀疏性与活动痕迹),神经网络在CartPole等高层任务上实现了稳定且可扩展的学习,性能优于仅使用任务奖励的训练方式,尤其在更深的网络架构中表现更优。

ABSTRACT

Artificial Intelligence has historically relied on planning, heuristics, and handcrafted approaches designed by experts. All the while claiming to pursue the creation of Intelligence. This approach fails to acknowledge that intelligence emerges from the dynamics within a complex system. Neurons in the brain are governed by local rules, where no single neuron, or group of neurons, coordinates or controls the others. This local structure gives rise to the appropriate dynamics in which intelligence can emerge. Populations of neurons must compete with their neighbors for resources, inhibition, and activity representation. At the same time, they must cooperate, so the population and organism can perform high-level functions. To this end, we introduce modeling neurons as reinforcement learning agents. Where each neuron may be viewed as an independent actor, trying to maximize its own self-interest. By framing learning in this way, we open the door to an entirely new approach to building intelligent systems.

研究动机与目标

  • 通过将注意力从自上而下的行为级损失函数优化,转向自下而上的涌现智能,基于局部神经元动态,克服人工智能中现有方法的局限性。
  • 通过在神经元层面嵌入生物上合理的奖励机制,解决深度强化学习中的可扩展性与稳定性问题。
  • 证明神经元作为独立的强化学习智能体,可通过内在的竞争与合作共同解决高层级任务。
  • 探索局部、神经元特异性的奖励(如稀疏性与活动痕迹)是否能改善网络动力学并实现更深网络的训练。
  • 超越外部定义的奖励函数,研究内部、智能体本地化的奖励生成机制,以实现更具生物合理性的学习。

提出的方法

  • 每个神经元被建模为一个独立的强化学习智能体,使用策略梯度方法最大化其自身利益。
  • 网络采用多智能体框架,神经元在活动表征与资源上相互竞争,同时协作以实现高层级任务目标。
  • 奖励信号由三部分组成:任务级奖励(如CartPole得分)、稀疏性奖励(惩罚过度或不足活动)以及活动痕迹(鼓励平衡的放电模式)。
  • 活动痕迹奖励惩罚始终活跃或始终不活跃的神经元,促进群体编码多样性并防止饱和。
  • 训练在OpenAI Gym的CartPole环境中进行,网络结构包含1层、2层与5层,采用随机策略优化。
  • 测试了多种奖励组合:仅任务奖励、仅生物启发式奖励,以及两者结合的混合方案,以评估对学习效率与可扩展性的影响。

实验结果

研究问题

  • RQ1在无集中监督的情况下,将神经元建模为独立强化学习智能体的网络是否能学会解决高层控制任务(如CartPole)?
  • RQ2在更深的网络中,引入生物启发式奖励(如稀疏性与活动痕迹)是否能提升训练稳定性和性能?
  • RQ3当网络仅依赖任务级奖励与同时结合本地、生物基础奖励时,多智能体神经网络的性能表现有何差异?
  • RQ4在追求自我利益的同时,神经元是否仍能实现高阶任务所必需的集体协作?
  • RQ5内部、神经元本地化的奖励机制在多大程度上减少了对外部定义奖励函数的依赖?

主要发现

  • 仅使用任务级奖励训练的网络在超过两层后难以有效扩展,深层架构中需超过20,000个训练回合才能达到目标性能。
  • 引入生物启发式奖励(稀疏性与活动痕迹)使五层网络成功训练,当与任务奖励结合时,平均训练时间减少至4,419个回合。
  • 混合奖励方案(生物奖励+任务奖励)表现最佳,五层网络在100个回合中平均奖励达到300时,平均仅需4,419个回合。
  • 活动痕迹奖励成功实现了平衡的放电模式,防止神经元永久活跃或沉默,从而促进群体编码多样性。
  • 结果表明,生物启发式奖励对稳定深层、更复杂网络的学习动力学至关重要。
  • 该框架在多智能体、神经元级强化学习中具有可行性,表明自利智能体可通过内在奖励结构实现集体智能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。