Skip to main content
QUICK REVIEW

[论文解读] Network of Evolvable Neural Units: Evolving to Learn at a Synaptic Level

Paul Bertens, Seong-Whan Lee|arXiv (Cornell University)|Dec 16, 2019
Advanced Memory and Neural Computing参考文献 42被引用 4
一句话总结

该论文提出可演化神经元单元(Evolvable Neural Units, ENUs),一种新型神经网络架构,其中神经元和突触均独立演化,以实现突触层面的学习。通过使用进化算法优化动态、多通道的突触与胞体隔室,该模型学习了整合-放电动力学与突触时序可塑性,从而在无需反向传播或固定学习规则的情况下,实现T形迷宫任务中的一次性强化学习。

ABSTRACT

Although Deep Neural Networks have seen great success in recent years through various changes in overall architectures and optimization strategies, their fundamental underlying design remains largely unchanged. Computational neuroscience on the other hand provides more biologically realistic models of neural processing mechanisms, but they are still high level abstractions of the actual experimentally observed behaviour. Here a model is proposed that bridges Neuroscience, Machine Learning and Evolutionary Algorithms to evolve individual soma and synaptic compartment models of neurons in a scalable manner. Instead of attempting to manually derive models for all the observed complexity and diversity in neural processing, we propose an Evolvable Neural Unit (ENU) that can approximate the function of each individual neuron and synapse. We demonstrate that this type of unit can be evolved to mimic Integrate-And-Fire neurons and synaptic Spike-Timing-Dependent Plasticity. Additionally, by constructing a new type of neural network where each synapse and neuron is such an evolvable neural unit, we show it is possible to evolve an agent capable of learning to solve a T-maze environment task. This network independently discovers spiking dynamics and reinforcement type learning rules, opening up a new path towards biologically inspired artificial intelligence.

研究动机与目标

  • 通过创建生物上合理且可学习的神经组件,弥合计算神经科学、机器学习与进化算法之间的鸿沟。
  • 通过演化动态、多参数的突触与神经元隔室,克服固定权重深度神经网络与静态学习规则的局限性。
  • 证明由可演化单元构成的网络能够通过进化优化自主发现脉冲动力学与强化学习机制。
  • 通过基于局部奖励信号演化自适应的突触更新规则,实现在强化学习环境中的一次性学习。
  • 探索复杂神经行为(如记忆与回避)是否可从一组演化单元的局部、去中心化学习中涌现。

提出的方法

  • 每个神经元与突触均建模为可演化神经元单元(ENU),即具备动态内部参数的自包含计算单元。
  • 使用遗传算法演化ENUs,基于适应度(T形迷宫任务中的奖励)优化其内部状态转换与突触更新规则。
  • 突触ENUs通过多通道动态运算处理来自突触前神经元的输入,而非固定乘法,从而实现灵活的信息转换。
  • 神经元ENUs使用可演化的阈值机制整合输入,能够演化出兴奋性与抑制性行为。
  • 网络采用基于T形迷宫环境中累积奖励的适应度函数,其中智能体需学习将特定颜色与食物或毒物关联。
  • 每个世代开始时重置每个ENU内的参数向量,从而实现真正意义上的元学习,与标准反向传播相区别。

实验结果

研究问题

  • RQ1一组独立演化的神经元与突触单元是否能学习模仿生物脉冲动力学(如整合-放电行为)?
  • RQ2同一框架是否可通过进化优化演化出类似突触时序可塑性(STDP)的突触可塑性规则?
  • RQ3由ENUs构成的网络是否能通过局部、去中心化的学习在无反向传播的情况下解决强化学习任务(如T形迷宫)?
  • RQ4所演化系统是否通过单次经历奖励结果即实现一次性学习,从而实现持久的行为适应?
  • RQ5ENUs中多通道动态参数的使用是否能实现比固定权重网络更灵活、更生物合理的信息处理?

主要发现

  • 可演化神经元单元成功演化出整合-放电神经元的动力学特性,包括分级总和与动作电位生成。
  • 模型演化出功能性突触时序可塑性(STDP)形式,其中突触权重根据突触前与突触后动作电位的时间顺序进行更新。
  • 在T形迷宫环境中,所演化网络通过学习将特定颜色与食物或毒物关联,并据此调整行为,实现了强化学习。
  • 该系统展示了单次学习能力,即单次接触奖励结果后即实现持久的行为适应,而标准深度学习模型需数百万次训练才能实现类似效果。
  • 网络演化出抑制性突触机制,可抑制先前被奖励但具有危害性的行为(如误食毒物),展现出自适应行为控制。
  • 多通道动态参数的使用使系统能够演化出超越简单权重乘法的复杂非线性突触运算,支持更丰富的信息处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。