[论文解读] Hebbian Synaptic Modifications in Spiking Neurons that Learn
本文提出了一种适用于脉冲神经元的生物可实现突触可塑性规则,该规则通过直接强化学习算法实现长期奖励的最大化。该规则仅依赖局部的突触前与突触后活动以及一个全局奖励信号,在无需反向传播或梯度计算的情况下,实现了模式分类和运动控制任务中的局部最优性能。
In this paper, we derive a new model of synaptic plasticity, based on recent algorithms for reinforcement learning (in which an agent attempts to learn appropriate actions to maximize its long-term average reward). We show that these direct reinforcement learning algorithms also give locally optimal performance for the problem of reinforcement learning with multiple agents, without any explicit communication between agents. By considering a network of spiking neurons as a collection of agents attempting to maximize the long-term average of a reward signal, we derive a synaptic update rule that is qualitatively similar to Hebb's postulate. This rule requires only simple computations, such as addition and leaky integration, and involves only quantities that are available in the vicinity of the synapse. Furthermore, it leads to synaptic connection strengths that give locally optimal values of the long term average reward. The reinforcement learning paradigm is sufficiently broad to encompass many learning problems that are solved by the brain. We illustrate, with simulations, that the approach is effective for simple pattern classification and motor learning tasks.
研究动机与目标
- 开发一种适用于脉冲神经元的突触可塑性规则,使其既具有生物学合理性,又能优化长期性能。
- 证明强化学习原理可导出一种类似赫布型的更新规则,仅需局部可用信号和一个全局奖励信号。
- 证明该规则可在无需反向传播的情况下,有效实现模式分类和自适应控制任务中的学习。
- 建立理论基础,阐明此类规则如何导致神经网络中突触权重的局部最优。
提出的方法
- 基于直接强化学习算法(特别是REINFORCE族)推导出一种突触更新规则,并将其适配于脉冲神经元。
- 使用一个全局可用但仅在更新规则中局部应用的奖励信号,确保其生物学合理性。
- 将该规则应用于由脉冲神经元构成的网络,模型为协作智能体,每个智能体基于局部活动和全局奖励独立优化其突触权重。
- 采用漏电积分和简单加法运算来计算资格迹,避免复杂的梯度反向传播。
- 引入一个控制更新时间敏感度的参数β,发现在恒定输入模式下β = 0.5时性能最优。
- 将学习规则分解为独立更新,使每个突触仅依赖其附近的突触前与突触后活动以及全局奖励信号。
实验结果
研究问题
- RQ1能否推导出一种基于强化学习的突触可塑性规则,使其既具有生物学合理性,又能在脉冲神经网络中实现有效学习?
- RQ2仅基于突触前与突触后活动及一个全局奖励信号的局部突触更新规则,是否能在神经回路中实现局部最优性能?
- RQ3此类规则是否可在无需反向传播或梯度计算的情况下,实现模式分类和运动控制等任务的学习?
- RQ4奖励信号的时间结构与突触资格迹如何影响学习性能?
主要发现
- 所提出的突触更新规则在声纳模式分类任务中实现了约10%的训练误差,与标准反向传播方法相当。
- 在倒立摆控制任务中,该算法成功学习到保持摆杆平衡,且在模拟时间推移中,摆倒前的平均持续时间逐渐增加。
- 倒立摆任务的学习曲线显示出稳步提升,性能在约2000秒模拟时间后趋于稳定。
- 该算法在无需任何梯度信息向网络反向传播的情况下实现了有效学习。
- 该规则在声纳分类任务的100次独立运行中表现出鲁棒性,误差率波动极小,性能一致。
- 对于恒定输入模式,时间衰减参数β的最优值被确定为0.5,该值在时间敏感度与稳定性之间实现了良好平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。