Skip to main content
QUICK REVIEW

[论文解读] Short-Term Plasticity Neurons Learning to Learn and Forget

Hector Garcia Rodriguez|arXiv (Cornell University)|Jun 28, 2022
Advanced Memory and Neural Computing被引用 6
一句话总结

本文提出了一种新型循环神经单元——短期可塑性神经元(STPN),该单元能够通过时间反向传播训练突触可塑性参数,使网络具备动态学习与遗忘的能力。STPN在监督学习与强化学习任务中均优于RNN、LSTM及其他可塑性模型,同时通过动态突触抑制实现最低能耗。

ABSTRACT

Short-term plasticity (STP) is a mechanism that stores decaying memories in synapses of the cerebral cortex. In computing practice, STP has been used, but mostly in the niche of spiking neurons, even though theory predicts that it is the optimal solution to certain dynamic tasks. Here we present a new type of recurrent neural unit, the STP Neuron (STPN), which indeed turns out strikingly powerful. Its key mechanism is that synapses have a state, propagated through time by a self-recurrent connection-within-the-synapse. This formulation enables training the plasticity with backpropagation through time, resulting in a form of learning to learn and forget in the short term. The STPN outperforms all tested alternatives, i.e. RNNs, LSTMs, other models with fast weights, and differentiable plasticity. We confirm this in both supervised and reinforcement learning (RL), and in tasks such as Associative Retrieval, Maze Exploration, Atari video games, and MuJoCo robotics. Moreover, we calculate that, in neuromorphic or biological circuits, the STPN minimizes energy consumption across models, as it depresses individual synapses dynamically. Based on these, biological STP may have been a strong evolutionary attractor that maximizes both efficiency and computational power. The STPN now brings these neuromorphic advantages also to a broad spectrum of machine learning practice. Code is available at https://github.com/NeuromorphicComputing/stpn

研究动机与目标

  • 通过将短期可塑性(STP)引入深度学习模型,弥合生物神经计算与人工神经网络之间的差距。
  • 通过利用生物上合理的机制,解决人工神经网络的关键局限,包括高样本复杂度、差的任务适应性以及高能耗。
  • 实现通过时间反向传播训练突触可塑性参数,使网络能够元学习最优的短期记忆动态。
  • 证明STP可同时提升模型能力与能效,尤其在动态与序列任务中表现显著。

提出的方法

  • STPN在每个突触内部引入自循环连接,以维持随时间衰减的动态突触状态,从而模拟短期可塑性。
  • 每个突触包含三个可训练参数:长期权重 $w_{ij}$,以及两个控制短期记忆衰减与增强的STP参数 $\lambda$ 和 $\gamma$。
  • 通过递归机制将突触状态随时间传播,实现通过时间的梯度流动,以优化可塑性参数。
  • 模型使用通过时间的反向传播,联合训练长期权重与短期可塑性动态,实现记忆衰减与增强的端到端学习。
  • 该架构可应用于前馈网络与循环网络,所有突触均应用可塑性,且支持监督学习与强化学习。
  • 通过测量动态突触抑制来评估能效,其中不活跃的突触被抑制,从而降低计算成本。

实验结果

研究问题

  • RQ1能否通过时间反向传播训练突触中的短期可塑性,以实现对动态记忆模式的元学习?
  • RQ2与标准RNN和LSTM相比,具有循环突触状态机制是否能提升序列与动态任务中的性能与稳定性?
  • RQ3可训练的短期可塑性是否能同时提升深度学习模型的性能与能效?
  • RQ4STPN学习遗忘的能力在多大程度上提升了训练稳定性与跨任务的泛化能力?
  • RQ5在收敛速度、最终性能以及对超参数选择的鲁棒性方面,STPN与其它快速权重及可微分可塑性模型相比表现如何?

主要发现

  • STPN在多个任务中均优于RNN、LSTM、快速权重模型及可微分可塑性基线模型,包括联想检索、迷宫探索、Atari游戏与MuJoCo机器人控制任务。
  • 在倒立摆任务中,STPN相比标准MLP展现出更优的训练稳定性,避免了先前研究中报告的中期训练不稳定性。
  • STPN在更少的超参数敏感性下实现更高性能,包括在Pong任务中可容忍高于LSTM的初始学习率,而LSTM在高学习率下无法训练。
  • 模型表现出早期收敛与高能力水平,表明其有效元学习了最优的记忆动态。
  • 随着训练进行,不重要突触被动态抑制,能耗随之降低,证实模型以减少计算成本的方式学习了遗忘机制。
  • STPN在能效与奖励增益之间的增长最小,尤其在Atari与MuJoCo任务中表现突出,表明效率与性能之间具有强一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。