[论文解读] Finding online neural update rules by learning to remember
本文提出了一种新颖的方法,通过训练元网络记忆过往经验,而非使用反向传播或进化算法,来在线学习神经元激活和权重的更新规则。该方法使用可学习的神经元类型嵌入向量,并通过短期反向传播在记忆目标上训练更新函数,从而得到在生物学上更合理的学习规则,且这些规则可在不同网络规模和任务间泛化。
We investigate learning of the online local update rules for neural activations (bodies) and weights (synapses) from scratch. We represent the states of each weight and activation by small vectors, and parameterize their updates using (meta-) neural networks. Different neuron types are represented by different embedding vectors which allows the same two functions to be used for all neurons. Instead of training directly for the objective using evolution or long term back-propagation, as is commonly done in similar systems, we motivate and study a different objective: That of remembering past snippets of experience. We explain how this objective relates to standard back-propagation training and other forms of learning. We train for this objective using short term back-propagation and analyze the performance as a function of both the different network types and the difficulty of the problem. We find that this analysis gives interesting insights onto what constitutes a learning rule. We also discuss how such system could form a natural substrate for addressing topics such as episodic memories, meta-learning and auxiliary objectives.
研究动机与目标
- 从零开始发现无需依赖反向传播或进化算法的在线、局部神经激活与权重更新规则。
- 探索基于记忆的目标是否可作为更易处理且更符合生物学特性的训练信号,用于学习更新规则。
- 研究跨神经元类型共享的元参数如何支持学习规则的泛化。
- 分析此类学习到的更新规则是否能随网络规模扩展并支持多样化的学习任务。
- 为未来在神经网络中开展情景记忆、元学习及辅助目标的研究奠定基础。
提出的方法
- 将神经元激活和突触状态表示为小向量,通过(元)神经网络参数化其更新过程。
- 使用可学习的嵌入向量表示不同神经元类型,使同一套更新规则函数在不同神经元类型间共享。
- 通过聚焦于记忆过往经验片段的短期反向传播目标来训练更新规则。
- 将更新过程分解为仅依赖于局部前突触和后突触状态及嵌入向量的局部、突触和神经元级更新函数。
- 对所有神经元应用相同的元网络,通过类型特定的嵌入向量调节更新动态。
- 采用循环网络架构,其中内部状态较大,但由少量元参数控制,类似于超网络。
实验结果
研究问题
- RQ1基于记忆的目标是否能在不直接对长序列进行反向传播的情况下有效训练神经更新规则?
- RQ2单组元参数在不同网络规模和任务间的泛化程度如何?
- RQ3神经元类型嵌入如何影响学习到的更新规则及其泛化能力?
- RQ4学习记忆目标与标准反向传播或其他学习范式之间存在何种关系?
- RQ5该框架能否作为人工神经网络中情景记忆、元学习或辅助目标的潜在基础?
主要发现
- 学习记忆目标成功训练出可在不同网络规模和任务间泛化的更新规则,表明其捕捉到了学习的核心特征。
- 即使在小网络中,系统在序列记忆任务上也表现出色,表明规则在容量有限的情况下依然有效。
- 随着网络规模增大,性能未见提升,表明存在扩展性限制,可能由于输入层自连接的过度依赖。
- 观察到优化挑战,大网络的学习效果反而不如小网络,表明存在训练不稳定性。
- 该方法揭示了有效学习规则的本质,强调了泛化能力和参数效率。
- 该方法为情景记忆和元学习提供了自然的实现基础,表明其在当前实验之外具有更广泛的应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。