[论文解读] Continual Learning with Deep Artificial Neurons
该论文提出了深度人工神经元(DANs),其中每个人工神经元均由一个共享的、元学习得到的参数向量(称为‘神经元表型’)连接的深层神经网络取代。通过将DANs嵌入标准网络,并使用反向传播优化元目标——持续学习中最小化遗忘——该模型在无需经验回放或独立训练阶段的情况下,实现了跨顺序任务的稳定学习,表明先天的神经元结构可使人工网络具备终身学习能力。
Neurons in real brains are enormously complex computational units. Among other things, they're responsible for transforming inbound electro-chemical vectors into outbound action potentials, updating the strengths of intermediate synapses, regulating their own internal states, and modulating the behavior of other nearby neurons. One could argue that these cells are the only things exhibiting any semblance of real intelligence. It is odd, therefore, that the machine learning community has, for so long, relied upon the assumption that this complexity can be reduced to a simple sum and fire operation. We ask, might there be some benefit to substantially increasing the computational power of individual neurons in artificial systems? To answer this question, we introduce Deep Artificial Neurons (DANs), which are themselves realized as deep neural networks. Conceptually, we embed DANs inside each node of a traditional neural network, and we connect these neurons at multiple synaptic sites, thereby vectorizing the connections between pairs of cells. We demonstrate that it is possible to meta-learn a single parameter vector, which we dub a neuronal phenotype, shared by all DANs in the network, which facilitates a meta-objective during deployment. Here, we isolate continual learning as our meta-objective, and we show that a suitable neuronal phenotype can endow a single network with an innate ability to update its synapses with minimal forgetting, using standard backpropagation, without experience replay, nor separate wake/sleep phases. We demonstrate this ability on sequential non-linear regression tasks.
研究动机与目标
- 探究提高单个人工神经元计算复杂度是否可使深层网络具备先天的终身学习能力。
- 通过嵌入结构化、深层的神经元函数,而非仅依赖突触权重优化,解决持续学习中的灾难性遗忘问题。
- 探究在所有DANs中共享单一参数向量(神经元表型)是否可在部署期间促进元目标——具体而言,即持续学习。
- 评估向量化突触连接与参数共享对持续学习效率与稳定性的影响力。
- 证明当神经元本身为高度计算能力强的单元时,反向传播可有效用于记忆保持性更新。
提出的方法
- 将标准前馈网络中的每个人工神经元替换为深度人工神经元(DAN),即一个在所有神经元间共享参数的小型深层神经网络。
- DAN通过向量化突触连接相连,其中每个突触前神经元向每个突触后神经元发送一个高维向量,从而增加输入维度。
- 一个单一的、共享的参数向量——称为‘神经元表型’——在所有DAN上元学习,以优化元目标:在顺序任务学习中最小化记忆损失。
- 元训练通过在一系列非线性回归任务上使用反向传播进行,目标是最小化所有任务上的累积记忆损失。
- 在部署阶段,元学习到的表型被固定,网络执行标准反向传播进行任务特定学习,无需经验回放或独立阶段。
- 通过在多种网络架构上比较具有元学习表型与随机表型、有无参数共享的模型,对方法进行评估。
实验结果
研究问题
- RQ1在标准网络中嵌入具有共享神经元表型的深度参数化神经元(DANs)是否可实现遗忘最小化的持续学习?
- RQ2将DAN之间的突触连接向量化是否能提高持续学习元优化的效率?
- RQ3单一元学习的神经元表型是否能在顺序任务学习中最小化记忆损失方面优于随机或非共享参数配置?
- RQ4是否可能在无需经验回放或独立唤醒/睡眠阶段的情况下,通过标准反向传播实现稳定的持续学习?
- RQ5当单个神经元的计算复杂度通过元学习表型结构化时,是否可使人工网络具备先天学习能力?
主要发现
- 在学习五个子任务后,具有元学习到的共享神经元表型的模型在所有任务上的平均记忆损失约为0.03均方误差,表现出有效的持续学习。
- 无论表型是否固定或更新,元学习到的表型在部署期间显著优于具有随机或非共享表型的模型,总记忆损失最小化。
- 该模型在200至300个元周期内收敛到合适的神经元表型,表明在给定任务集上元优化效率较高。
- 通过增加每个DAN的输入维度(即通道数)来向量化突触连接,加速了元训练期间记忆损失的最小化,显示出优化效率的提升。
- 具有单一共享表型(net0)的模型表现几乎与具有层特定(net1)或完全唯一(net2)表型的模型相当,表明参数共享不会损害性能,反而可能简化学习过程。
- 结果证实,通过元学习表型嵌入先天的、结构化的神经元功能,可在无需经验回放或专门训练阶段的情况下,实现遗忘最小化的持续学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。