Skip to main content
QUICK REVIEW

[论文解读] When, where, and how to add new neurons to ANNs

Kaitlin Maile, Emmanuel Rachelson|arXiv (Cornell University)|Feb 17, 2022
Neural Networks and Applications被引用 4
一句话总结

本文提出NORTH*,一种神经发生框架,通过基于正交性的触发机制与有信息的初始化策略,动态地向人工神经网络添加神经元。通过确定在何时、何地以及以何种方式在训练过程中扩展网络,NORTH*实现了紧凑且高性能的网络结构,能够高效收敛,且无需手动调整网络架构。

ABSTRACT

Neurogenesis in ANNs is an understudied and difficult problem, even compared to other forms of structural learning like pruning. By decomposing it into triggers and initializations, we introduce a framework for studying the various facets of neurogenesis: when, where, and how to add neurons during the learning process. We present the Neural Orthogonality (NORTH*) suite of neurogenesis strategies, combining layer-wise triggers and initializations based on the orthogonality of activations or weights to dynamically grow performant networks that converge to an efficient size. We evaluate our contributions against other recent neurogenesis works across a variety of supervised learning tasks.

研究动机与目标

  • 为解决尚未被充分探索的神经发生问题——即在训练过程中动态添加神经元——通过将问题分解为触发机制与初始化策略。
  • 开发一种框架,以回答在何时、何地以及以何种方式添加神经元的核心问题,从而提升网络效率与性能。
  • 评估激活或权重的正交性是否可作为有效且可扩展的触发机制与初始化策略,用于神经发生。
  • 证明动态神经发生可生成紧凑且高性能的网络,其表现可媲美或超越静态架构,且无需大量超参数调优。

提出的方法

  • 将神经发生分解为两个组成部分:触发机制(决定何时、何地添加神经元)与初始化策略(决定如何设置新神经元的权重)。
  • 提出基于激活正交性的触发机制,通过测量小批量中激活向量的正交性,检测是否需要添加新神经元。
  • 提出基于权重正交性的触发机制,通过评估权重矩阵的正交性,指导按层添加神经元。
  • 采用基于梯度的触发机制,通过评估新神经元参数方向上的梯度大小,检测其学习潜力。
  • 采用保持正交性的初始化策略,确保新神经元的输入与输出权重与现有网络组件保持正交关系。
  • 在每次梯度更新后应用触发机制,实现在训练过程中动态、自适应地添加神经元,无需预设的时间表。

实验结果

研究问题

  • RQ1激活或权重的正交性是否可作为深度神经网络中动态添加神经元的有效且可扩展的触发机制?
  • RQ2初始化策略的选择——特别是基于正交性的初始化与随机或基于梯度的初始化——如何影响动态生长网络的性能与收敛性?
  • RQ3在训练过程中动态扩展网络的神经发生策略,是否能在无需手动架构搜索的情况下,实现比静态架构更优的紧凑性与性能?
  • RQ4不同触发频率与超参数(如候选神经元数量、激活缓冲区大小)如何影响神经发生的效率与有效性?
  • RQ5神经发生能否扩展至持续学习或无监督设置,其中梯度信息可能不可靠?

主要发现

  • NORTH*在多种监督学习任务中均实现了紧凑且高性能的网络结构,在模型效率与准确率方面优于基线静态架构。
  • 使用激活与权重正交性作为触发机制,可实现动态神经元添加,有效避免冗余神经元,尤其在训练初期表现显著。
  • NORTH*在GPU效率方面优于基于梯度的神经发生方法,尽管后者在CPU上可能因计算成本权衡而更具优势。
  • 该框架实现了功能保持的神经元添加,即新神经元不会立即改变网络输出,而是在梯度更新中逐步学习。
  • 基于正交性的初始化策略降低了对损失曲面造成破坏性改变的风险,而不同于Firefly或NeST等方法中的功能初始化方式。
  • 结果表明,神经发生可降低神经架构搜索的环境成本,无需依赖昂贵的超网络或重复的手动调优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。