Skip to main content
QUICK REVIEW

[论文解读] How connectivity structure shapes rich and lazy learning in neural circuits

Yuhan Helena Liu, Aristide Baratin|arXiv (Cornell University)|Oct 12, 2023
Neural Networks and ApplicationsComputer Science被引用 3
一句话总结

本文研究了初始连接结构——特别是权重矩阵的有效秩——如何影响神经回路中的学习动态。通过理论分析和基于生物启发连接的循环网络实验,发现高秩初始化通常导致更懒惰的学习(网络变化最小),而低秩初始化则促进更丰富的学习;然而,当初始化与任务统计对齐时,即使在低秩设置下也可能引发懒惰学习。

ABSTRACT

In theoretical neuroscience, recent work leverages deep learning tools to explore how some network attributes critically influence its learning dynamics. Notably, initial weight distributions with small (resp. large) variance may yield a rich (resp. lazy) regime, where significant (resp. minor) changes to network states and representation are observed over the course of learning. However, in biology, neural circuit connectivity could exhibit a low-rank structure and therefore differs markedly from the random initializations generally used for these studies. As such, here we investigate how the structure of the initial weights -- in particular their effective rank -- influences the network learning regime. Through both empirical and theoretical analyses, we discover that high-rank initializations typically yield smaller network changes indicative of lazier learning, a finding we also confirm with experimentally-driven initial connectivity in recurrent neural networks. Conversely, low-rank initialization biases learning towards richer learning. Importantly, however, as an exception to this rule, we find lazier learning can still occur with a low-rank initialization that aligns with task and data statistics. Our research highlights the pivotal role of initial weight structures in shaping learning regimes, with implications for metabolic costs of plasticity and risks of catastrophic forgetting.

研究动机与目标

  • 理解初始权重矩阵的有效秩如何影响神经网络中的学习范式。
  • 弥合理论深度学习研究(通常假设随机、独立同分布的初始化)与生物神经回路中观察到的低秩连接之间的差距。
  • 探究低秩初始化是否以及在何种条件下仍能产生有效的懒惰学习。
  • 通过在神经科学相关任务上使用实验获得的连接模式训练的循环神经网络,验证理论发现。

提出的方法

  • 对两层前馈线性网络进行理论分析,以推导初始权重秩对学习动态影响的期望值。
  • 使用神经正切核(NTK)运动作为有效学习丰富性/懒惰性的度量,该度量在训练后定义,而非预先设定。
  • 在循环神经网络(RNNs)上进行数值实验,任务包括2AFC、DMS和CXT,初始连接模式基于实验数据(如电子显微镜重建)获得。
  • 通过奇异值分解(SVD)系统性地改变初始权重秩,以生成“硬”低秩和“软”低秩初始化。
  • 对实验获得的连接矩阵进行随机化处理,以检验观察到的效果是否由低秩结构而非稀疏性或拓扑结构驱动。
  • 比较不同初始化方式(高斯分布、均匀分布、软秩、硬秩)和超参数(学习率、增益、网络规模)下的学习动态。

实验结果

研究问题

  • RQ1初始权重矩阵的有效秩在多大程度上影响训练过程中网络适应的程度,以NTK运动为衡量标准?
  • RQ2当初始权重按照生物连接模式进行结构化时,高秩初始化与懒惰学习之间的传统关联是否仍然成立?
  • RQ3如果低秩初始化与任务和数据统计对齐,是否仍能产生有效的懒惰学习?
  • RQ4所观察到的连接秩与学习范式之间的关系在多大程度上对不同网络架构、初始化分布和超参数具有鲁棒性?

主要发现

  • 高秩初始化在训练过程中显著导致更小的NTK运动,表明学习更懒惰,该结果在理论分析和RNN实验中均得到验证。
  • 在多个神经科学任务(2AF、DMS、CXT)中,低秩初始化通常导致更大的NTK运动,表明学习更丰富。
  • 当初始权重与任务统计对齐时(例如,通过数据协方差的特定投影),即使低秩初始化也能产生有效的懒惰学习。
  • 低秩结构对学习范式的影响并非仅源于稀疏性或网络拓扑,因为对EM-derived连接进行随机化会破坏该趋势。
  • 核心趋势——更高秩 → 更大懒惰性——在多种初始化方式(高斯分布、均匀分布)、学习率、增益和网络规模下均保持成立。
  • 在两层线性网络中,理论预测的高秩初始化导致更大正切核对齐的现象得到了实证验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。