Skip to main content
QUICK REVIEW

[论文解读] The Influence of Learning Rule on Representation Dynamics in Wide Neural Networks

Blake Bordelon, Cengiz Pehlevan|arXiv (Cornell University)|Oct 5, 2022
Neural Networks and Applications被引用 7
一句话总结

本文分析了不同学习规则——梯度下降(GD)、反馈对齐(FA)、直接反馈对齐(DFA)、赫布学习(Hebb)以及门控线性网络(GLN)——如何塑造无限宽度深度神经网络中的表征动态。通过动力学平均场理论(DMFT)框架,研究发现每种规则均会诱导一个时变的有效神经正切核(eNTK),揭示出FA与DFA可在丰富(rich)模式下实现与深度相关的、动态演化的特征学习,而赫布与GLN则表现出有限或无任务相关的特征自适应能力。

ABSTRACT

It is unclear how changing the learning rule of a deep neural network alters its learning dynamics and representations. To gain insight into the relationship between learned features, function approximation, and the learning rule, we analyze infinite-width deep networks trained with gradient descent (GD) and biologically-plausible alternatives including feedback alignment (FA), direct feedback alignment (DFA), and error modulated Hebbian learning (Hebb), as well as gated linear networks (GLN). We show that, for each of these learning rules, the evolution of the output function at infinite width is governed by a time varying effective neural tangent kernel (eNTK). In the lazy training limit, this eNTK is static and does not evolve, while in the rich mean-field regime this kernel's evolution can be determined self-consistently with dynamical mean field theory (DMFT). This DMFT enables comparisons of the feature and prediction dynamics induced by each of these learning rules. In the lazy limit, we find that DFA and Hebb can only learn using the last layer features, while full FA can utilize earlier layers with a scale determined by the initial correlation between feedforward and feedback weight matrices. In the rich regime, DFA and FA utilize a temporally evolving and depth-dependent NTK. Counterintuitively, we find that FA networks trained in the rich regime exhibit more feature learning if initialized with smaller correlation between the forward and backward pass weights. GLNs admit a very simple formula for their lazy limit kernel and preserve conditional Gaussianity of their preactivations under gating functions. Error modulated Hebb rules show very small task-relevant alignment of their kernels and perform most task relevant learning in the last layer.

研究动机与目标

  • 理解替代性学习规则(无论是否具有生物学合理性)如何影响深度神经网络中的表征动态与功能归纳偏置。
  • 分析学习规则对无限宽网络中特征与预测动态的影响,尤其关注懒惰(lazy)与丰富(特征学习)模式。
  • 建立一个动力学平均场理论(DMFT)框架,以表征各种学习规则下时变有效神经正切核(eNTK)的特性。
  • 比较FA、DFA、Hebb与GLN网络在表征学习能力上的差异,尤其关注其对深度依赖的特征自适应能力以及梯度-伪梯度对齐特性。
  • 研究初始反馈权重相关性在FA与DFA中的作用,及其对丰富模式下表征演化的影响。

提出的方法

  • 基于时变有效神经正切核(eNTK)推导出无限宽网络中学习规则动态的一般性框架。
  • 应用动力学平均场理论(DMFT)计算每种学习规则的eNTK,从而实现对核演化过程的解析与数值研究。
  • 提出一种广义的FA规则,允许前馈与反馈权重之间存在部分相关性,从而以受控方式调节eNTK。
  • 在无限宽极限下利用鞍点法与微扰理论,计算核波动与协方差结构(例如,Φℓ与Gℓ方差随1/N缩放)。
  • 基于DMFT形式化推导出深度线性网络中eNTK的闭式解,并为非线性网络建立数值求解程序。
  • 通过在核波动与不同层宽下方差缩放方面的实证实验,验证DMFT的预测结果。

实验结果

研究问题

  • RQ1学习规则的选择(如GD、FA、DFA、Hebb、GLN)如何影响宽网络中有效神经正切核(eNTK)的演化?
  • RQ2在反馈对齐(FA)与直接反馈对齐(DFA)中,前向与反向权重之间的初始相关性在丰富模式下的表征学习中起到何种作用?
  • RQ3不同学习规则在跨多层学习特征方面的能力如何比较,尤其是在非懒惰(非懒惰)训练模式下?
  • RQ4与梯度下降相比,赫布学习与门控线性网络(GLN)在多大程度上表现出与任务相关的特征自适应?
  • RQ5在丰富模式下,动态eNTK如何与梯度-伪梯度对齐及网络的功能归纳偏置相关联?

主要发现

  • 在懒惰模式下,DFA与Hebb仅能利用最后一层的特征进行学习,而完整的FA若初始前向与反馈权重相关性非零,则可利用更早的层。
  • 在丰富模式下,FA与DFA均表现出随时间演化、与深度相关的eNTK,其特征自适应能力超越了懒惰极限。
  • 出人意料的是,在丰富模式下,当FA网络初始时前向与反馈权重相关性较小时,其特征学习更为显著。
  • GLN网络保持了预激活量的条件高斯性,并可导出其懒惰极限下eNTK的简洁闭式表达,其动态特性与GD相当。
  • 赫布学习表现出最小的任务相关核对齐,且几乎所有学习均发生在最后一层,表明其在深度间特征自适应能力有限。
  • DMFT框架预测核方差按1/N缩放,其中Φℓ方差随网络深度增加,而Gℓ方差随深度减小,实验结果验证了该预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。