Skip to main content
QUICK REVIEW

[论文解读] Gradient-Free Learning Based on the Kernel and the Range Space

Kar-Ann Toh, Zhiping Lin|arXiv (Cornell University)|Oct 27, 2018
Neural Networks and Applications参考文献 35被引用 8
一句话总结

该论文通过利用线性矩阵方程的核空间与值域空间操作,提出了一种无需梯度的全连接前馈神经网络学习框架,实现了分析性、非迭代的权重估计。该方法在预测精度上与基于梯度的学习方法相当,但训练速度提升了200倍以上,展示了无需显式正则化或反向传播的可行性与泛化能力。

ABSTRACT

In this article, we show that solving the system of linear equations by manipulating the kernel and the range space is equivalent to solving the problem of least squares error approximation. This establishes the ground for a gradient-free learning search when the system can be expressed in the form of a linear matrix equation. When the nonlinear activation function is invertible, the learning problem of a fully-connected multilayer feedforward neural network can be easily adapted for this novel learning framework. By a series of kernel and range space manipulations, it turns out that such a network learning boils down to solving a set of cross-coupling equations. By having the weights randomly initialized, the equations can be decoupled and the network solution shows relatively good learning capability for real world data sets of small to moderate dimensions. Based on the structural information of the matrix equation, the network representation is found to be dependent on the number of data samples and the output dimension.

研究动机与目标

  • 建立核空间与值域空间估计方法与线性系统中最小二乘误差最小化之间的理论等价性。
  • 通过将训练问题重新表述为交叉耦合方程组,为多层前馈网络开发一种无梯度学习框架。
  • 实现在无需反向传播或迭代优化情况下的分析性、单次遍历权重估计。
  • 研究在无梯度下降条件下,网络深度与初始化对学习性能的影响。
  • 在真实世界基准数据集上验证该方法的可行性与泛化能力,且不依赖显式正则化。

提出的方法

  • 将全连接前馈网络表述为线性矩阵方程,以应用线性代数工具。
  • 利用核空间与值域空间操作,推导出最小二乘误差最小化问题的等价形式。
  • 将网络训练问题转化为跨层的交叉耦合方程组求解问题。
  • 通过随机初始化隐藏层权重实现系统解耦,从而获得权重矩阵的解析解。
  • 利用引理1与引理2中的最小范数性质,确保无需显式正则化即可实现泛化。
  • 应用logit激活函数以确保可逆性,并对解的适定性提供有利的映射。

实验结果

研究问题

  • RQ1核空间与值域空间分析能否为线性系统中的最小二乘误差最小化提供等价替代方案?
  • RQ2多层前馈网络的训练能否在不依赖梯度下降的前提下,被重新表述为一组交叉耦合方程?
  • RQ3隐藏层权重的随机初始化是否能够实现系统解耦并获得权重的解析解?
  • RQ4在所提出的无梯度框架中,网络深度对预测精度有何影响?
  • RQ5在依赖最小范数解的前提下,该方法是否能在无显式正则化的情况下实现良好泛化?

主要发现

  • 通过核空间与值域空间操作推导出的解在数学上等价于最小二乘误差解,验证了理论基础的正确性。
  • 所提出方法的训练速度比基于梯度的学习方法快超过200倍,且隐藏节点数量相同。
  • 在不同网络深度(2层、3层与4层网络)下,预测精度保持相对稳定,大多数基准数据集上差异不显著。
  • 该方法在无显式正则化的情况下仍能实现良好泛化,其解的最小范数性质为此提供了支持。
  • 网络的表示能力取决于数据样本数量与输出维度,非线性激活函数有助于提升问题的适定性。
  • 该方法的闭式、非迭代特性使得无需计算梯度或进行反向传播,即可直接估计权重。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。