[论文解读] A New Backpropagation Algorithm without Gradient Descent
本文提出了一种新颖的反向传播算法,用 Moore-Penrose 广义逆替代梯度下降来计算人工神经网络中的权重和偏置更新。通过利用广义逆在最小二乘意义下直接求解最优参数,该方法避免了迭代梯度计算,并能有效处理不可微或类似 ReLU 的激活函数,在威斯康星州乳腺癌数据集上实现了高达 90.4% 的准确率,且不依赖基于梯度的优化。
The backpropagation algorithm, which had been originally introduced in the 1970s, is the workhorse of learning in neural networks. This backpropagation algorithm makes use of the famous machine learning algorithm known as Gradient Descent, which is a first-order iterative optimization algorithm for finding the minimum of a function. To find a local minimum of a function using gradient descent, one takes steps proportional to the negative of the gradient (or of the approximate gradient) of the function at the current point. In this paper, we develop an alternative to the backpropagation without the use of the Gradient Descent Algorithm, but instead we are going to devise a new algorithm to find the error in the weights and biases of an artificial neuron using Moore-Penrose Pseudo Inverse. The numerical studies and the experiments performed on various datasets are used to verify the working of this alternative algorithm.
研究动机与目标
- 开发一种反向传播方法,以消除在神经网络权重和偏置更新中对梯度下降的依赖。
- 通过避免梯度计算,实现对不可微或分段线性激活函数的神经网络训练。
- 通过用基于矩阵的直接解法替代迭代梯度下降,提升训练效率。
- 在基准数据集和真实世界数据集上验证所提方法的可行性和性能。
- 探索该方法与类似 ReLU 的激活函数(如 Softplus 和 LeakyReLU)的兼容性。
提出的方法
- 该方法通过计算输入数据矩阵的 Moore-Penrose 广义逆,以最小二乘意义求解最优参数,从而计算权重和偏置的更新。
- 每个神经元被修改为对每个输入具有独立的权重和偏置,从而形成适合广义逆计算的线性系统形式。
- 该算法假设激活函数在其输出范围内可逆,允许将反函数应用于期望输出,以构建广义逆解的目标向量。
- 通过奇异值分解(SVD)计算广义逆,即使在秩亏或过定系统中,也能确保解的稳定性和唯一性。
- 该方法按层应用,将每个神经元的输入-输出关系视为需通过广义逆求解的线性系统。
- 该方法通过直接求解可使误差最小化的参数更新,避免了反向传播梯度,从而绕过迭代优化。
实验结果
研究问题
- RQ1能否设计一种不依赖梯度下降进行权重和偏置更新的反向传播算法?
- RQ2Moore-Penrose 广义逆是否可作为训练人工神经网络的梯度下降可行替代方案?
- RQ3基于广义逆的方法在不可微或类似 ReLU 的激活函数上的表现如何?
- RQ4该方法能否在不依赖基于梯度优化的情况下,实现在真实世界数据集上的竞争性准确率?
- RQ5该方法在激活函数兼容性和收敛速度方面存在哪些局限性?
主要发现
- 所提出的基于广义逆的反向传播方法在威斯康星州乳腺癌数据集上经过 1000 个周期训练后,达到 90.4% 的验证准确率,表明其在真实世界数据上的强大性能。
- 在 Two-Spirals 问题上,该方法实现了约 63% 的准确率,考虑到使用了对任务不理想的 Softplus 激活函数,该结果是合理的。
- 在 Concentric-Circles 问题上,该方法达到 61% 的准确率,同样受限于 Softplus 激活函数的选择,该函数对圆形数据模式并非最优。
- 在 XOR 问题上,该方法实现了 81% 的验证准确率,表明其即使使用非典型激活函数,也能学习非线性决策边界。
- 训练和验证误差在数百个周期后趋于稳定,表明已实现收敛,尽管早期训练阶段的误差曲线较为波动。
- 该方法在激活函数的反函数在整个实数范围内有定义的情况下最为有效,如 Softplus;而对于 Tanh 等因定义域受限的函数,效果较差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。