[论文解读] Lifted Neural Networks
本文提出了一种新型的提升神经网络(lifted neural networks)框架,通过将单调激活函数编码为凸优化问题的解,重新表述前馈神经网络,从而实现可并行化的、简单的子问题的块坐标下降训练。其主要贡献在于:通过该方法学习到的权重可为标准神经网络提供优越的初始化,显著加速收敛速度,并在MNIST数据集上提升测试准确率,其中一种架构达到了95.8%的准确率。
We describe a novel family of models of multi- layer feedforward neural networks in which the activation functions are encoded via penalties in the training problem. Our approach is based on representing a non-decreasing activation function as the argmin of an appropriate convex optimiza- tion problem. The new framework allows for algo- rithms such as block-coordinate descent methods to be applied, in which each step is composed of a simple (no hidden layer) supervised learning problem that is parallelizable across data points and/or layers. Experiments indicate that the pro- posed models provide excellent initial guesses for weights for standard neural networks. In addi- tion, the model provides avenues for interesting extensions, such as robustness against noisy in- puts and optimizing over parameters in activation functions.
研究动机与目标
- 为解决标准神经网络训练中使用随机梯度下降时收敛缓慢及对初始化敏感的问题。
- 开发一种非梯度优化框架,利用凸松弛方法建模激活函数。
- 构建一种可训练的初始化方案,其性能优于随机初始化和结构化权重初始化方法。
- 支持新扩展,如对输入噪声的鲁棒性、激活参数的优化,以及拓扑约束。
提出的方法
- 将每个非递减激活函数表示为凸或双凸优化问题的最小化解,将其嵌入训练目标函数中。
- 将非光滑神经网络训练问题转化为在扩展变量空间中的光滑、带约束的优化问题。
- 使用块坐标下降法交替优化网络权重与与激活相关的变量,每个子问题均为无隐藏层的监督学习任务。
- 应用惩罚项(如l2正则)以强制激活值与其预激活值之间的等式约束。
- 通过适当的凸公式化方法,将该框架扩展至处理ReLU、Leaky ReLU及其他单调激活函数。
- 将训练好的提升网络权重用作标准前馈网络的初始化,避免使用随机或启发式初始化。
实验结果
研究问题
- RQ1能否将激活函数重新表述为凸优化问题的解,以实现深度网络的非梯度训练?
- RQ2所提出的提升框架是否能为标准神经网络提供优于标准初始化技术的初始权重?
- RQ3该提升模型能否在标准训练范式中加速收敛并提升泛化性能?
- RQ4该框架如何支持如对输入不确定性鲁棒性或激活参数优化等扩展?
- RQ5该提升网络的权重是否可在多种架构和数据集上作为近似最优初始化?
主要发现
- 在400-200-100-50架构下,提升神经网络模型在MNIST数据集上实现了95.8%的测试准确率,优于采用各种初始化方案的标准网络。
- 当用作初始化时,该模型使标准网络收敛更快并达到更高的测试准确率,其中一种架构在训练初期几个周期内即达到其最终准确率的90%。
- 在所有测试的架构和学习率下,该模型始终优于使用Xavier、正态分布和方差缩放方法初始化的网络。
- 该方法对初始化方差具有鲁棒性,在更深的架构上,测试准确率相比标准初始化最高提升达10个百分点。
- 该框架实现了高效、可并行化的训练步骤,并为优化激活函数参数(如Leaky ReLU的斜率)提供了系统性路径。
- 该方法可推广至其他架构,包括卷积网络和循环网络,并支持如鲁棒优化和酉约束等扩展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。