[论文解读] Nonparametric Weight Initialization of Neural Networks via Integral Representation
该论文提出了一种基于积分表示的非参数化权重初始化方法,通过推导隐藏参数的数据相关最优分布,实现更快的反向传播收敛速度,并在无需微调的情况下实现高精度,尤其适用于低维问题。
A new initialization method for hidden parameters in a neural network is proposed. Derived from the integral representation of the neural network, a nonparametric probability distribution of hidden parameters is introduced. In this proposal, hidden parameters are initialized by samples drawn from this distribution, and output parameters are fitted by ordinary linear regression. Numerical experiments show that backpropagation with proposed initialization converges faster than uniformly random initialization. Also it is shown that the proposed method achieves enough accuracy by itself without backpropagation in some cases.
研究动机与目标
- 解决因次优随机权重初始化导致的反向传播收敛性差的问题。
- 开发一种数据驱动的初始化策略,利用积分表示理论避免非凸优化的陷阱。
- 通过使用有意义的初始参数,实现最小化或无需反向传播更新的高性能神经网络训练。
- 提供一种理论基础坚实、非参数化的初始化方法,兼容深度学习框架,并可扩展至真实世界数据。
提出的方法
- 利用Murata的神经网络积分表示理论,推导隐藏参数的最优概率分布。
- 直接从非参数化、数据相关的最优分布中采样隐藏权重参数,确保其位于参数空间的信息丰富区域。
- 通过普通最小二乘回归方法拟合输出权重,将输出层学习与非线性优化解耦。
- 采用坐标变换与混合逼近技术,实际处理复杂且高维的最优分布。
- 使用退火采样技术提升高维设置下的样本质量,尤其适用于真实世界数据(如MNIST)。
- 在两阶段流程中应用该方法:(1) 从最优分布中采样隐藏权重;(2) 通过线性方法回归输出权重。
实验结果
研究问题
- RQ1与均匀分布或高斯分布初始化相比,使用非参数化、数据相关的隐藏权重分布是否能提升训练收敛性?
- RQ2所提出的初始化方法在不进行任何反向传播更新的情况下,能达到多高的准确率?
- RQ3该方法在真实世界高维数据(如手写数字分类)上的表现如何?
- RQ4积分表示框架是否可在实际中实现神经网络初始化,具备数值稳定性和可扩展性?
- RQ5与现有预训练和初始化技术相比,该方法在收敛速度和最终准确率方面表现如何?
主要发现
- 所提方法(尤其从最优分布采样,记为SR)在MNIST数据集上经45,000次SGD迭代后,测试误差率为9.94%,优于标准反向传播与随机初始化的性能。
- SBP变体(采样+反向传播)在初始阶段误差下降最快,45,000次迭代后误差率降至8.30%,表明其具有更优的收敛速度。
- 对于低维问题(如曲线拟合与布尔函数逼近),该方法在不进行任何反向传播更新的情况下即达到高准确率(如3.66%测试误差)。
- 当隐藏单元数为6,000时,测试误差为3.66%,优于LeCun等人使用仅300个单元报告的4.7%误差。
- 回归步骤耗时最长,SR方法耗时2.60秒,而采样与SGD步骤显著更快,表明该方法具备良好的可扩展性潜力。
- 退火采样提升了样本质量,并在真实世界数据上支持了有效初始化,表明其对高维输入空间具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。