Skip to main content
QUICK REVIEW

[论文解读] Linear discriminant initialization for feed-forward neural networks

Marissa Masden, Dev Sinha|arXiv (Cornell University)|Jul 24, 2020
Neural Networks and Applications参考文献 14被引用 5
一句话总结

本文提出线性判别初始化(LDI),一种基于几何结构的方法,通过使用能最佳分离数据类别的线性判别式来初始化前馈神经网络的第一层。通过用LDI替代随机初始化,网络训练速度更快,准确率更高,尤其是在大批次训练时,这是由于其更好地契合数据几何结构,并初始化在更优的损失盆地中。

ABSTRACT

Informed by the basic geometry underlying feed forward neural networks, we initialize the weights of the first layer of a neural network using the linear discriminants which best distinguish individual classes. Networks initialized in this way take fewer training steps to reach the same level of training, and asymptotically have higher accuracy on training data.

研究动机与目标

  • 通过用基于几何结构的方法替代随机权重初始化,提升神经网络训练效率和准确率。
  • 探究基于数据几何结构的初始化是否能带来更快的收敛速度和更好的泛化性能。
  • 探讨第一层权重在捕捉判别性特征中的作用,如训练后网络的几何分析所提示的那样。
  • 为昂贵的权重剪枝方法(如彩票理论中的方法)提供一种计算上可行的替代方案。
  • 将几何与拓扑网络分析的见解拓展至深度学习的实际权重初始化技术中。

提出的方法

  • 对输入数据空间中成对类别的数据应用线性判别分析(LDA),以计算能最佳分离这些类别的超平面。
  • 将LDA得到的单位向量用作前馈网络第一层神经元的初始权重。
  • 在每次成功分离后,对剩余未分类的数据点迭代应用LDA,并丢弃已被正确分类的点。
  • 这一递归过程被称为“排序游戏”(Sorting Game),生成一系列逐步按类别排序数据点的超平面。
  • 以至少与生成的超平面数量相当的神经元数初始化第一层,并对深层网络使用标准初始化方法(如Xavier或He)。
  • 在反向传播训练过程中允许所有已初始化的权重自由演化,从而在保持灵活性的同时从几何信息丰富的初始状态开始。

实验结果

研究问题

  • RQ1与随机初始化相比,基于数据几何结构的初始化是否能提升训练速度和最终准确率?
  • RQ2使用线性判别式进行初始化是否能带来更好的收敛性能,尤其是在大批次训练设置下?
  • RQ3在训练后的网络中,第一层权重在多大程度上反映了数据分布的几何结构?
  • RQ4是否可以设计一种确定性、非随机的初始化方法,在无需网络剪枝的前提下超越标准随机初始化?
  • RQ5所提出的方法是否具备可扩展性,并可适用于小型网络和简单架构之外的场景?

主要发现

  • LDI初始化的网络收敛速度更快,且在相同架构下训练准确率高于随机初始化网络。
  • 在大批次训练设置下,性能提升更为显著,表明LDI有助于定位更优的损失盆地。
  • 在MNIST数据集上,非优化的“排序游戏”算法耗时约170秒,而小型网络的一个训练周期仅需约17秒。
  • 完整规模网络训练至完成所需时间约为LDI初始化时间的十倍,表明该方法在计算上相对于训练过程极为高效。
  • 使用Sigmoid激活函数时性能提升更显著,表明该方法可能对激活函数类型存在敏感性。
  • 将LDA应用于第一层特征图以初始化深层网络权重未取得积极效果,表明LDI在第一层效果最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。