Skip to main content
QUICK REVIEW

[论文解读] Provable Methods for Training Neural Networks with Sparse Connectivity

Hanie Sedghi, Anima Anandkumar|arXiv (Cornell University)|Dec 8, 2014
Sparse and Compressive Sensing Techniques参考文献 21被引用 11
一句话总结

本文提出了一种可证明保证的方法,用于使用矩方法训练具有稀疏连接的深度前馈神经网络。通过利用Stein引理由分析标签与输入得分函数之间的交叉矩,证明了该矩矩阵的奇异值分解可恢复第一层权重矩阵的行空间,且在温和的非退化条件下,$µ_1$-正则化优化可实现稀疏第一层权重的精确恢复。

ABSTRACT

We provide novel guaranteed approaches for training feedforward neural networks with sparse connectivity. We leverage on the techniques developed previously for learning linear networks and show that they can also be effectively adopted to learn non-linear networks. We operate on the moments involving label and the score function of the input, and show that their factorization provably yields the weight matrix of the first layer of a deep network under mild conditions. In practice, the output of our method can be employed as effective initializers for gradient descent.

研究动机与目标

  • 开发理论上可保证的训练稀疏连接深度神经网络的方法。
  • 将此前仅限于无监督模型的矩方法学习扩展至有监督、非线性深度网络设置。
  • 建立使用$µ_1$-优化精确恢复第一层权重矩阵的条件。
  • 证明标签与输入得分函数之间的交叉矩包含足够信息,可用于低秩逼近与深度网络初始化。
  • 为预训练和基于得分的初始化在深度学习中的经验成功提供理论依据。

提出的方法

  • 该方法使用交叉矩矩阵$ M = \mathbb{E}[y (\nabla_x \log p(x))^\top] $,其中$ y $为标签,$ \nabla_x \log p(x) $为输入分布的得分函数。
  • 应用Stein引理由证明$ M = -\mathbb{E}[\nabla_x y] $,从而将矩矩阵与网络输出对输入的导数联系起来。
  • 通过$ M $的奇异值分解(SVD)获得第一层权重矩阵$ A_1 $的低秩逼近,实现在反向传播中的降维。
  • 对于稀疏权重,在非退化假设下对矩矩阵应用$ \ell_1 $-正则化优化,可精确恢复$ A_1 $。
  • 通过分别使用softmax和sigmoid激活函数,将该方法扩展至多类与多标签设置。
  • 在对网络深度、权重矩阵和激活函数的假设下,利用链式法则及Spielman等人(2012)关于稀疏恢复的结果,推导出理论保证。

实验结果

研究问题

  • RQ1能否将矩方法从无监督设置扩展至有监督、非线性深度学习,并提供可证明的保证?
  • RQ2标签与输入得分函数之间的交叉矩是否包含足够信息以恢复第一层权重矩阵?
  • RQ3在何种条件下,$ \ell_1 $-优化可精确恢复深度神经网络中的稀疏第一层权重?
  • RQ4Stein引理由如何在非线性模型中建立得分函数与网络梯度之间的联系?
  • RQ5该框架能否应用于中间层?需要何种结构约束?

主要发现

  • 标签与输入得分函数之间交叉矩矩阵$ M $的奇异值分解可恢复第一层权重矩阵$ A_1 $的行空间,从而实现有效的低秩初始化。
  • 在非退化与稀疏性假设下,对矩矩阵应用$ \ell_1 $-正则化优化可精确恢复$ A_1 $的行归一化版本,且失败概率呈指数级小。
  • 该方法在稀疏度水平高达$ \sqrt{k} $时仍能实现恢复,其中$ k $为隐藏单元数,优于以往工作仅限于$ k^\gamma $($ \gamma \leq 0.2 $)的性能。
  • 理论分析表明,学习得分函数的预训练方法可通过使得分与标签信息对齐,改善反向传播,从而解释其经验优势。
  • 该框架适用于多类(使用softmax)与多标签(使用sigmoid)分类任务。
  • 该方法为在有监督设置下,对一般非线性深度网络中部分参数的学习提供了首个可证明的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。