Skip to main content
QUICK REVIEW

[论文解读] Deepest Neural Networks

Raúl Rojas|arXiv (Cornell University)|Jul 9, 2017
Neural Networks and Applications参考文献 2被引用 4
一句话总结

本文证明,通过使用宽度为一的深层窄型多层感知机(MLP),可利用串联的感知机编码嵌套凸多面体,实现对数据的通用分类。通过顺序线性切割与反相器,网络逐步检测越来越复杂的区域成员资格,证明深度可替代宽度实现通用逼近,尽管效率较低。

ABSTRACT

This paper shows that a long chain of perceptrons (that is, a multilayer perceptron, or MLP, with many hidden layers of width one) can be a universal classifier. The classification procedure is not necessarily computationally efficient, but the technique throws some light on the kind of computations possible with narrow and deep MLPs.

研究动机与目标

  • 证明宽度为一的深层窄型MLP(隐藏层宽度为一)可作为通用分类器。
  • 探索窄型深层网络的计算能力,与宽型浅层网络进行对比。
  • 证明仅通过二元输出的感知机链与凸区域的模块化嵌套,即可实现通用分类。
  • 通过证明仅深度本身即可实现通用逼近(即使宽度极小),为深层网络提供理论基础。

提出的方法

  • 该方法使用感知机链,每个感知机在输入空间中测试一个线性切割,权重经缩放以保持内积有界。
  • 使用一个大正权重S,当任意感知机触发时,向前传播“激活”信号,确保下游感知机无论输入如何都会触发。
  • 在链末端设置一个反相器,仅当链中所有感知机输出为0时输出1,从而正确识别内层最内凸区域的成员资格。
  • 通过迭代构建嵌套凸包(R1, R2, ...),每个区域将前一个区域的补集内的一类包含在内。
  • 采用模块化方法,将内层区域的链重用于更深链中的子模块,构建对更复杂区域(如R1−R2+R3−R4+R5)的分类器。
  • 该架构通过将原始输入传递至所有层,实现跨深度的一致性评估,形成一种“快捷路径”。

实验结果

研究问题

  • RQ1宽度为一的深层神经网络(每个隐藏层宽度为一)是否能对任意两个不相交的数据类别实现通用分类?
  • RQ2如何仅通过感知机的顺序链编码嵌套凸多面体?
  • RQ3通过大权重传播“激活”信号在保持层间逻辑一致性方面起到什么作用?
  • RQ4是否可能仅通过深度与最小宽度实现通用分类,而无需宽型隐藏层?
  • RQ5感知机链的模块化重用如何实现对复杂非凸数据区域的分类?

主要发现

  • 若数据类别区域可表示为嵌套凸多面体,则宽度为一的深层MLP可对任意两个不相交数据类别实现通用分类。
  • 网络结构采用感知机链,任一层触发时,通过大权重S向前传播信号,确保下游层无论输入如何都会触发。
  • 链末端的反相器仅在链中所有感知机输出为0时输出1,正确识别内层最内凸区域的成员资格。
  • 通过递归组合子模块构建复杂区域的分类器,实现对如R1−R2+R3−R4+R5等区域的识别。
  • 即使嵌套过程缓慢或区域任意接近,只要序列能终止,该证明依然成立。
  • 该架构表明深度可替代宽度实现通用逼近,为经典宽型浅层网络的通用逼近定理提供了“对偶”版本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。