Skip to main content
QUICK REVIEW

[论文解读] Expressiveness of Rectifier Networks

Xingyuan Pan, Vivek Srikumar|arXiv (Cornell University)|Nov 18, 2015
Evolutionary Algorithms and Applications参考文献 12被引用 20
一句话总结

本文通过证明两层修正线性单元神经网络(ReLU)可表示与指数级更大的阈值网络等价的决策边界,分析了ReLU网络的表征能力,但此类等价性在最坏情况下需要指数级规模。本文建立了将阈值网络压缩为ReLU网络的对数压缩的充分条件,并通过实验表明,仅具备表征能力并不保证可学习性,因为存在非凸优化的挑战。

ABSTRACT

Rectified Linear Units (ReLUs) have been shown to ameliorate the vanishing gradient problem, allow for efficient backpropagation, and empirically promote sparsity in the learned parameters. They have led to state-of-the-art results in a variety of applications. However, unlike threshold and sigmoid networks, ReLU networks are less explored from the perspective of their expressiveness. This paper studies the expressiveness of ReLU networks. We characterize the decision boundary of two-layer ReLU networks by constructing functionally equivalent threshold networks. We show that while the decision boundary of a two-layer ReLU network can be captured by a threshold network, the latter may require an exponentially larger number of hidden units. We also formulate sufficient conditions for a corresponding logarithmic reduction in the number of hidden units to represent a sign network as a ReLU network. Finally, we experimentally compare threshold networks and their much smaller ReLU counterparts with respect to their ability to learn from synthetically generated data.

研究动机与目标

  • 正式分析ReLU网络与阈值网络的表征能力,后者虽研究充分但在此语境下理解不足。
  • 确定ReLU网络是否能以更紧凑的方式表示阈值网络的决策边界,特别是隐藏单元数量方面。
  • 识别阈值网络可被压缩为更小ReLU网络的充分条件,从而实现高效表示。
  • 通过实证评估,探究ReLU网络中表征能力、样本复杂度与优化难度之间的相互作用。

提出的方法

  • 通过构造性证明建立两层ReLU网络与阈值网络之间的函数等价性,证明阈值网络为表示相同决策边界可能需要指数级更多的单元。
  • 基于决策边界的结构性质,推导出阈值网络可被压缩为ReLU网络且隐藏单元数对数减少的充分条件。
  • 引入一种放松的等价条件,适用于隐藏层状态(而不仅输出预测)的考虑,从而实现多分类任务中的等价性。
  • 使用合成生成的数据,对ReLU网络与压缩后的tanh(模拟阈值)激活函数的网络进行实证比较。
  • 采用早停法、L2正则化和交叉验证进行超参数调优,评估不同输入维度和隐藏单元数下的测试集性能。
  • 在不同架构下评估泛化误差:ReLU网络(n个单元)、压缩tanh网络(n个单元)以及压缩tanh网络(2^n个单元)以模拟阈值网络。

实验结果

研究问题

  • RQ1两层ReLU网络的决策边界能否由阈值网络表示?若能,阈值网络的规模如何?
  • RQ2是否存在充分条件,使得阈值网络可被压缩为隐藏单元数对数减少的ReLU网络?
  • RQ3即使函数可被表示,ReLU网络的表征能力是否能保证其相比阈值网络具有更好的可学习性?
  • RQ4非凸训练目标如何影响恢复真实概念的能力,特别是在使用压缩tanh模拟阈值行为时?

主要发现

  • 两层ReLU网络可表示与阈值网络等价的决策边界,但后者的隐藏单元数在最坏情况下可能呈指数级增长。
  • 存在两层ReLU网络无法被更小的阈值网络表示,表明ReLU网络具有内在的表征优势。
  • 识别出阈值网络可被压缩为隐藏单元数对数减少的ReLU网络的充分条件,从而实现更高效的表示。
  • 即使真实概念可被表示,使用压缩tanh(模拟阈值)训练时仍无法用相同数量的单元恢复函数,表明表征能力不等于可学习性。
  • 使用指数级更多的压缩tanh单元(2^n)在部分数据集上提升了性能,但并非全部,表明优化景观与非凸性阻碍了学习,尽管具备表征能力。
  • 所有设置下的训练误差与测试误差均接近,表明过拟合并非性能不佳的主要原因,而是高维空间中非凸目标优化的困难所致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。