[论文解读] Complexity of Training ReLU Neural Network
本文证明了训练两隐藏层前馈ReLU神经网络是NP难的,解决了深度学习复杂性领域长期悬而未决的开放问题。然而,当输入维度和网络拓扑固定时,存在多项式时间算法;此外,若第一隐藏层充分过参数化,则可实现全局最优的多项式时间训练。
In this paper, we explore some basic questions on the complexity of training neural networks with ReLU activation function. We show that it is NP-hard to train a two-hidden layer feedforward ReLU neural network. If dimension of the input data and the network topology is fixed, then we show that there exists a polynomial time algorithm for the same training problem. We also show that if sufficient over-parameterization is provided in the first hidden layer of ReLU neural network, then there is a polynomial time algorithm which finds weights such that output of the over-parameterized ReLU neural network matches with the output of the given data.
研究动机与目标
- 为解决训练深度ReLU神经网络计算复杂性的开放问题。
- 确定在梯度方法经验成功但理论不确定性存在的情况下,训练两隐藏层ReLU网络是否为NP难。
- 研究在何种条件下训练问题变得可 tractable,特别是当输入维度和网络结构固定时。
- 分析过参数化对ReLU网络训练可 tractability 的影响。
- 通过新颖的归约和几何论证,将阈值激活网络的难解性结果扩展至ReLU激活网络。
提出的方法
- 通过从2-超平面可分性问题归约,证明训练两隐藏层ReLU网络的NP难性。
- 利用ReLU单元构建一个硬排序装置,以模拟阈值行为,依赖于特定的权重和偏置配置。
- 使用仿射函数与ReLU激活来建模分段线性函数,并分析不同符号和大小范围内线性形式的功能行为。
- 证明当第一层权重同号且为负时,在特定约束下ReLU网络可模拟类似阈值的行为。
- 通过增加零输出节点,将难解性结果扩展至多输出ReLU网络,同时保持归约结构。
- 应用几何与凸包论证(例如,$T_1 \subset \text{conv}(T_0)$),证明在某些配置下分离的不可能性。
实验结果
研究问题
- RQ1训练两隐藏层ReLU神经网络是否为NP难?
- RQ2在一般情况下为NP难的前提下,训练问题在何种条件下变得可 tractable?
- RQ3第一隐藏层的充分过参数化是否能实现ReLU网络的多项式时间训练?
- RQ4ReLU网络在多大程度上能模拟阈值函数,这是否意味着其复杂性与阈值激活网络相似?
- RQ5权重矩阵的结构(例如对角与非对角)是否影响训练的复杂性?
主要发现
- 即使输入维度和网络拓扑固定,训练两隐藏层ReLU神经网络仍是NP难的。
- 当输入维度和网络拓扑固定时,存在用于训练ReLU网络的多项式时间算法。
- 若第一隐藏层实现充分过参数化,则可构造出多项式时间算法,实现对训练数据的精确拟合。
- ReLU网络可通过硬排序装置模拟类似阈值的行为,但需特定权重配置,且当权重符号相反时无法实现。
- 即使对于多输出ReLU网络,NP难性结果依然成立,通过将归约扩展至$j$维输出并为除一个节点外的所有节点设置零输出得以证明。
- 利用具有对齐或相反法向的ReLU单元无法对某些点集实现硬排序,证明了在一般ReLU架构中模拟阈值函数的核心几何障碍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。