Skip to main content
QUICK REVIEW

[论文解读] Training Fully Connected Neural Networks is $\exists\mathbb{R}$-Complete

Daniel Bertschinger, Christoph Hertrich|arXiv (Cornell University)|Apr 4, 2022
Neural Networks and Applications被引用 7
一句话总结

本文证明了,即使在高度受限的设定下(例如仅两个输入、两个输出、13个标签,且隐藏神经元数量为固定比例),训练全连接的两层ReLU神经网络以实现零训练误差也是∃ℝ-完全问题。该结果表明,最优训练需要求解具有实数根的代数方程,这意味着除非NP = ∃ℝ,否则标准的NP求解工具(如SAT或MIP求解器)无法充分应对。

ABSTRACT

We consider the problem of finding weights and biases for a two-layer fully connected neural network to fit a given set of data points as well as possible, also known as EmpiricalRiskMinimization. Our main result is that the associated decision problem is $\exists\mathbb{R}$-complete, that is, polynomial-time equivalent to determining whether a multivariate polynomial with integer coefficients has any real roots. Furthermore, we prove that algebraic numbers of arbitrarily large degree are required as weights to be able to train some instances to optimality, even if all data points are rational. Our result already applies to fully connected instances with two inputs, two outputs, and one hidden layer of ReLU neurons. Thereby, we strengthen a result by Abrahamsen, Kleist and Miltzow [NeurIPS 2021]. A consequence of this is that a combinatorial search algorithm like the one by Arora, Basu, Mianjy and Mukherjee [ICLR 2018] is impossible for networks with more than one output dimension, unless $\mathsf{NP}=\exists\mathbb{R}$.

研究动机与目标

  • 确立训练全连接两层ReLU神经网络至全局最优的计算复杂度。
  • 证明即使在严格约束条件下(两个输入、两个输出、13个标签、零目标误差,且隐藏神经元数量为固定比例),该问题仍为∃ℝ-完全问题。
  • 证明即使所有数据点均为有理数,最优权重仍需使用任意代数数。
  • 证明除非NP = ∃ℝ,否则通用NP求解工具(如SAT或MIP求解器)无法高效求解此问题。
  • 通过证明硬度源于基本网络结构本身,而非人为构造的病态结构,从而强化先前结果。

提出的方法

  • 从存在性实数理论带逆运算(ETR-INV)问题归约,该问题是已知的∃ℝ-完全问题。
  • 设计专用神经网络组件:堤坝、逆运算和抵消组件,每种均编码代数约束。
  • 构建一个Train-F2NN实例,其中数据点位于有理坐标上,并能被连续分段线性函数精确拟合。
  • 利用ReLU激活函数实现分段线性行为,并通过权重和偏置配置控制斜率。
  • 证明神经网络问题的解与ETR-INV实例的解之间存在双射关系,通过域算术(加法、乘法、除法)实现。
  • 建立代数普遍性:Train-F2NN的解空间通过域运算捕获ETR-INV实例的所有实代数解。

实验结果

研究问题

  • RQ1即使在最小的架构约束下,训练全连接两层ReLU神经网络至零训练误差是否在计算上是困难的?
  • RQ2神经网络训练的困难性是否源于网络架构本身,还是仅源于病态构造?
  • RQ3即使所有输入数据均为有理数,最优训练是否仍需要代数数?
  • RQ4假设∃ℝ严格大于NP,标准NP求解工具(如SAT或MIP求解器)能否高效求解此问题?
  • RQ5最优神经网络权重的解空间是否与一个实代数系统解空间完全对应?

主要发现

  • 即使仅使用两个输入神经元和两个输出神经元,训练全连接两层ReLU神经网络至零误差也是∃ℝ-完全问题。
  • 在13个不同标签、零目标误差以及隐藏神经元数量为数据点数量的固定比例等多重约束下,该问题仍为∃ℝ-完全问题。
  • 即使所有训练数据点均为有理数,最优权重和偏置仍可能需要任意代数数。
  • 神经网络训练问题的解空间具有代数普遍性:通过域运算,其可捕获ETR-INV实例的所有实数解。
  • 除非NP = ∃ℝ,否则任何通用NP求解工具(如SAT或MIP求解器)都无法高效求解此问题。
  • 该问题的困难性是固有的,不依赖于病态网络结构——即使是结构最简单的全连接网络也表现出此类复杂性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。