Skip to main content
QUICK REVIEW

[論文レビュー] Training Neural Networks is NP-Hard in Fixed Dimension

Vincent Froese, Christoph Hertrich|arXiv (Cornell University)|Mar 29, 2023
Stochastic Gradient Optimization Techniques被引用数 4
ひとこと要約

この論文は、固定次元 d=2 においても、2層の ReLU および線形しきい値ニューラルネットワークの学習が NP 困難であることを証明し、長年の未解決問題を解決した。4つの ReLU を用いたゼロ訓練誤差の場合に W[1]-困難性を確立し、次元と幅をパrameter として見たときの凸写像に対する固定パrameter可 tractability を示した。

ABSTRACT

We study the parameterized complexity of training two-layer neural networks with respect to the dimension of the input data and the number of hidden neurons, considering ReLU and linear threshold activation functions. Albeit the computational complexity of these problems has been studied numerous times in recent years, several questions are still open. We answer questions by Arora et al. [ICLR '18] and Khalife and Basu [IPCO '22] showing that both problems are NP-hard for two dimensions, which excludes any polynomial-time algorithm for constant dimension. We also answer a question by Froese et al. [JAIR '22] proving W[1]-hardness for four ReLUs (or two linear threshold neurons) with zero training error. Finally, in the ReLU case, we show fixed-parameter tractability for the combined parameter number of dimensions and number of ReLUs if the network is assumed to compute a convex map. Our results settle the complexity status regarding these parameters almost completely.

研究の動機と目的

  • 2層 ReLU および線形しきい値ニューラルネットワークの学習のパラメータ化された複雑性に関する未解決問題を解明すること。
  • 入力次元 d やニューロン数 k をパラメータとした場合に、学習が固定パラメータ可 tractable (FPT) であるかどうかを特定すること。
  • 特に低次元設定において、ニューラルネットワーク学習の計算複雑性の地図に空白を埋めること。
  • 正確な学習(ゼロ誤差)における tractable と intractable なケースの境界を明確にすること。
  • さまざまなパラメータ化の下で2層ネットワークの包括的な複雑性分類を提供すること。

提案手法

  • d=2 における ReLU 活性化関数を用いた NP 困難性の証明のため、部分和問題という NP 完全問題への帰着を実施した。
  • 線形計画法を用いて ReLU 出力の和の下界を計算し、探索空間内での強制点の検出を可能にした。
  • 強制点に基づいて動的に制約を強制する再帰的探索木アルゴリズムを採用し、再帰の深さを制限した。
  • 重みとバイアスの制約によって定義される実行可能多面体の次元を分析することで、再帰深さを O(kd) で抑えられた。
  • 指数時間仮説 (ETH) を適用し、k=4 の ReLU とゼロ誤差の場合に、部分指数時間アルゴリズムが存在しないことを示した。
  • 類似の帰着と制約解析を用いて、線形しきい値ニューロンへの結果の拡張を実施した。

実験結果

リサーチクエスチョン

  • RQ1入力次元 d をパラメータとした場合に、2L-ReLU-NN-Train(L) は XP に属するか。すなわち、(nk)^f(d) poly(L) 時間で解けるか?
  • RQ2任意の定数 d に対して、k をパラメータとした場合に、2L-ReLU-NN-Train(L) は固定パラメータ可 tractable (FPT) か。すなわち、n^f(d) g(k,d) poly(L) 時間で解けるか?
  • RQ3ゼロ訓練誤差で k=4 の ReLU を用いた場合に、d をパラメータとしたとき、問題は W[1]-困難か?
  • RQ4探索木アプローチは、正負の係数が混在するネットワーク(aj ∈ {−1,1})に拡張可能か?
  • RQ5d=2 かつ k∈{2,3} の場合に、ReLU ネットワークを k をパラメータとした FPT に含むか?

主な発見

  • 入力次元 d を固定した状態(d=2)でも、2層 ReLU ネットワークの学習は NP 困難であることが示され、Arora 他 [ICLR '18] の質問1を解決した。
  • k=4 の ReLU とゼロ訓練誤差の場合に、d をパラメータとしたとき、問題は W[1]-困難であることが示され、Froese 他 [JAIR '22] の未解決問題に答えを提示した。
  • ReLU ネットワークが凸写像を計算する場合、d と k をパラメータとした固定パラメータ可 tractability が成立し、実行時間は 2^{O(k^2 d)} poly(k, L) である。
  • 同じ硬度結果は線形しきい値ネットワークにも拡張され、類似したパラメータ化の下で NP 困難性と W[1]-困難性が示された。
  • 強制点検出を組み込んだ再帰的探索アルゴリズムにより、再帰深さが最大で k(d+1)+1 に制限され、結果として 2^{O(k^2 d)} 時間のアルゴリズムが得られた。
  • 混合符号係数(aj ∈ {−1,1})の場合は、強制点の検出が不可能なため、探索木手法は失敗し、一般ケースにおけるこのアプローチの本質的限界が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。