Skip to main content
QUICK REVIEW

[論文レビュー] Training Fully Connected Neural Networks is $\exists\mathbb{R}$-Complete

Daniel Bertschinger, Christoph Hertrich|arXiv (Cornell University)|Apr 4, 2022
Neural Networks and Applications被引用数 7
ひとこと要約

この論文は、完全結合型2層ReLUニューラルネットワークをゼロのトレーニング誤差に収束させる訓練が、2つの入力、2つの出力、13ラベル、固定された隠れニューロン数の割合という極めて制限された条件下ですら ∃ℝ-完全であることを証明している。この結果は、最適な訓練が実数の代数的方程式を解く必要があることを示しており、標準的なNPソルバー(例:SATやMIPソルバー)では十分でないことが示唆される。NP = ∃ℝ でない限り、そのようなツールでは効率的に解けない。

ABSTRACT

We consider the problem of finding weights and biases for a two-layer fully connected neural network to fit a given set of data points as well as possible, also known as EmpiricalRiskMinimization. Our main result is that the associated decision problem is $\exists\mathbb{R}$-complete, that is, polynomial-time equivalent to determining whether a multivariate polynomial with integer coefficients has any real roots. Furthermore, we prove that algebraic numbers of arbitrarily large degree are required as weights to be able to train some instances to optimality, even if all data points are rational. Our result already applies to fully connected instances with two inputs, two outputs, and one hidden layer of ReLU neurons. Thereby, we strengthen a result by Abrahamsen, Kleist and Miltzow [NeurIPS 2021]. A consequence of this is that a combinatorial search algorithm like the one by Arora, Basu, Mianjy and Mukherjee [ICLR 2018] is impossible for networks with more than one output dimension, unless $\mathsf{NP}=\exists\mathbb{R}$.

研究の動機と目的

  • 完全結合型2層ReLUニューラルネットワークのトレーニングをグローバル最適化する計算複雑性を確立すること。
  • 2つの入力、2つの出力、13ラベル、ゼロのターゲット誤差、および固定された隠れニューロン数の割合という厳しい制約下でも、この問題が ∃ℝ-完全のままであることを示すこと。
  • すべてのデータポイントが有理数であっても、最適な重みには任意の代数的数が必要になることを示すこと。
  • NPソルバー(例:SATやMIPソルバー)のような汎用的なNPソルバーでは、NP = ∃ℝ でない限り、この問題を効率的に解くことはできないことを証明すること。
  • 以前の結果を強化し、複雑さが悪意あるアーキテクチャに起因するのではなく、基本的なネットワーク構造そのものに内在していることを示すこと。

提案手法

  • 逆数を含む実数の存在理論(ETR-INV)への還元:既知の ∃ℝ-完全問題。
  • 特殊なニューラルネットワーク部品の設計:レベー、インバージョン、キャンセルの各コンポーネント。それぞれが代数的制約を符号化する。
  • データポイントが有理数座標上にあり、連続的で区分線形関数によって正確にフィットする「Train-F2NN」インスタンスの構築。
  • ReLU活性化関数を用いて区分線形挙動を強制し、重みとバイアスの設定で勾配を制御する。
  • 体演算(加法、乗法、除法)を介して、ニューラルネットワーク問題の解がETR-INVインスタンスの解と一対一対応することの証明。
  • 代数的普遍性の確立:Train-F2NNの解空間は、体演算を用いてETR-INVインスタンスのすべての実数代数的解を捉える。

実験結果

リサーチクエスチョン

  • RQ1完全結合型2層ReLUニューラルネットワークをゼロのトレーニング誤差に収束させる訓練は、最小限のアーキテクチャ的制約のもとでも計算的に難しいか?
  • RQ2ニューラルネットワーク訓練の難易度は、アーキテクチャそのものに起因するのか、それとも病理的構成に起因するのか?
  • RQ3すべての入力データが有理数であっても、最適な訓練には代数的数が必要か?
  • RQ4∃ℝがNPよりも真に大きいと仮定した場合、標準的なNPソルバー(例:SATやMIPソルバー)は、この問題を効率的に解けるか?
  • RQ5最適なニューラルネットワーク重みの解空間は、実数代数的系の解空間と正確に一致するか?

主な発見

  • 完全結合型2層ReLUニューラルネットワークをゼロ誤差にトレーニングする問題は、2つの入力および2つの出力ニューロンしかない場合でも ∃ℝ-完全である。
  • 13個の異なるラベル、ゼロのターゲット誤差、およびデータポイント数に対する固定された隠れニューロン数の割合という同時制約下でも、問題は ∃ℝ-完全のままである。
  • 最適な重みとバイアスは、すべてのトレーニングデータポイントが有理数であっても、任意の代数的数を必要とすることがある。
  • ニューラルネットワークトレーニング問題の解空間は代数的普遍性を有する:体演算を用いてETR-INVインスタンスのすべての実数解を捉える。
  • NPソルバー(例:SATやMIPソルバー)のような汎用的なNPソルバーでは、NP = ∃ℝ でない限り、この問題を効率的に解くことはできない。
  • 複雑さは問題そのものに内在しており、悪意あるアーキテクチャに起因するものではなく、最も基本的な完全結合型ネットワークですら、この複雑性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。