Skip to main content
QUICK REVIEW

[논문 리뷰] Training Fully Connected Neural Networks is $\exists\mathbb{R}$-Complete

Daniel Bertschinger, Christoph Hertrich|arXiv (Cornell University)|2022. 04. 04.
Neural Networks and Applications인용 수 7
한 줄 요약

이 논문은 두 층의 완전 연결 ReLU 신경망을 0의 훈련 오차로 훈련시키는 것이, 심지어 두 입력, 두 출력, 13개의 레이블, 고정된 은닉 뉴런 비율과 같은 매우 제약된 조건 하에서도 ∃ℝ-완전하다는 것을 증명한다. 이 결과는 최적의 훈련이 실수의 근을 가진 대수 방정식을 풀어야 한다는 것을 시사하며, 이는 표준 NP 해법 도구들(예: SAT 또는 MIP 솔버)이 NP = ∃ℝ일 경우를 제외하고는 충분하지 않음을 의미한다.

ABSTRACT

We consider the problem of finding weights and biases for a two-layer fully connected neural network to fit a given set of data points as well as possible, also known as EmpiricalRiskMinimization. Our main result is that the associated decision problem is $\exists\mathbb{R}$-complete, that is, polynomial-time equivalent to determining whether a multivariate polynomial with integer coefficients has any real roots. Furthermore, we prove that algebraic numbers of arbitrarily large degree are required as weights to be able to train some instances to optimality, even if all data points are rational. Our result already applies to fully connected instances with two inputs, two outputs, and one hidden layer of ReLU neurons. Thereby, we strengthen a result by Abrahamsen, Kleist and Miltzow [NeurIPS 2021]. A consequence of this is that a combinatorial search algorithm like the one by Arora, Basu, Mianjy and Mukherjee [ICLR 2018] is impossible for networks with more than one output dimension, unless $\mathsf{NP}=\exists\mathbb{R}$.

연구 동기 및 목표

  • 완전 연결 두 층 ReLU 신경망의 훈련을 전역 최적화에 도달하는 데 필요한 계산 복잡도를 규명하는 것.
  • 두 입력, 두 출력, 13개의 레이블, 0의 목표 오차, 은닉 뉴런 비율이 일정한 철저한 제약 조건 하에서도 이 문제가 여전히 ∃ℝ-완전하다는 것을 보여주는 것.
  • 모든 데이터 포인트가 유리수일지라도 최적의 가중치를 구하기 위해 임의의 대수적 수가 필요하다는 것을 보여주는 것.
  • NP-해결 도구(예: SAT 또는 MIP 솔버)가 일반적으로 이 문제를 효율적으로 해결할 수 없다는 것을 증명하는 것, 단지 NP = ∃ℝ일 경우를 제외하고.
  • 기존 결과를 강화하여, 복잡성의 근본 원인이 공격적인 아키텍처가 아니라 기본적인 네트워크 아키텍처 자체에 있음을 보여주는 것.

제안 방법

  • 기존의 ∃ℝ-완전 문제인 실수에 대한 존재 이론과 역행 연산을 포함한 ETR-INV로의 감소.
  • 특수 설계된 신경망 기반 구성 요소: 레이브, 역행, 취소 구성 요소의 설계로 각각 대수적 제약 조건을 인코딩.
  • 모든 데이터 포인트가 유리수 좌표에 위치하고 연속적인 조각별 선형 함수로 정확히 피팅되는 Train-F2NN 인스턴스의 구성.
  • ReLU 활성화 함수를 사용하여 조각별 선형 행동을 강제하고, 가중치 및 편향 설정을 통해 기울기를 제어.
  • 체의 산술(덧셈, 곱셈, 나눗셈)을 통해 신경망 문제의 해가 ETR-INV 인스턴스의 해와 일대일 대응됨을 증명.
  • 대수적 보편성 확립: Train-F2NN의 해 공간은 ETR-INV 인스턴스의 모든 실수 대수 해를 체의 연산을 통해 포괄한다.

실험 결과

연구 질문

  • RQ1완전 연결 두 층 ReLU 신경망을 0의 훈련 오차로 훈련시키는 것이, 최소한의 아키텍처 제약 조건 하에서도 계산적으로 어렵기는 한가?
  • RQ2신경망 훈련의 복잡성은 아키텍처 자체의 특성 때문인지, 아니면 병리적인 구성 때문인가?
  • RQ3모든 입력 데이터가 유리수일지라도 최적의 훈련을 위해 대수적 수가 필요한가?
  • RQ4∃ℝ가 NP보다 엄격히 크다고 가정할 때, 표준 NP 해법 도구(SAT 또는 MIP 솔버 등)가 이 문제를 효율적으로 해결할 수 있는가?
  • RQ5최적의 신경망 가중치 해 공간은 실수 대수 시스템의 해 공간과 정확히 일치하는가?

주요 결과

  • 완전 연결 두 층 ReLU 신경망을 0 오차로 훈련시키는 것은, 심지어 입력과 출력 뉴런이 각각 두 개인 경우에도 ∃ℝ-완전하다.
  • 13개의 서로 다른 레이블, 0의 목표 오차, 데이터 포인트 수에 대해 은닉 뉴런 수가 일정 비율로 증가하는 조건 하에서도 문제의 복잡성은 ∃ℝ-완전성을 유지한다.
  • 최적의 가중치와 편향는 모든 훈련 데이터 포인트가 유리수일지라도 임의의 대수적 수를 필요로 할 수 있다.
  • 신경망 훈련 문제의 해 공간은 대수적 보편성을 가지며, 체의 연산을 통해 ETR-INV 인스턴스의 모든 실수 해를 포괄한다.
  • NP-해결 도구(예: SAT 또는 MIP 솔버 등)는 NP = ∃ℝ일 경우를 제외하고는 이 문제를 효율적으로 해결할 수 없다.
  • 복잡성은 문제 자체에 내재되어 있으며, 공격적인 아키텍처 때문이 아니라, 가장 기본적인 완전 연결 네트워크조차도 이 복잡성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.