Skip to main content
QUICK REVIEW

[논문 리뷰] Complexity of Training ReLU Neural Network

Digvijay Boob, Santanu S. Dey|arXiv (Cornell University)|2018. 09. 27.
Neural Networks and Applications참고 문헌 19인용 수 18
한 줄 요약

이 논문은 두 은닉층을 가진 피드포워드 ReLU 신경망을 훈련시키는 것이 NP-난이도임을 입증하여 딥 러닝 복잡도 이론에서 오랫동안 남아있던 열린 문제를 해결한다. 그러나 입력 차원과 네트워크 구조가 고정되어 있을 경우 다항시간 알고리즘이 존재하며, 또한 첫 번째 은닉층에서 충분한 오버파라미터화가 이루어지면 전역 최적화를 다항시간 내에 달성할 수 있다.

ABSTRACT

In this paper, we explore some basic questions on the complexity of training neural networks with ReLU activation function. We show that it is NP-hard to train a two-hidden layer feedforward ReLU neural network. If dimension of the input data and the network topology is fixed, then we show that there exists a polynomial time algorithm for the same training problem. We also show that if sufficient over-parameterization is provided in the first hidden layer of ReLU neural network, then there is a polynomial time algorithm which finds weights such that output of the over-parameterized ReLU neural network matches with the output of the given data.

연구 동기 및 목표

  • 딥 루프 ReLU 신경망 훈련의 계산 복잡도에 관한 열린 문제를 해결하기 위해.
  • 기울기 기반 방법의 경험적 성공에도 불구하고 이론적 불확실성에도 불구하고 두 은닉층을 가진 ReLU 네트워크 훈련이 NP-난이도인지 여부를 규명하기 위해.
  • 입력 차원과 네트워크 구조가 고정되어 있을 경우 훈련이 어떻게 다항시간 내에 가능해지는지 조사하기 위해.
  • 오버파라미터화가 ReLU 네트워크 훈련의 가용성에 미치는 영향을 분석하기 위해.
  • 새로운 감소 기법과 기하학적 추론을 사용해 임계값 활성화 네트워크에서 ReLU 활성화 네트워크로의 난이도 결과를 확장하기 위해.

제안 방법

  • 두 초평면 분리 문제에서의 감소를 통해 두 은닉층 ReLU 네트워크 훈련의 NP-난이도를 증명하기 위해.
  • 특정 가중치 및 편향 설정에 의존하여 임계값 행동을 시뮬레이션하는 ReLU 유닛을 사용한 하드-정렬 기반 장치의 구축.
  • 아핀 함수와 ReLU 활성화를 사용하여 조각별 선형 함수를 모델링하고, 선형 형식의 다양한 부호 및 크기 영역에서의 기능적 행동 분석.
  • 첫 번째 층의 가중치가 같은 부호를 가지며 모두 음수일 경우, 특정 조건 하에서 ReLU 네트워크가 임계값 유사 행동을 시뮬레이션할 수 있음을 증명하기 위해.
  • 영 출력 노드를 추가하여 다중출력 ReLU 네트워크로의 난이도 결과를 확장하고, 감소 구조를 유지하기 위해.
  • 기하학적 및 볼록 Hull 추론(예: $T_1 \subset \text{conv}(T_0)$)을 적용하여 특정 구성에서의 분리 불가능성을 입증하기 위해.

실험 결과

연구 질문

  • RQ1두 은닉층을 가진 ReLU 신경망 훈련은 NP-난이도인가?
  • RQ2일반적으로 NP-난이도임에도 불구하고 어떤 조건에서 훈련 문제가 다항시간 내에 해결 가능한가?
  • RQ3첫 번째 은닉층에서의 충분한 오버파라미터화가 ReLU 네트워크의 다항시간 훈련 가능성을 보장할 수 있는가?
  • RQ4ReLU 네트워크가 얼마나 잘 임계값 함수를 시뮬레이션할 수 있으며, 이는 임계값 활성화 네트워크와 유사한 복잡도를 의미하는가?
  • RQ5가중치 행렬의 구조(예: 대각선 대비 비대각선)가 훈련의 복잡도에 영향을 미치는가?

주요 결과

  • 입력 차원과 네트워크 구조가 고정되어 있어도, 두 은닉층 ReLU 신경망 훈련은 NP-난이도이다.
  • 입력 차원과 네트워크 구조가 고정되어 있을 경우, ReLU 네트워크 훈련을 위한 다항시간 알고리즘이 존재한다.
  • 첫 번째 은닉층에서 충분한 오버파라미터화가 이루어지면, 훈련 데이터에 정확히 피팅하는 데 다항시간 알고리즘을 구성할 수 있다.
  • 하드-정렬 기반 장치를 통해 ReLU 네트워크는 임계값 유사 행동을 시뮬레이션할 수 있지만, 이는 특정 가중치 설정이 필요하며, 가중치가 반대 부호를 가질 경우 이를 달성할 수 없다.
  • 다중출력 ReLU 네트워크에 대해서도 NP-난이도 결과가 성립함을 증명하기 위해, 모든 노드 중 하나를 제외한 나머지에 대해 영 출력을 추가하여 감소를 확장함.
  • 일치하거나 반대 방향의 법선을 가진 ReLU 유닛으로 특정 점 집합을 하드-정렬할 수 없는 것은 일반 ReLU 아키텍처에서 임계값 함수를 시뮬레이션하는 데 핵심적인 기하학적 장벽임을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.