Skip to main content
QUICK REVIEW

[논문 리뷰] The Computational Complexity of Training ReLU(s)

Pasin Manurangsi, Daniel Reichman|arXiv (Cornell University)|2018. 10. 09.
Adversarial Robustness in Machine Learning참고 문헌 1인용 수 21
한 줄 요약

이 논문은 깊이 2의 ReLU 신경망 학습의 계산 복잡도를 규명하며, 실현 가능할 경우 단일 ReLU 또는 두 개의 ReLU에 대해서도 제곱 오차를 최소화하는 것이 NP-난이도임을 증명한다. 또한, 가중치와 입력이 단위 구에 속하는 네트워크에 대해 $2^{(k/\epsilon)^{O(1)}}n^{O(1)}}$ 시간 내에 작동하는 적절한 학습 알고리즘을 제안하며, 이는 이전의 부적절한 학습 결과를 확장한다.

ABSTRACT

We consider the computational complexity of training depth-2 neural networks composed of rectified linear units (ReLUs). We show that, even for the case of a single ReLU, finding a set of weights that minimizes the squared error (even approximately) for a given training set is NP-hard. We also show that for a simple network consisting of two ReLUs, the error minimization problem is NP-hard, even in the realizable case. We complement these hardness results by showing that, when the weights and samples belong to the unit ball, one can (agnostically) properly and reliably learn depth-2 ReLUs with $k$ units and error at most $ε$ in time $2^{(k/ε)^{O(1)}}n^{O(1)}$; this extends upon a previous work of Goel, Kanade, Klivans and Thaler (2017) which provided efficient improper learning algorithms for ReLUs.

연구 동기 및 목표

  • 제곱 오차를 최소화하는 데 있어 깊이 2의 ReLU 네트워크 학습의 계산 복잡도를 규명하는 것.
  • 영점 학습 오차가 이론적으로 달성 가능한 실현 가능 케이스에서도 ReLU 학습 문제의 난이도가 그대로 유지되는지 조사하는 것.
  • 제한된 노름 조건 하에서 ReLU 네트워크에 대해 적절하고 신뢰할 수 있는 학습 알고리즘을 개발하는 것. 이는 이전의 부적절한 학습 접근 방식을 향상시키는 것을 목표로 한다.
  • 학습의 난이도(NP-난이도)와 특정 노름 조건 하에서의 학습 가능성 사이의 분리 관계를 확립하는 것.
  • ReLU 학습의 NP-난이도와 이전의 임계값 유닛 또는 평균 케이스 난이도 결과 간의 관계를 명확히 하는 것.

제안 방법

  • 기존의 알려진 NP-난이도 문제로의 감소를 통해 ReLU 학습의 NP-난이도를 증명하며, 최소 오차를 거의 다항 인자 범위 내에서 근사하는 것조차도 NP-난이도임을 보여준다.
  • 근사 최소화자를 적절한 ReLU 가설로 변환하면서 오차를 제어하는 데 bias-shifting 기법을 도입하여 출력이 유효한 ReLU 네트워크로 남도록 보장한다.
  • 일반화 경계를 위해 리프시츠 손실 함수(예: $\ell_{\gamma\text{-cont}}$)를 적용하여 경험적 손실과 진짜 손실 간의 관계를 설정함으로써 신뢰할 수 있는 학습 보장을 가능하게 한다.
  • 제곱 손실이 출력 범위 $[0, 2k]$에서 리프시츠이자 유계임을 이용하여 일반화 정리 적용이 가능하게 하여 일반화 오차를 유계로 제한한다.
  • 표본 기반 최적화 전략을 사용하여 유한한 표본에서 경험 오차를 최소화하는 가설을 도출한 후, 적절한 ReLU 구조를 확보하기 위해 바이어스 조정을 수행한다.
  • Goel 등 [GKKT17]의 이전 작업을 바탕으로 약간의 보완을 거쳐 근사 이론 및 커널 방법 도구를 활용하여 시간 복잡도 $2^{(k/\epsilon)^{O(1)}}n^{O(1)}}$를 갖는 학습 알고리즘을 설계한다.

실험 결과

연구 질문

  • RQ1제곱 오차를 최소화하기 위해 단일 ReLU 네트워크를 학습하는 것은 NP-난이도인가?
  • RQ2학습 데이터가 실현 가능할 경우(즉, 영점 오차가 이론적으로 달성 가능한 경우)에도 ReLU 학습 문제의 난이도가 유지되는가?
  • RQ3가중치와 입력이 유한 노름을 갖는 ReLU 네트워크에 대해 오차 $\epsilon$를 달성하는 데 $k/\epsilon$에 대해 지수적 시간만 소요되는 적절한 학습 알고리즘을 설계할 수 있는가?
  • RQ4ReLU 학습의 NP-난이도는 이전의 임계값 유닛 또는 평균 케이스 가정에 기반한 난이도 결과와 어떻게 관련되는가?
  • RQ5일반화 보장을 유지하면서도 부적절한 해를 적절한 ReLU 네트워크로 변환하는 데 bias shifting을 사용할 수 있는가?

주요 결과

  • 제곱 오차를 최소화하기 위해 단일 ReLU를 학습하는 것은 거의 다항 인자 범위 내에서 근사하는 것조차도 NP-난이도이다.
  • 두 개의 ReLU에 대해서도 실현 가능 케이스에서 영점 학습 오차가 이론적으로 달성 가능한 경우에도 오차 최소화 문제는 여전히 NP-난이도이다.
  • 입력과 가중치가 단위 구에 속하는 $k$개의 유닛을 갖는 ReLU 네트워크에 대해 오차가 $\epsilon$ 이내인 적절한 학습 알고리즘이 존재하며, 이는 $2^{(k/\epsilon)^{O(1)}}n^{O(1)}}$ 시간 내에 수행된다.
  • 제안된 알고리즘은 신뢰할 수 있고, ReLU 함수를 적절하게 학습하며, Goel 등 [GKKT17]의 이전 부적절한 학습 결과를 향상시킨다.
  • 핵심 기술적 통찰은 bias shifting이 일반화를 유지하면서도 출력이 유효한 ReLU 네트워크로 남도록 보장한다는 점이다.
  • 일반화 경계는 리프시츠이자 유계인 손실 함수를 사용하여 확립되었으며, 이는 경험 오차 최소화로부터 신뢰할 수 있는 오차 보장을 유도하는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.