Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Two Layer Rectified Neural Networks in Polynomial Time

Ainesh Bakshi, Rajesh Jayaram|arXiv (Cornell University)|2018. 11. 05.
Machine Learning and Algorithms참고 문헌 53인용 수 12
한 줄 요약

이 논문은 가우시안 입력 가정 하에 두 층의 ReLU 신경망에서 가중치 행렬의 정확한 복원을 위한 최초의 다항시간 알고리즘을 제시한다. 노이즈가 없는 경우 정확한 복원을 달성하고, 평균이 0인 서브가우시안 노이즈가 존재하는 경우 근사 복원을 달성하며, 낮은 질서 행렬 복원과 ReLU 활성화 함수의 조합적 성질을 활용한다.

ABSTRACT

Consider the following fundamental learning problem: given input examples $x \in \mathbb{R}^d$ and their vector-valued labels, as defined by an underlying generative neural network, recover the weight matrices of this network. We consider two-layer networks, mapping $\mathbb{R}^d$ to $\mathbb{R}^m$, with $k$ non-linear activation units $f(\cdot)$, where $f(x) = \max \{x , 0\}$ is the ReLU. Such a network is specified by two weight matrices, $\mathbf{U}^* \in \mathbb{R}^{m imes k}, \mathbf{V}^* \in \mathbb{R}^{k imes d}$, such that the label of an example $x \in \mathbb{R}^{d}$ is given by $\mathbf{U}^* f(\mathbf{V}^* x)$, where $f(\cdot)$ is applied coordinate-wise. Given $n$ samples as a matrix $\mathbf{X} \in \mathbb{R}^{d imes n}$ and the (possibly noisy) labels $\mathbf{U}^* f(\mathbf{V}^* \mathbf{X}) + \mathbf{E}$ of the network on these samples, where $\mathbf{E}$ is a noise matrix, our goal is to recover the weight matrices $\mathbf{U}^*$ and $\mathbf{V}^*$. In this work, we develop algorithms and hardness results under varying assumptions on the input and noise. Although the problem is NP-hard even for $k=2$, by assuming Gaussian marginals over the input $\mathbf{X}$ we are able to develop polynomial time algorithms for the approximate recovery of $\mathbf{U}^*$ and $\mathbf{V}^*$. Perhaps surprisingly, in the noiseless case our algorithms recover $\mathbf{U}^*,\mathbf{V}^*$ exactly, i.e., with no error. To the best of the our knowledge, this is the first algorithm to accomplish exact recovery. For the noisy case, we give the first polynomial time algorithm that approximately recovers the weights in the presence of mean-zero noise $\mathbf{E}$. Our algorithms generalize to a larger class of rectified activation functions, $f(x) = 0$ when $x\leq 0$, and $f(x) > 0$ otherwise.

연구 동기 및 목표

  • 입력-라벨 쌍에서 두 층의 ReLU 신경망의 가중치 행렬을 학습하는 기본 문제를 다루기.
  • 라벨이 노이즈에 의해 손상된 경우 정확한 및 근사적인 가중치 행렬 복원을 위한 다항시간 알고리즘 개발하기.
  • ReLU를 초월하는 더 넓은 범주에 속하는 정류형 활성화 함수에 대한 복원 보장을 확장하기.
  • 가중치 행렬 U*가 최대 열 질서를 갖지 않는 경우 고정 매개변수 다항시간 알고리즘 제공하기.
  • 정확한 복원이 다항시간 내에 가능해지는 이론적 조건 설정하기.

제안 방법

  • 노이즈 있는 관측치 A로부터 은닉층 표현 U*f(V*X)를 복원하기 위해 핵노름 최소화를 통한 낮은 질서 행렬 복원 기법을 활용한다.
  • 골프링 기법과 쌍대 증명문자 구성 기법을 사용하여 낮은 질서 복원을 위한 볼록 최적화의 유일성과 정확성을 증명한다.
  • ReLU 활성화 함수의 조합적 및 기하학적 성질을 적용하여 노이즈가 없는 경우 정확한 복원을 가능하게 한다.
  • U*와 V*에 대해 비일관성 및 조건수 제약 조건을 부과하여 다항 시간 샘플 복잡도 하에서 안정적인 복원을 보장한다.
  • E가 s-희소이며 s ≤ γnm인 희소성 기반 노이즈 모델을 도입하여 일반적인 노이즈 하에서도 복원 가능성을 확보한다.
  • 핵노름과 l1-노름 정규화를 갖는 볼록 최적화 문제로 문제를 환원하여 다항시간 내에 해를 구할 수 있다.

실험 결과

연구 질문

  • RQ1가우시안 입력 가정 하에 두 층의 ReLU 네트워크 가중치 행렬을 다항시간 내에 복원할 수 있는가?
  • RQ2라벨이 노이즈가 없고 입력이 i.i.d. 가우시안일 경우 U*와 V*의 정확한 복원이 가능한가?
  • RQ3라벨이 평균이 0인 서브가우시안 노이즈에 의해 손상된 경우 다항시간 근사 복원을 달성할 수 있는가?
  • RQ4다항시간 복원을 보장하기 위해 U*와 V*에 필요한 구조적 가정은 무엇인가?
  • RQ5이 복원 프레임워크는 ReLU를 초월하는 더 일반적인 정류형 활성화 함수로 확장될 수 있는가?

주요 결과

  • 논문은 가우시안 입력 조건 하에서 노이즈가 없는 경우 U*와 V*의 정확한 복원을 달성하는 최초의 다항시간 알고리즘을 제시한다.
  • 평균이 0인 서브가우시안 노이즈가 존재하는 경우, 알고리즘은 노이즈 수준에 비례하는 오차 범위 내에서 다항시간 내에 근사 복원을 달성한다.
  • U*의 열이 정규직교이고 μ-비일관성이며, k ≤ m / (O((κ(V*))²√(k log n)μ + μ + (κ(V*))⁴ log n) log² n)일 경우 정확한 복원이 가능하다.
  • 샘플 복잡도 n은 d, m, k 및 V*의 조건수에 대해 다항식적으로 증가하므로 실용적 환경에서의 적용 가능성을 보장한다.
  • 핵노름과 l1-노름 최소화를 통한 볼록 최적화를 통해 인수분해된 형태 U*f(V*X)를 정확히 복원한다.
  • U*가 최대 열 질서를 갖지 않는 경우를 대비해 k를 매개변수로 하는 고정 매개변수 다항시간 알고리즘을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.