Skip to main content
QUICK REVIEW

[논문 리뷰] Piecewise linear activations substantially shape the loss surfaces of neural networks

Fengxiang He, Bohan Wang|arXiv (Cornell University)|2020. 03. 27.
Stochastic Gradient Optimization Techniques인용 수 19
한 줄 요약

이 논문은 조각별 선형 활성화 함수—예를 들어 ReLU—가 깊은 신경망의 손실 표면을 심각하게 형상화함을 보여주며, 심지어 단일 은닉층 네트워크에서도 무수히 많은 유사 국소 최소값을 유도한다. 저자들은 이러한 최소값이 비가속성 경계로 분할된 매끄럽고 다중선형 셀 내의 연결된 골짜이에 집중되어 있음을 증명하며, 한 셀 내의 모든 국소 최소값이 그 셀의 매개변수 부분공간에서 전역적으로 최적임을 보여준다.

ABSTRACT

Understanding the loss surface of a neural network is fundamentally important to the understanding of deep learning. This paper presents how piecewise linear activation functions substantially shape the loss surfaces of neural networks. We first prove that {\it the loss surfaces of many neural networks have infinite spurious local minima} which are defined as the local minima with higher empirical risks than the global minima. Our result demonstrates that the networks with piecewise linear activations possess substantial differences to the well-studied linear neural networks. This result holds for any neural network with arbitrary depth and arbitrary piecewise linear activation functions (excluding linear functions) under most loss functions in practice. Essentially, the underlying assumptions are consistent with most practical circumstances where the output layer is narrower than any hidden layer. In addition, the loss surface of a neural network with piecewise linear activations is partitioned into multiple smooth and multilinear cells by nondifferentiable boundaries. The constructed spurious local minima are concentrated in one cell as a valley: they are connected with each other by a continuous path, on which empirical risk is invariant. Further for one-hidden-layer networks, we prove that all local minima in a cell constitute an equivalence class; they are concentrated in a valley; and they are all global minima in the cell.

연구 동기 및 목표

  • 비선형 활성화 함수, 특히 조각별 선형 함수가 신경망 손실 표면 기하학에 어떻게 영향을 미치는지 이해하기.
  • 조각별 선형 활성화 함수를 갖는 깊은 네트워크에서 유사 국소 최소값의 존재성과 구조를 조사하기.
  • 손실 표면이 비가속성 경계로 분리된 매끄럽고 다중선형 셀로 기하학적으로 분할됨을 드러내기.
  • 각 셀 내의 국소 최소값 간의 등가성과 연결성 분석을 통해 이들이 전역적으로 최적인 골짜이 구조를 이룸을 보여주기.

제안 방법

  • 표준 손실 함수 하에 임의의 깊이와 조각별 선형 활성화 함수(선형 함수 제외)를 갖는 네트워크에서 무한히 많은 유사 국소 최소값의 존재를 증명한다.
  • 가중치 매개변수 $ (W_1, W_2) $ 에서 감소된 표현 $ \hat{W} $ 로의 사상 $ Q $ 를 구축하며, $ Q $ 가 곱 $ \text{diag}(W_2)W_1 $ 를 유지하는 스케일링 변환에 대해 불변임을 보여준다.
  • 활성화 함수의 절점에 의해 유도되는 비가속성 경계를 사용해 매개변수 공간을 개구역으로 분할한다.
  • 각 셀 내에서 경험적 위험 $ \hat{\mathcal{R}} $ 가 $ \hat{W} $ 에 대해 볼록임을 보이며, 이는 한 셀 내의 모든 국소 최소값이 그 셀 내에서 전역적으로 최소임을 의미한다.
  • 한 셀 내의 국소 최소값들이 경험적 위험이 일정한 연속 경로를 따라 연결되어 있음을 보이며, 이는 골짜이 구조를 이룸을 시사한다.
  • 사상 $ Q $ 를 기반으로 등가 관계 $ \sim_R $ 를 정의하며, 한 셀 내의 모든 국소 최소값이 이 관계 하에서 등가이며 몫 공간을 이룸을 보여준다.

실험 결과

연구 질문

  • RQ1일반적인 학습 조건 하에서 조각별 선형 활성화 함수를 갖는 신경망은 무수히 많은 유사 국소 최소값을 갖는가?
  • RQ2매개변수 공간에서 국소 최소값은 연결성과 경험적 위험 측면에서 어떻게 분포되어 있는가?
  • RQ3조각별 선형 활성화 함수를 갖는 신경망의 손실 표면은 비가속성 경계로 분리된 매끄럽고 다중선형 셀로 분할될 수 있는가?
  • RQ4한 셀 내의 모든 국소 최소값은 그 셀의 매개변수 부분공간에서 전역적으로 최적인가?
  • RQ5한 셀 내의 국소 최소값 집합의 기하학적·위상수학적 구조는 무엇이며, 어떻게 상호 연결되어 있는가?

주요 결과

  • 임의의 깊이와 어떤 조각별 선형 활성화 함수(선형 함수 제외)를 갖는 신경망은 표준 손실 함수 하에 무수히 많은 유사 국소 최소값을 갖는다.
  • 이러한 유사 국소 최소값은 매개변수 공간의 한 매끄럽고 다중선형 셀 내에서 유일한 연결 골짜이에 집중되어 있다.
  • 특정 셀 내의 모든 국소 최소값은 그 셀의 매개변수 부분공간에서 전역적으로 최소이며, 해당 영역에서 가능한 가장 낮은 경험적 위험을 달성한다.
  • 한 셀 내의 국소 최소값들은 경험적 위험이 일정한 연속 경로를 따라 연결되어 있으며, 이는 열림된 골짜이 형태의 구조를 시사한다.
  • 한 셀 내의 국소 최소값의 등가류는 사상 $ Q $ 를 통해 정의되며, 이는 곱 $ \text{diag}(W_2)W_1 $ 를 유지하고, 이 등가 관계 하에 몫 공간을 이룬다.
  • 손실 표면은 활성화 함수의 절점에서 유래하는 비가속성 경계로 여러 개의 매끄럽고 다중선형 셀로 분할되며, 각 셀은 해당 부분공간에 대해 유일한 전역 최소값을 포함한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.