[논문 리뷰] A Critical View of Global Optimality in Deep Learning
이 논문은 깊이 있는 선형 및 비선형 네트워크의 손실 표면을 분석함으로써 딥 러닝에서의 전역 최적성에 대한 비판적 분석을 제공한다. 깊이 있는 선형 네트워크의 경우, 임계점이 선형 매개변수화로부터 구조적 성질을 물려받아 전역 최소값과 안장점 사이를 구분할 수 있음을 증명한다. 비선형 네트워크에서 ReLU 유사 활성화를 사용할 경우, 실제 데이터셋에서 무수히 많은 비최적의 국소 최소값이 존재하며, 국소 최소값이 전역 최소값보다 엄격히 열 劣할 수 있음을 보여주는 반례를 구성한다.
We investigate the loss surface of deep linear and nonlinear neural networks. We show that for deep linear networks with differentiable losses, critical points after the multilinear parameterization inherit the structure of critical points of the underlying loss with linear parameterization. As corollaries we obtain minima are results that subsume most previous results, while showing how to distinguish global minima from saddle points. For nonlinear neural networks, we prove two theorems showing that even for networks with one hidden layer, there can be spurious local minima. Indeed, for piecewise linear nonnegative homogeneous activations (e.g., ReLU), we prove that for almost all practical datasets there exist infinitely many local minima that are not global. We conclude by constructing a counterexample involving other activation functions (e.g., sigmoid, tanh, arctan, etc.), for which there exists a local minimum strictly inferior to the global minimum.
연구 동기 및 목표
- 깊이 있는 선형 및 비선형 신경망에서의 임계점의 구조를 조사하기 위해.
- 전역 최소값이 안장점이나 비최적의 국소 최소값으로부터 신뢰성 있게 식별되고 구분될 수 있는지 확인하기 위해.
- 일반적인 딥 러닝 설정에서, 특히 일반적인 비선형 활성화를 사용할 경우, 허위 국소 최소값의 빈도를 조사하기 위해.
- 국소 최소값이 전역 최소값보다 엄격히 열 劣한 경우를 명시적으로 구성하기 위해.
제안 방법
- 다중선형 매개변수화 하에서 깊이 있는 선형 네트워크의 손실 표면을 분석하여, 임계점이 선형 매개변수화의 임계점과 관련이 있음을 규명하기 위해.
- 미분기하학과 최적화 이론을 사용하여 선형 네트워크에서의 임계점의 구조를 특성화하기 위해.
- 조각별 선형 비음수 동차 활성화(예: ReLU)를 갖는 한 층의 비선형 네트워크에서 전역 최소값이 아닌 무수히 많은 국소 최소값이 존재함을 증명하기 위해.
- 비다각형 활성화 함수(예: 시그모이드, 탄함, 아크탄함수)를 사용하여 국소 최소값이 전역 최소값보다 엄격히 열 劣할 수 있음을 보여주는 명시적 반례를 구성하기 위해.
- 측도 이론적 접근을 적용하여, 거의 모든 실질적 데이터셋에서 이러한 비최적의 최소값이 널리 퍼져 있음을 보여주기 위해.
실험 결과
연구 질문
- RQ1다중선형 매개변수화를 사용할 때, 깊이 있는 선형 네트워크에서 전역 최소값을 안장점과 구분할 수 있는가?
- RQ2실제 데이터셋에서 ReLU 유사 활성화를 갖는 비선형 깊이 네트워크에 비최적의 국소 최소값이 존재하는가?
- RQ3딥 러닝 네트워크에서 국소 최소값이 전역 최소값보다 엄격히 열 劣할 수 있으며, 만약 그렇다면 어떤 조건에서 그러한 일이 발생하는가?
- RQ4활성화 함수의 선택이 허위 국소 최소값의 존재와 심각도에 어떤 영향을 미치는가?
주요 결과
- 손실 함수가 미분 가능할 경우, 다중선형 매개변수화 하에서 깊이 있는 선형 네트워크의 임계점은 선형 매개변수화의 임계점의 구조를 물려받아 전역 최소값을 더 명확히 식별할 수 있다.
- ReLU 유사 활성화를 갖는 한 층의 비선형 네트워크에서는 거의 모든 실질적 데이터셋에서 전역 최소값이 아닌 무수히 많은 국소 최소값이 존재한다.
- 시그모이드, 탄함, 아크탄함수와 같은 특정 비선형 활성화 함수의 경우, 명시적 반례를 통해 국소 최소값이 전역 최소값보다 엄격히 열 劣할 수 있음을 보여준다.
- 결과적으로, 딥 러닝 학습에서 전역 최적성에 대한 가정은 심지어 표준 비선형성을 갖는 비교적 단순한 아키텍처에서도 보장되지 않음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.