Skip to main content
QUICK REVIEW

[논문 리뷰] Why Learning of Large-Scale Neural Networks Behaves Like Convex Optimization

Hui Jiang|arXiv (Cornell University)|2019. 03. 06.
Stochastic Gradient Optimization Techniques참고 문헌 21인용 수 5
한 줄 요약

이 논문은 비볼록성에도 불구하고 대규모 신경망에서 경사하강법이 전역 최소값으로 수렴하는 이유를 설명한다. 비볼록성을 해소하기 위해 손실 함수가 볼록이 되는 표준 공간을 도입함으로써 이를 해결한다. 이 논문은 원래 공간과 표준 공간을 연결하는 불일치 행렬(disparity matrix)이 전순위를 유지하는 한, 즉 무작위 초기화 하에 매우 높은 확률로 유지되는 한, 경사하강법이 영 손실(global minimum)로 수렴함을 증명한다. 이는 마치 볼록 최적화 문제를 해결하는 것처럼 행동함을 의미한다.

ABSTRACT

In this paper, we present some theoretical work to explain why simple gradient descent methods are so successful in solving non-convex optimization problems in learning large-scale neural networks (NN). After introducing a mathematical tool called canonical space, we have proved that the objective functions in learning NNs are convex in the canonical model space. We further elucidate that the gradients between the original NN model space and the canonical space are related by a pointwise linear transformation, which is represented by the so-called disparity matrix. Furthermore, we have proved that gradient descent methods surely converge to a global minimum of zero loss provided that the disparity matrices maintain full rank. If this full-rank condition holds, the learning of NNs behaves in the same way as normal convex optimization. At last, we have shown that the chance to have singular disparity matrices is extremely slim in large NNs. In particular, when over-parameterized NNs are randomly initialized, the gradient decent algorithms converge to a global minimum of zero loss in probability.

연구 동기 및 목표

  • 대규모 비볼록 신경망을 훈련시키는 데에 단순한 경사하강법이 성공하는 이유에 대한 오랫동안 남아있던 수수께끼를 해결하기 위해.
  • 딥 러닝에서 경사하강법이 영 손실의 전역 최소값으로 수렴할 수 있는 이론적 조건을 규명하기 위해.
  • 네트워크 구조나 데이터 분포에 대한 제한적인 가정 없이 수학적으로 엄밀한 설명을 제공하기 위해.
  • 딥 러닝의 경험적 관찰을 새로운 수학적 프레임워크를 통해 이론적 최적화 원리와 통합하기 위해.
  • 무작위 가중치 초기화나 과도한 파rameter화와 같은 일반적인 딥 러닝 관행을 이론적으로 설명하기 위해.

제안 방법

  • 푸리에 분석을 통해 유도된 표준 모델 공간을 도입하여, 원래의 비볼록 최적화 문제를 볼록 문제로 변환한다.
  • 원래 가중치 공간과 표준 공간 사이의 국소 선형 변환을 나타내는 불일치 행렬(disparity matrix)을 정의한다.
  • 표준 공간에서 목표 함수가 볼록이 되며, 전순위 조건을 만족할 경우 전역 수렴이 가능함을 증명한다.
  • 불일치 행렬의 질을 최적화 성공의 핵심 결정 요소로 분석하여, 과도한 파rameter화된 네트워크에서 특이성이 흔치 않음을 보여준다.
  • 확률적 추론을 사용하여 과도한 파arameter화된 네트워크에서 무작위 초기화가 전순위 불일치 행렬을 거의 확실히 유지함을 보여준다.
  • 일반적인 근사 이론을 적용하여 $L^1(\mathbb{U}_K)$ 내의 함수에 대해 모델 공간의 완전성을 확보함으로써 영 손실 해를 위한 능력을 보장한다.

실험 결과

연구 질문

  • RQ1이론적으로 실패할 것으로 예상되지만, 왜 대규모 비볼록 신경망에서 경사하강법이 일관되게 전역 최소값으로 수렴하는가?
  • RQ2신경망 최적화 지형이 어떤 수학적 조건에서 볼록 문제처럼 행동하는가?
  • RQ3불일치 행렬의 구조가 신경망 훈련에서 경사하강법의 수렴 행동에 어떤 영향을 미치는가?
  • RQ4무작위 초기화가 불일치 행렬의 전순위를 보장하고, 그로 인해 전역 수렴이 이루어지는 데 어떤 역할을 하는가?
  • RQ5왜 과도한 파arameter화가 실무에서 영 손실 수렴을 위해 필수적인가? 이에 대한 이론적 보장은 무엇인가?

주요 결과

  • 대규모 신경망 학습에서 목표 함수는 표준 모델 공간에서 볼록이 되며, 적절한 조건 하에서 전역 수렴이 가능하다.
  • 불일치 행렬이 훈련 전반에 걸쳐 전순위를 유지하는 것과 동시에, 오직 그 경우에만 경사하강법이 영 손실의 전역 최소값으로 수렴한다.
  • 과도한 파arameter화된 네트워크에서 무작위 초기화 시 불일치 행렬이 특이행렬이 되는 확률은 극히 낮다.
  • 항상 비활성인 죽은 뉴런(dead neurons)과 동일한 가중치와 출력을 가지는 중복 뉴런(duplicated neurons)은 불일치 행렬의 질을 낮출 수 있으며, 이는 수렴을 차단할 수 있다.
  • 고차원이고 무작위로 초기화된 네트워크에서는 이러한 질이 떨어진 구성이 매우 흔치 않아, SGD의 강건성을 설명할 수 있다.
  • 이 이론적 프레임워크는 분석 함수 및 밴드제한 함수와 같은 다양한 함수 클래스에 일반적으로 적용 가능하며, 표준 신경망 설정을 초월하여 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.