Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient Descent Finds Global Minima of Deep Neural Networks

Simon S. Du, Jason D. Lee|arXiv (Cornell University)|2018. 11. 09.
Sparse and Compressive Sensing Techniques참고 문헌 47인용 수 198
한 줄 요약

논문은 잔차 연결(ResNet)을 갖춘 과매개변수화된 심층 신경망에서 gradient descent가 다항 시간 안에 학습 손실을 0으로 만들 수 있음을 증명하고, 학습 중 Gram 행렬의 안정성 분석을 통해 합성 ResNet까지 확장한다.

ABSTRACT

Gradient descent finds a global minimum in training deep neural networks despite the objective function being non-convex. The current paper proves gradient descent achieves zero training loss in polynomial time for a deep over-parameterized neural network with residual connections (ResNet). Our analysis relies on the particular structure of the Gram matrix induced by the neural network architecture. This structure allows us to show the Gram matrix is stable throughout the training process and this stability implies the global optimality of the gradient descent algorithm. We further extend our analysis to deep residual convolutional neural networks and obtain a similar convergence result.

연구 동기 및 목표

  • 딥 네트워크에서 무작위로 초기화된 그래디언트 메서드가 왜 0의 학습 손실을 달성하는지 이해를 촉진한다.
  • 딥한 완전 연결(fully-connected), ResNet 및 합성 ResNet 아키텍처에서 그래디언트 디센트가 전역 최적해로 수렴하는 조건을 확립한다.
  • 학습 역학의 엄밀한 안정성 분석을 가능하게 하는 활성화 함수 및 아키텍처 가정을 개발한다.

제안 방법

  • 깊은 네트워크의 학습 역학을 포착하는 Gram 매트릭스 프레임워크를 정의한다.
  • 충분한 폭(width)이 주어지면 초기화 시 Gram 매트릭스가 데이터-및 아키텍처 의존적 한계에 가깝고 학습 중 안정적으로 남아 있음을 보여준다.
  • 수렴 속도를 한계 Gram 매트릭스의 최소 고유값과 연결하는 파워-메서드 스타일의 주장을 사용한다.
  • 완전 연결, ResNet, 합성 ResNet에 대한 Gram 매트릭스의 아키텍처별 재귀 정의를 도출하여 층 간 교란을 구한다.
  • Skip 연결로 인해 ResNet에서 교란 전파가 더 완만해지며 깊이에 따른 지수적 의존성을 줄인다.
  • 적절한 스텝 사이즈와 과매개변수화 하에서 그래디언트 디센트의 선형 수렴 속도를 보장하는 수렴 정리를 제공한다.

실험 결과

연구 질문

  • RQ1깊고 과매개변수화된 네트워크에서 잔차 연결을 갖는 경우 그래디언트 디센트가 0의 학습 손실에 도달할 수 있는가?
  • RQ2네트워크 폭과 아키텍처(완전 연결 vs. ResNet vs. 합성 ResNet)가 필요한 과매개화 수준과 수렴 속도에 어떤 영향을 미치는가?
  • RQ3Gram 매트릭스가 글로벌 수렴 보장에 어떤 역할을 하며 학습 중 얼마나 안정적인가?
  • RQ4Gram 매트릭스의 양의 확정성 및 수렴을 보장하기 위해 필요한 활성화 함수 및 데이터 가정은 무엇인가?

주요 결과

  • 깊은 완전 연결 네트워크의 경우 충분한 폭 m은 (지정된 초기화 및 데이터 가정하에) 그래디언트 디센트가 0의 학습 손실로 선형 속도로 수렴한다.
  • ResNet 아키텍처의 경우 층당 필요한 폭은 깊이에 대해 완전 연결 네트보다 느리게 증가하여 수렴 보장에 다항식 깊이 의존성을 부여한다.
  • 합성 ResNet의 경우 폭이 데이터 크기, 패치 수 및 깊이에 다항식으로 의존하는 경우 0의 학습 손실로의 수렴이 성립한다.
  • 분석에 따르면 Gram 매트릭스 G(H)(k)가 데이터- 및 아키텍처 의존적 한계 K(H)에 가깝게 남아 있으며, K(H)의 strictly positive minimum 고유값은 선형 수렴을 보장한다.
  • ResNet의 Skip 연결은 교란을 안정화시켜 폭 요구의 깊이에 따른 지수적 의존성을 피하고 깊이에 대한 다항식 의존성을 가능하게 한다.
  • 이 결과는 매끄러운 활성화(예: 소프트 플러스) 및 해석적 비다항 활성화에 대해, 무작위 가우시안 초기화 및 이차 손실 하에서 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.