Skip to main content
QUICK REVIEW

[논문 리뷰] Convergence rates for gradient descent in the training of overparameterized artificial neural networks with biases

Arnulf Jentzen, Timo Kröger|arXiv (Cornell University)|2021. 02. 23.
Machine Learning and ELM인용 수 4
한 줄 요약

이 논문은 편향이 있는 오버파rameter화된 완전히 연결된 ReLU 신경망에서 배치 경사하강법의 선형 수렴 속도를 확립한다. 넓이가 충분하고 학습률이 작으며 입력 데이터가 선형 독립일 조건 하에서 훈련 오차가 지수적으로 빠르게 감소함을 보여준다. 분석은 평균 제곱 오차가 선형 속도로 0으로 수렴함을 증명하여 오버파rameter화된 설정에서 경사하강법의 경험적 성공에 이론적 근거를 제공한다.

ABSTRACT

In recent years, artificial neural networks have developed into a powerful tool for dealing with a multitude of problems for which classical solution approaches reach their limits. However, it is still unclear why randomly initialized gradient descent optimization algorithms, such as the well-known batch gradient descent, are able to achieve zero training loss in many situations even though the objective function is non-convex and non-smooth. One of the most promising approaches to solving this problem in the field of supervised learning is the analysis of gradient descent optimization in the so-called overparameterized regime. In this article we provide a further contribution to this area of research by considering overparameterized fully-connected rectified artificial neural networks with biases. Specifically, we show that for a fixed number of training data the mean squared error using batch gradient descent optimization applied to such a randomly initialized artificial neural network converges to zero at a linear convergence rate as long as the width of the artificial neural network is large enough, the learning rate is small enough, and the training input data are pairwise linearly independent.

연구 동기 및 목표

  • 비볼록이고 비미분 가능한 손실 표면에도 불구하고 오버파라미터화된 신경망에서 경사하강법이 훈련 손실을 0으로 만들 수 있는 이유를 설명하는 것.
  • 기존의 수렴 결과를 확장하여 완전히 연결된 ReLU 네트워크에 편향을 포함한 분석을 수행하는 것.
  • 이 오버파라미터화된 환경에서 배치 경사하강법의 정량적 수렴 속도를 확립하는 것.
  • 랜덤 초기화, 네트워크의 넓이, 입력 데이터의 구조가 수렴을 보장하는 데 미치는 영향을 분석하는 것.

제안 방법

  • 랜덤 가중치 초기화를 사용하여 오버파라미터화된 완전히 연결된 ReLU 네트워크에서의 배치 경사하강법을 분석한다.
  • 훈련 중 네트워크 파라미터에 대한 경험적 위험의 정확한 기울기 표현을 유도한다.
  • 훈련 동역학과 초기화 시 네트워크의 특징 매핑의 그람 행렬 사이의 연결 고리를 설정한다.
  • 최적화 중 스토케스틱 그람 행렬을 제어하기 위해 농도 불등식과 하위지수 尾 꼬리 유계를 사용한다.
  • 충분한 넓이와 작은 학습률 조건 하에서 경험적 위험이 선형 속도로 감소함을 증명한다.
  • 기울기 유동의 극한이 네트워크의 특징 매핑과 ReLU 활성화 함수에 의해 지배되는 선형 시스템과 일치함을 보여준다.

실험 결과

연구 질문

  • RQ1배치 경사하강법이 오버파라미터화된 ReLU 네트워크에서 어떤 조건 하에 선형 수렴을 달성하는가?
  • RQ2편향의 포함이 오버파라미터화된 설정에서 경사하강법의 수렴 행동에 어떤 영향을 미치는가?
  • RQ3훈련 데이터의 선형 독립성이 0 훈련 오차 수렴을 보장하는 데 어떤 역할을 하는가?
  • RQ4네트워크의 넓이와 학습률이 함께 수렴 속도에 어떤 영향을 미치는가?
  • RQ5오버파라미터화된 환경에서 경사하강법의 동역학을 극한 선형 시스템으로 특성화할 수 있는가?

주요 결과

  • 훈련 단계 수가 증가함에 따라 평균 제곱 오차가 충분히 넓은 네트워크에서 선형 속도로 0으로 수렴한다.
  • 학습률이 충분히 작고 입력 데이터가 짝별로 선형 독립일 경우 수렴이 보장된다.
  • 기울기 유동의 극한은 네트워크 출력이 입력과 은닉층 가중치의 내적곱에 의해 결정되는 선형 시스템과 일치한다.
  • 수렴 속도는 (1 - ηΛ)^n 으로 유계지며, 여기서 Λ는 결정론적 그람 행렬의 최소 고유값과 관련된 양수 상수이다.
  • 높은 확률(최소 1 - ε)로 경험적 위험은 시간이 지남에 따라 지수적으로 감소한다.
  • 분석은 편향의 존재가 수렴을 방해하지 않으며, 훈련 중 네트워크의 특징 매핑이 잘 조절된 상태를 유지함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.