Skip to main content
QUICK REVIEW

[논문 리뷰] Stagewise Training Accelerates Convergence of Testing Error Over SGD

Zhuoning Yuan, Yan Yan|arXiv (Cornell University)|2018. 12. 10.
Stochastic Gradient Optimization Techniques참고 문헌 32인용 수 13
한 줄 요약

이 논문은 스위치 단계 학습에서 기하급수적으로 감소하는 학습률을 사용할 경우, 특히 폴리악-로자예프스키 조건(PL 조건) 하에서, 확률적 경사 하강법(SGD)의 학습 오차와 테스트 오차 수렴 속도가 가속화되는 이론적 근거를 제공한다. 이는 볼록 함수 및 볼록 함수에 가까운 특정 비볼록 목적 함수에 대해, 기하급수적으로 감소하는 학습률을 사용하는 스위치 단계 SGD가 다항식 감소 학습률을 사용하는 일반적인 SGD보다 더 빠른 수렴 속도와 더 낮은 테스트 오차 경계를 달성함을 보여준다.

ABSTRACT

Stagewise training strategy is widely used for learning neural networks, which runs a stochastic algorithm (e.g., SGD) starting with a relatively large step size (aka learning rate) and geometrically decreasing the step size after a number of iterations. It has been observed that the stagewise SGD has much faster convergence than the vanilla SGD with a polynomially decaying step size in terms of both training error and testing error. {\it But how to explain this phenomenon has been largely ignored by existing studies.} This paper provides some theoretical evidence for explaining this faster convergence. In particular, we consider a stagewise training strategy for minimizing empirical risk that satisfies the Polyak-Łojasiewicz (PL) condition, which has been observed/proved for neural networks and also holds for a broad family of convex functions. For convex loss functions and two classes of "nice-behaviored" non-convex objectives that are close to a convex function, we establish faster convergence of stagewise training than the vanilla SGD under the PL condition on both training error and testing error. Experiments on stagewise learning of deep residual networks exhibits that it satisfies one type of non-convexity assumption and therefore can be explained by our theory. Of independent interest, the testing error bounds for the considered non-convex loss functions are dimensionality and norm independent.

연구 동기 및 목표

  • 딥 러닝에서 스위치 단계 학습이 테스트 오차 수렴 속도를 가속화하는 데 성공한 이유를 설명하는 것.
  • 스위치 단계 SGD가 다항식 감소 학습률을 사용하는 일반적인 SGD보다 더 빠른 수렴 속도를 보이는 데 대한 이론적 근거를 제공하는 것.
  • 많은 신경망과 볼록 함수에 대해 성립하는 폴리악-로자예프스키(PL) 조건 하에서 수렴을 분석하는 것.
  • 비볼록 손실 함수에 대해 차원 수와 노름에 영향을 받지 않는 테스트 오차 경계를 수립하는 것.
  • 딥 리샘플링 네트워크에서 이론을 실증적으로 검증하여, 비볼록성 가정이 실생활에서 실제로 만족됨을 보여주는 것.

제안 방법

  • 다중 단계에서 기하급수적으로 감소하는 학습률을 사용하는 스위치 단계 학습 알고리즘을 제안한다.
  • 최적 해와의 거리가 기울기 노름에 의해 제어되는 PL 조건 하에서 수렴을 분석한다.
  • 학습 오차와 일반화 오차를 통합한 분석 프레임워크를 사용하여 테스트 오차를 경계한다.
  • 볼록 및 비볼록 설정 모두에 동일한 일반화 분석 도구(예: 안정성 또는 라데마처 복잡도)를 적용한다.
  • 두 단계 접근 방식을 사용한다: 각 단계 내부에선 고정된 학습률로 SGD를 실행하고, 각 단계 후에 학습률을 기하급수적으로 감소시킨다.
  • 딥 리샘플링 네트워크에서의 실증 분석을 통해 이론적 가정을 검증하며, μ, θ 및 최소 헤시안 고유값을 측정한다.

실험 결과

연구 질문

  • RQ1기하급수적으로 감소하는 학습률을 사용하는 스위치 단계 학습이 다항식 감소 학습률을 사용하는 일반적인 SGD보다 테스트 오차 수렴 속도가 더 빠른 이유는 무엇인가?
  • RQ2스위치 단계 SGD가 테스트 오차 수렴 속도 측면에서 일반적인 SGD를 능가하는 조건은 무엇인가?
  • RQ3실제 딥 네트워크가 이론에서 요구하는 비볼록성 가정(예: 한 점에서의 약한 쿼드라틱 볼록성)을 어느 정도 만족하는가?
  • RQ4PL 조건 하에서 유도된 비볼록 목표 함수의 테스트 오차 경계는 차원 수와 모델 노름에 영향을 받지 않는가?
  • RQ5동일한 반복 횟수와 데이터 샘플 수 하에서, 스위치 단계 SGD의 수렴 속도는 1/t 및 1/√t 학습률을 사용하는 일반적인 SGD와 비교해 어떻게 되는가?

주요 결과

  • 스위치 단계 SGD는 일반적인 SGD와 비교해 PL 상수 μ에 대해 더 우수한 종속성을 보이며, 이는 학습 오차와 테스트 오차 수렴 속도 향상으로 이어진다.
  • 크고 불량한 조건을 가진 문제(μ ≪ 1)에서는 스위치 단계 SGD가 1/√t 학습률을 사용하는 일반적인 SGD보다 훨씬 낮은 테스트 오차를 달성한다.
  • PL 조건 하에서 비볼록 목표 함수의 테스트 오차 경계는 데이터 차원과 모델 노름에 영향을 받지 않으며, 이는 강력한 이론적 이점이다.
  • 딥 리샘플링 네트워크에서의 실험 결과는 한 점에서의 약한 쿼드라틱 볼록성 가정(θ > 1)과 작은 μ 값이 학습 과정에서 만족됨을 보여주며, 이론 프레임워크의 타당성을 검증한다.
  • 실증 결과는 여러 데이터셋과 손실 함수에서 스위치 단계 학습이 일반적인 SGD보다 학습 오차와 테스트 오차 수렴 속도에서 뛰어난 성능을 보임을 확인한다.
  • 헤시안 분석 결과, ρ ≤ O(μ) 가정은 딥 네트워크에서는 성립하지 않지만, μ 및 θ 가정의 타당성 덕분에 이론은 여전히 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.