Skip to main content
QUICK REVIEW

[논문 리뷰] A General Family of Stochastic Proximal Gradient Methods for Deep Learning

Jihun Yun, Aurélie Lozano|arXiv (Cornell University)|2020. 07. 15.
Stochastic Gradient Optimization Techniques참고 문헌 41인용 수 7
한 줄 요약

이 논문은 딥러닝을 위한 일반적인 스토하스틱 프락시멀 그라디언트 방법인 ProxGen을 제안한다. 이는 임의의 양수 프리컨dition러와 하향반순속(비볼록 포함) 정규화를 지원하며, 표준 스토하스틱 프락시멀 그라디언트 디센트와 동일한 수렴 보장을 확립한다. 또한 ℓq 정규화(0 ≤ q ≤ 1)에 대한 새로운 폐형 프락시멀 매핑과 양자화를 위한 ProxQuant의 수정 버전을 도입한다. 실험 결과, 비볼록 정규화를 사용할 경우, 프락시멀 방법이 서브그라디언트 방법보다 뛰어난 성능을 보인다.

ABSTRACT

We study the training of regularized neural networks where the regularizer can be non-smooth and non-convex. We propose a unified framework for stochastic proximal gradient descent, which we term ProxGen, that allows for arbitrary positive preconditioners and lower semi-continuous regularizers. Our framework encompasses standard stochastic proximal gradient methods without preconditioners as special cases, which have been extensively studied in various settings. Not only that, we present two important update rules beyond the well-known standard methods as a byproduct of our approach: (i) the first closed-form proximal mappings of $\ell_q$ regularization ($0 \leq q \leq 1$) for adaptive stochastic gradient methods, and (ii) a revised version of ProxQuant that fixes a caveat of the original approach for quantization-specific regularizers. We analyze the convergence of ProxGen and show that the whole family of ProxGen enjoys the same convergence rate as stochastic proximal gradient descent without preconditioners. We also empirically show the superiority of proximal methods compared to subgradient-based approaches via extensive experiments. Interestingly, our results indicate that proximal methods with non-convex regularizers are more effective than those with convex regularizers.

연구 동기 및 목표

  • 딥러닝에서 임의의 양수 프리컨디셔너와 비연속, 비볼록 정규화를 지원하는 통합된 스토하스틱 프락시멀 그라디언트 디센트 프레임워크를 개발하는 것.
  • 프리컨디셔너와 비볼록 정규화를 적용한 적응형 스토하스틱 프락시멀 그라디언트 방법에 대한 이론적 수렴 보장이 부족한 문제를 해결하는 것.
  • ℓq 정규화(0 ≤ q ≤ 1)에 대한 폐형 프락시멀 매핑을 유도하여 적응형 방법에서의 효율적 구현을 가능하게 하는 것.
  • 네트워크 양자화를 위한 원래 ProxQuant 방법의 결함을 ProxGen 프레임워크에 통합하여 수정하는 것.
  • 프락시멀 방법이 비볼록 정규화를 사용할 경우 서브그라디언트 기반 방법과 표준 프락시멀 방법보다 실증적으로 뛰어나게 성능을 발휘함을 검증하는 것.

제안 방법

  • 임의의 양수 프리컨디셔너와 하향반순속 정규화를 통합한 스토하스틱 프락시멀 그라디언트 디센트를 위한 일반적인 프레임워크인 ProxGen을 제안한다.
  • 손실 함수에 대한 그라디언트 디센트와 정규화 함수에 대한 정확한 프락시멀 매핑을 결합한 새로운 업데이트 규칙을 유도하며, 이는 비볼록 및 비연속 정규화 함수에도 적용 가능하다.
  • 리아파노프 함수를 분석하고 스토하스틱 그라디언트 분산을 유계화하여 정류점까지의 거리 분석을 통해 수렴 속도를 확립한다.
  • ℓq 정규화(0 ≤ q ≤ 1)에 대한 폐형 프락시멀 매핑을 도입하여 계산 효율성을 높이고, 적응형 방법에서의 적용 가능성을 보장한다.
  • 프락시멀 디센트가 올바르게 작동하도록 보장하기 위해 ProxQuant의 업데이트 규칙을 수정하여, 양자화 인식 훈련에서의 안정성과 수렴성을 향상시킨다.
  • 모멘타움 기반 업데이트를 사용하며, 적응형 학습률과 그라디언트의 지수이동평균을 통합하여, 비볼록 및 비연속 설정에서도 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1딥러닝에서 임의의 양수 프리컨디셔너와 비볼록 정규화를 지원하는 통합된 스토하스틱 프락시멀 그라디언트 프레임워크를 설계할 수 있는가?
  • RQ2ℓq 정규화(0 ≤ q ≤ 1)에 대한 폐형 프락시멀 매핑은 적응형 최적화에서 더 효율적이고 안정적인 훈련을 가능하게 하는가?
  • RQ3ProxGen 프레임워크는 원래 ProxQuant 방법의 수렴 문제를 수정할 수 있는가?
  • RQ4ProxGen의 수렴 속도는 프리컨디셔닝 없이 표준 스토하스틱 프락시멀 그라디언트 디센트와 동일한가?
  • RQ5실제로 비볼록 정규화를 사용하는 프락시멀 방법이 서브그라디언트 기반 방법과 볼록 정규화보다 성능이 뛰어나게 되는가?

주요 결과

  • ProxGen은 적응형 학습률과 일반 정규화를 통합함에도 불구하고, 프리컨디셔닝이 없는 표준 스토하스틱 프락시멀 그라디언트 디센트와 동일한 수렴 속도를 달성한다.
  • 이 프레임워크는 이전 연구에서 확보되지 않은 ℓq 정규화(0 ≤ q ≤ 1)에 대한 폐형 프락시멀 매핑을 가능하게 하여 계산 효율성을 향상시킨다.
  • ProxGen 내부의 수정된 ProxQuant 방법은 원래 방법의 핵심 결함을 수정하여 더 안정적이고 정확한 양자화 인식 훈련을 가능하게 한다.
  • 경험적 결과로는 비볼록 정규화를 사용하는 프락시멀 방법이 수렴 속도와 최종 모델 성능 측면에서 서브그라디언트 기반 방법과 볼록 정규화보다 뚜렷이 뛰어나게 성능을 발휘한다.
  • 이론적 분석을 통해 수렴 속도는 스토하스틱 그라디언트 분산과 프리컨디셔너의 안정성에 의존하며, 반복 수 T에 대한 상수는 독립적임을 확인하였다.
  • 이 프레임워크는 프리컨디셔닝이나 특정 정규화를 사용하지 않을 경우 기존의 AdaGrad, RMSProp, Adam 등의 방법을 특수 케이스로 포함할 수 있을 정도로 일반적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.