[논문 리뷰] On ADMM in Deep Learning: Convergence and Saturation-Avoidance
이 논문은 시그모이드 활성화 함수를 갖는 딥 신경망을 위한 새로운 ADMM 기반 학습 방법(sigmoid-ADMM)을 제안하며, 기울기 포화를 방지하고 O(1/k) 수준의 전역 수렴 속도로 KKT 점에 수렴한다. 깊이 있는 시그모이드 신경망이 두 개의 은닉층을 가진 ReLU 네트워크를 근사할 수 있음을 보이며, 단순 함수에서 ReLU-SGD에 비해 안정성과 성능 면에서 뛰어나다.
In this paper, we develop an alternating direction method of multipliers (ADMM) for deep neural networks training with sigmoid-type activation functions (called extit{sigmoid-ADMM pair}), mainly motivated by the gradient-free nature of ADMM in avoiding the saturation of sigmoid-type activations and the advantages of deep neural networks with sigmoid-type activations (called deep sigmoid nets) over their rectified linear unit (ReLU) counterparts (called deep ReLU nets) in terms of approximation. In particular, we prove that the approximation capability of deep sigmoid nets is not worse than that of deep ReLU nets by showing that ReLU activation function can be well approximated by deep sigmoid nets with two hidden layers and finitely many free parameters but not vice-verse. We also establish the global convergence of the proposed ADMM for the nonlinearly constrained formulation of the deep sigmoid nets training from arbitrary initial points to a Karush-Kuhn-Tucker (KKT) point at a rate of order ${\cal O}(1/k)$. Besides sigmoid activation, such a convergence theorem holds for a general class of smooth activations. Compared with the widely used stochastic gradient descent (SGD) algorithm for the deep ReLU nets training (called ReLU-SGD pair), the proposed sigmoid-ADMM pair is practically stable with respect to the algorithmic hyperparameters including the learning rate, initial schemes and the pro-processing of the input data. Moreover, we find that to approximate and learn simple but important functions the proposed sigmoid-ADMM pair numerically outperforms the ReLU-SGD pair.
연구 동기 및 목표
- SGD로 훈련하는 딥 ReLU 네트워크에서 기울기 소실/폭발과 하이퍼파라미터 민감성으로 인한 근사와 최적화 간의 일관성 없는 문제를 해결하기 위해.
- 기울기 기반 최적화 방법이 아닌 ADMM를 개발하여, 부드러운 함수에 대해 우수한 근사 성질을 지닌 시그모이드 유형 활성화 함수의 포화 문제를 피하기 위해.
- 비선형 제약 조건 하에 딥 시그모이드 네트워크에 대해 ADMM의 전역 수렴성을 확립하고, O(1/k) 수렴 속도를 보장하기 위해.
- 깊이 있는 시그모이드 네트워크가 오직 두 개의 은닉층만으로도 ReLU 네트워크를 유한한 파라미터로 근사할 수 있으며, 반대로 그 반대는 성립하지 않음을 보여주어 근사 우월성을 입증하기 위해.
- 단순한 함수 근사 작업에서 제안된 시그모이드-ADMM 방법이 ReLU-SGD보다 더 안정적이고 수치적으로 뛰어나다는 경험적 검증을 위해.
제안 방법
- 딥 시그모이드 네트워크 학습을 비선형 제약 조건이 있는 최적화 문제로 공식화하며, ADMM 분해를 위해 네트워크를 교차하는 변수 블록으로 분할한다.
- 최적화 문제를 해결하기 위해 보조 변수를 도입하여 비선형 활성화 함수를 분리함으로써, ADMM이 깊이 있는 네트워크의 비볼록, 비연속적인 구조를 다룰 수 있도록 한다.
- 수렴 보장이 되도록 페널티 파라미터 업데이트 규칙을 적용하며, Kurdyka-Łojasiewicz (KŁ) 부등식과 내림내림 레미마 분석을 통해 이론적 근거를 도출한다.
- 근사된 라그랑주 함수(표기: \hat{\cal L})를 사용하여 수렴성을 분석하며, 프록시항과 이중 상승 단계를 통합한다.
- 반복 수렴의 유한성, 충분한 내림함수, 상대 오차 통제 및 KŁ 성질을 증명함으로써 전역 수렴을 확립하고, KKT 점으로의 수렴을 도출한다.
실험 결과
연구 질문
- RQ1ADMM는 깊이 있는 시그모이드 네트워크를 이론적 수렴 보장 하에 효과적으로 적용할 수 있는가?
- RQ2제안된 시그모이드-ADMM 방법은 SGD 기반 훈련에서 악영향을 미치는 시그모이드 활성화 함수의 포화 문제를 피할 수 있는가?
- RQ3유한한 파라미터로 깊이 있는 시그모이드 네트워크가 ReLU 네트워크를 근사할 수 있으며, 그 반대도 가능한가?
- RQ4단순한 함수 근사 작업에서 시그모이드-ADMM의 성능은 ReLU-SGD에 비해 안정성과 수치 정확도 면에서 어떻게 비교되는가?
- RQ5제안된 ADMM 방법의 수렴 속도는 깊이 있는 시그모이드 네트워크에서 얼마이며, 일반적인 부드러운 활성화 함수에 대해서도 성립하는가?
주요 결과
- 제안된 시그모이드-ADMM 방법은 온건한 가정 하에 임의의 초기값으로부터 O(1/k) 수렴 속도로 카루시-쿤-터커(KKT) 점으로 전역 수렴을 달성한다.
- 깊이 있는 시그모이드 네트워크는 오직 두 개의 은닉층과 유한한 수의 파라미터로 ReLU 활성화 함수를 근사할 수 있으나, 반대로 ReLU 네트워크는 깊이 있는 시그모이드 네트워크를 일반적으로 근사할 수는 없다.
- 시그모이드-ADMM 방법은 학습률, 초기화 및 입력 전처리에 민감하지 않아 ReLU-SGD보다 수치적으로 더 안정적이다.
- 경험적 결과로 시그모이드-ADMM가 조각별 선형 함수 및 부드러운 함수와 같이 단순하지만 중요한 함수를 근사하는 데에서 ReLU-SGD를 능가함을 보였다.
- 이론적 분석은 시그모이드 외에도 일반적인 부드러운 활성화 함수 클래스로 확장 가능하며, 단지 시그모이드 유형 활성화 함수에 국한되지 않는다.
- 이론적 분석을 통해 반복 수렴의 수열이 유한하고 목적 함수가 단조 감소함을 확인하여 수렴이 보장됨을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.