Skip to main content
QUICK REVIEW

[논문 리뷰] A Proximal Block Coordinate Descent Algorithm for Deep Neural Network Training

Tim Tsz-Kit Lau, Jinshan Zeng|arXiv (Cornell University)|2018. 03. 24.
Sparse and Compressive Sensing Techniques인용 수 14
한 줄 요약

이 논문은 이차 페널티 방법을 사용하여 딥 네ural 네트워크(DNN) 최적화 문제를 재구성하고 활성화 함수를 볼록 집합 위로 투영함으로써, 커르디카-로자셰비츠(Kurdyka-Łojasiewicz, KL) 성질 하에서 전역 수렴을 보장하는 새로운 프록시멀 블록 좌표 강하(PBCD) 알고리즘을 제안한다. 이 방법은 MNIST와 같은 표준 데이터셋에서 SGD를 사용한 백프로파게이션보다 적은 에포크 수로 경쟁적인 학습 효율성을 달성한다.

ABSTRACT

Training deep neural networks (DNNs) efficiently is a challenge due to the associated highly nonconvex optimization. The backpropagation (backprop) algorithm has long been the most widely used algorithm for gradient computation of parameters of DNNs and is used along with gradient descent-type algorithms for this optimization task. Recent work have shown the efficiency of block coordinate descent (BCD) type methods empirically for training DNNs. In view of this, we propose a novel algorithm based on the BCD method for training DNNs and provide its global convergence results built upon the powerful framework of the Kurdyka-Lojasiewicz (KL) property. Numerical experiments on standard datasets demonstrate its competitive efficiency against standard optimizers with backprop.

연구 동기 및 목표

  • 백프로파게이션에서 내재된 기울기 소실 문제를 포함한 딥 네ural 네트워크(DNN) 학습의 비볼록 최적화 문제에 도전하기 위해.
  • 기울기 의존성이 없는 블록 좌표 강하(BCD) 기반 최적화 방법을 개발하여 기울기 소실 문제를 피하고 효율적인 학습을 가능하게 하기 위해.
  • 커르디카-로자셰비츠(Kurdyka-Łojasiewicz, KL) 성질 프레임워크를 사용하여 제안된 알고리즘의 전역 수렴 보장을 수립하기 위해.
  • 기준 데이터셋에서 표준 백프로파게이션과 SGD를 사용한 방법과의 비교에서 경쟁적인 학습 효율성을 입증하기 위해.

제안 방법

  • 이차 페널티 방법을 사용하여 DNN 학습 문제를 재구성함으로써 중첩된 구조를 별개의 느슨하게 결합된 하위문제로 전환한다.
  • 활성화 함수를 비어 있지 않은 닫힌 볼록 집합 위로의 투영으로 모델링하여 손실 함수를 블록 다중볼록 형태로 변환한다.
  • 변수 블록(활성화, 가중치, 편향 및 보조 변수)을 순차적으로 갱신하기 위해 가우스-세이델 유형의 프록시멀 블록 좌표 강하 방식을 적용한다.
  • 가중치, 편향, 활성화, 보조 변수를 포함한 모든 변수 블록에 대해 프록시멀 스텝을 사용하여 안정성과 수렴성을 보장한다.
  • 전역 수렴과 수렴 속도 분석을 위해 커르디카-로자셰비츠(Kurdyka-Łojasiewicz, KL) 성질을 활용한다.
  • KL 지수에 기반한 수렴 속도를 유도하며, 함수의 기하적 특성에 따라 유한, 선형 또는 부분선형 수렴이 가능하다.

실험 결과

연구 질문

  • RQ1KL 성질 프레임워크 하에서 프록시멀 블록 좌표 강하 방법이 딥 네ural 네트워크 학습에 대해 전역 수렴을 달성할 수 있는가?
  • RQ2제안된 PBCD 알고리즘이 에포크당 학습 효율성 측면에서 표준 백프로파게이션과 SGD를 사용한 방법보다 뛰어나게 성능을 발휘하는가?
  • RQ3모든 변수 블록(활성화 및 편향 포함)에 프록시멀 스텝을 사용할 경우 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ4손실 함수의 다양한 기하 조건 하에서 PBCD 알고리즘의 수렴 속도 거동은 어떠한가?
  • RQ5제안된 방법이 백프로파게이션에 내재된 기울기 소실 문제를 효과적으로 피할 수 있는가?

주요 결과

  • 제안된 PBCD 알고리즘은 커르디카-로자셰비츠(Kurdyka-Łojasiewicz, KL) 성질 하에서 딥 네ural 네트워크 학습에 대해 전역 수렴을 달성하며, 임계점으로 수렴함을 보장한다.
  • 알고리즘은 경쟁적인 학습 효율성을 보이며, MNIST에서 백프로파게이션을 사용한 SGD보다 훨씬 적은 에포크 수로 유사한 테스트 정확도에 도달한다.
  • 784-2048-2048-2048-10 MLP에서 BCD는 30 에포크 만에 최종 테스트 정확도 94.58%를 달성했으며, 이는 SGD가 100 에포크 만에 달성한 95.33% 정확도와 유사하다.
  • 스킵 연결이 있는 784-2048-784-2048-10 ResNet에서 BCD는 20 에포크 만에 95.37%의 테스트 정확도를 기록했으며, 이는 SGD가 100 에포크 만에 달성한 95.33% 정확도와 유사하다.
  • PBCD 알고리즘의 수렴 속도는 KL 지수에 따라 달라지며, 유한(θ=0), 선형(θ∈(0,1/2]), 또는 부분선형(θ∈(1/2,1)) 수렴이 가능하며, 명시적인 경계가 도출되었다.
  • 모든 변수 블록(활성화 및 편향 포함)에 프록시멀 스텝을 사용함으로써 기울기 계산에 의존하지 않고도 안정적이고 효율적인 갱신이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.