Skip to main content
QUICK REVIEW

[논문 리뷰] Taylorized Training: Towards Better Approximation of Neural Network Training at Finite Width

Yu Bai, Ben Krause|arXiv (Cornell University)|2020. 02. 10.
Stochastic Gradient Optimization Techniques참고 문헌 40인용 수 12
한 줄 요약

이 논문은 신경망의 출력을 초기화 근처에서 k차 다항식까지 테일러 전개하여 신경망 학습을 근사하는 Taylorized 학습을 소개한다. 실험적으로는 고차수의 Taylorized 모델(특히 4차)이 선형화된 학습보다 유의미하게 뛰어나며, 가중치 공간과 함수 공간에서 전체 신경망 학습을 더 잘 근사함을 보였다. 표준 학습 환경에서 CIFAR-10에서 성능 격차를 70-80% 감소시켰다.

ABSTRACT

We propose \emph{Taylorized training} as an initiative towards better understanding neural network training at finite width. Taylorized training involves training the $k$-th order Taylor expansion of the neural network at initialization, and is a principled extension of linearized training---a recently proposed theory for understanding the success of deep learning. We experiment with Taylorized training on modern neural network architectures, and show that Taylorized training (1) agrees with full neural network training increasingly better as we increase $k$, and (2) can significantly close the performance gap between linearized and full training. Compared with linearized training, higher-order training works in more realistic settings such as standard parameterization and large (initial) learning rate. We complement our experiments with theoretical results showing that the approximation error of $k$-th order Taylorized models decay exponentially over $k$ in wide neural networks.

연구 동기 및 목표

  • 큰 학습률과 유한한 너비가 일반적인 실용적 딥러닝 환경에서 선형화된 학습의 한계를 해결하기 위해.
  • 유한한 너비에서 고차수 테일러 전개가 전체 신경망 학습 동역학을 더 잘 근사할 수 있는지 조사하기 위해.
  • 실용적 설정에서 선형화된 모델과 완전히 학습된 네트워크 사이의 성능 격차를 줄이기 위해.
  • 레이어 중요도 및 파라미터 이동과 같은 신경망 행동 분석 도구로 Taylorized 학습의 유용성을 탐색하기 위해.

제안 방법

  • 방법은 신경망 출력 fθ(x)를 초기화 θ₀ 근처에서 k차 다항식까지 테일러 급수를 사용해 전개한다: f^{(k)}_{θ;θ₀}(x) = f_{θ₀}(x) + Σ_{j=1}^k [∇^j_θ f_{θ₀}(x) / j!] ⋅ (θ−θ₀)^⊗j.
  • Taylorized 학습은 전체 네트워크 fθ(x) 대신 k차 테일러 근사 f^{(k)}_{θ;θ₀}(x)를 명시적으로 학습하는 방식이다.
  • 이 방법은 표준 아키텍처(예: ResNet, CNN)를 대상으로 실용적 학습 조건에서 적용된다: 표준 파arameterization과 큰 초기 학습률을 사용한다.
  • 근사 정확도는 다양한 k 값에서 전체 학습과 Taylorized 학습 간의 학습 궤적, 테스트 정확도, 파라미터 이동을 비교하여 평가된다.
  • 이론적 분석은 넓은 네트워크에서 k차 모델의 근사 오차가 k에 따라 지수적으로 감소함을 보여준다.
  • 레이어 중요도는 Taylorized 학습 중 각 레이어의 파라미터 업데이트 크기를 분석하여 연구된다.

실험 결과

연구 질문

  • RQ1유한한 너비에서 고차수 Taylorized 모델이 선형화된 모델보다 전체 신경망 학습을 더 잘 근사할 수 있는가?
  • RQ2큰 학습률과 표준 파rameterization 조건에서 Taylorized 학습은 실용적 환경에서 어떻게 성능을 발휘하는가?
  • RQ3테일러 전개의 차수 k를 높일수록 선형화된 학습과 전체 학습 간의 성능 격차는 어느 정도 감소하는가?
  • RQ4Taylorized 학습은 레이어 중요도 및 파라미터 이동 동역학에 대한 통찰을 제공할 수 있는가?
  • RQ5넓은 네트워크에서 k차 모델의 근사 오차는 k가 증가함에 따라 지수적으로 감소하는가?

주요 결과

  • CIFAR-10에서 k=4(4차)인 Taylorized 학습은 선형화된 학습과 전체 학습 간의 테스트 정확도 격차를 70-80% 감소시켰으며, 전체 학습보다 10-15% 낮은 성능을 기록했다.
  • 고차수 Taylorized 모델(k≥2)은 큰 학습률 조건에서도 파라미터 공간과 함수 공간에서 전체 학습 궤적을 점점 더 잘 근사한다.
  • 4차 Taylorized 모델은 일반적으로 전체 학습 대비 40% 이상 정확도 손실을 겪는 선형화된 학습보다 유의미하게 뛰어난 성능을 보였다.
  • 이론적 분석은 넓은 신경망에서 근사 오차가 k가 증가함에 따라 지수적으로 감소함을 확인하여 실험적 경향을 뒷받침한다.
  • Taylorized 학습은 깊이가 깊은 레이어가 얕은 레이어보다 더 적게 이동함을 드러내어 레이어 중요도의 계층적 구조를 시사한다.
  • 특히 표준 하이퍼파rameter 설정에서 선형화된 학습보다 유한한 너비 학습 동역학을 더 현실적으로 모델링할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.