Skip to main content
QUICK REVIEW

[논문 리뷰] Sketchy Empirical Natural Gradient Methods for Deep Learning

Minghan Yang, Dong Xu|arXiv (Cornell University)|2020. 06. 10.
Sparse and Compressive Sensing Techniques참고 문헌 27인용 수 5
한 줄 요약

이 논문은 깊이 있는 학습을 위한 확장 가능한 두 번째 순서 최적화 방법인 스케치 기반 경험적 자연 경사(Sketchy Empirical Natural Gradient, SENG)를 제안한다. 이 방법은 낮은 질서의 부분공간에서 경험적 페일러 정보 매트릭스(EFIM)를 효율적으로 근사하기 위해 랜덤 스케칭을 사용한다. 정규화된 최소 제곱 하위 문제와 낮은 질서의 행렬 근사에 스케칭을 적용함으로써, 신경 장핵 커널(NTK) 영역에서 전역 수렴과 빠른 선형 수렴을 달성한다. ResNet50/ImageNet-1k에서 41 에포크, 1 에포크당 663초에 75.9% Top-1 정확도를 달성하며, SGD와 KFAC를 능가한다. 또한 분산 환경에서도 높은 확장성 효율을 유지한다.

ABSTRACT

In this paper, we develop an efficient sketchy empirical natural gradient method (SENG) for large-scale deep learning problems. The empirical Fisher information matrix is usually low-rank since the sampling is only practical on a small amount of data at each iteration. Although the corresponding natural gradient direction lies in a small subspace, both the computational cost and memory requirement are still not tractable due to the high dimensionality. We design randomized techniques for different neural network structures to resolve these challenges. For layers with a reasonable dimension, sketching can be performed on a regularized least squares subproblem. Otherwise, since the gradient is a vectorization of the product between two matrices, we apply sketching on the low-rank approximations of these matrices to compute the most expensive parts. A distributed version of SENG is also developed for extremely large-scale applications. Global convergence to stationary points is established under some mild assumptions and a fast linear convergence is analyzed under the neural tangent kernel (NTK) case. Extensive experiments on convolutional neural networks show the competitiveness of SENG compared with the state-of-the-art methods. On the task ResNet50 with ImageNet-1k, SENG achieves 75.9\% Top-1 testing accuracy within 41 epochs. Experiments on the distributed large-batch training show that the scaling efficiency is quite reasonable.

연구 동기 및 목표

  • 대규모 깊이 신경망에서 경험적 페일러 정보 매트릭스(EFIM)의 낮은 질서 성질에도 불구하고 자연 경사 방법의 높은 계산 및 메모리 비용을 해결한다.
  • EFIM 근사에 대한 계산 부담을 줄이기 위해 효율적인 랜덤 스케칭 기법을 개발하며, 수렴 보장을 훼손하지 않는다.
  • 대규모 배치 설정에서 높은 통신 및 계산 효율성을 갖춘 확장 가능한 분산 학습을 가능하게 한다.
  • 유사한 가정 조건 하에서 전역 수렴과 신경 장핵 커널(NTK) 영역에서의 빠른 선형 수렴을 확립한다.
  • ImageNet-1k 및 CIFAR10과 같은 표준 벤치마크에서 최첨단의 일阶 및 이阶 방법과 경쟁 가능한 성능을 입증한다.

제안 방법

  • 경험적 자연 경사 방향을 EFIM의 낮은 질서 구조를 활용해 부분 샘플링된 기울기의 선형 조합으로 표현하기 위해 Sherman-Morrison-Woodbury(SMW) 공식을 사용한다.
  • 매개변수 수가 중간 수준인 레이어의 경우, 부분 샘플링된 기울기로부터 형성된 정규화된 최소 제곱 하위 문제에 스케칭을 적용하여 차원을 감소시킨다.
  • 고차원 레이어의 경우, 기울기를 행렬 곱으로 표현하고, 행렬에 대해 낮은 질서 근사를 적용한 후, 스케칭을 통해 유도된 하위 문제의 해를 가속화한다.
  • 대규모 행렬 연산을 효율적으로 처리하기 위해 SMW 기반 방향 계산을 랜덤 알고리즘과 통합한다.
  • 다중 GPU 환경에서 높은 확장성 효율을 유지하기 위해 통신 감소 전략을 적용한 SENG의 분산 버전을 설계한다.
  • 유사한 가정 조건 하에서 전역 수렴을 보장하기 위해 이론적 수렴성을 확보한다.

실험 결과

연구 질문

  • RQ1랜덤 스케칭 기법은 깊이 신경망에서 경험적 자연 경사 방법의 계산 및 메모리 비용을 효과적으로 줄일 수 있는가, 동시에 수렴 성질을 유지하는가?
  • RQ2대규모 벤치마크에서 SENG는 SGD와 같은 일阶 방법 및 KFAC와 같은 이阶 방법에 비해 학습 속도와 정확도에서 어떻게 비교되는가?
  • RQ3기존 방법과 비교해 높은 확장성 효율을 보이는가?
  • RQ4SENG는 신경 장핵 커널(NTK) 영역에서 빠른 선형 수렴을 달성하는가, 그리고 어떤 가정 조건 하에서인가?
  • RQ5대규모 배치 크기에서도 SENG는 높은 성능과 낮은 에포크당 시간을 유지할 수 있는가, 일반적으로 대규모 배치 학습에서 성능 저하가 발생하는 것을 피할 수 있는가?

주요 결과

  • SENG는 ResNet50을 사용해 ImageNet-1k에서 41 에포크 만에 75.9%의 Top-1 정확도를 달성했으며, 잘 튜닝된 SGD(76 에포크)와 KFAC(42 에포크)보다 총 학습 시간에서 앞서며 성능을 뛰어넘었다.
  • ResNet50/ImageNet-1k에서 SENG는 1 에포크당 663.17초로, KFAC의 712.29초보다 현저히 낮고, 더 높은 매트릭스 업데이트 빈도를 가진 KFAC의 1007.31초보다도 낮은 시간을 기록했다.
  • VGG16_bn을 사용한 CIFAR10에서 SENG는 1 에포크에 18초를 소요했으며, KFAC의 113.37초보다 훨씬 빠른 계산 효율을 보였다.
  • 4에서 32개의 GPU에 걸쳐 SENG는 GPU 확장성 효율을 90% 이상 유지했으며, 이는 분산 대규모 배치 학습 잠재력을 잘 보여준다.
  • 모든 배치 크기(4,096 포함)에서 SENG는 동일한 에포크 수(41)를 기록했으며, 이는 대규모 배치 학습에서의 강력한 내성과 효과성을 입증한다.
  • 이론적 분석을 통해 유사한 가정 조건 하에서 전역 수렴과 NTK 영역에서의 선형 수렴을 확인했으며, 이는 실용적 효용성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.