Skip to main content
QUICK REVIEW

[논문 리뷰] Neumann Optimizer: A Practical Optimization Algorithm for Deep Neural Networks

Shankar Krishnan, Ying Xiao|arXiv (Cornell University)|2017. 12. 08.
Advanced Neural Network Applications참고 문헌 36인용 수 3
한 줄 요약

Neumann 최적화기는 헤시안 행렬의 직접 계산이나 헤시안-벡터 곱을 피하는 네이만 급수 전개를 통해 은닉적으로 헤시안 역행렬 방향을 계산하는 실용적인 이阶 수반 확률적 최적화 알고리즘으로, 딥 네URAL 네트워크에 적합하다. 이 알고리즘은 학습률 조정 외에 추가 하이퍼파rameter 조정이 필요 없으며, Adam과 유사한 계산 비용을 유지를 하면서도, 검증 정확도가 저하되지 않은 채로 최대 32,000의 미니배치 크기까지 선형 스케일링을 달성하며, 더 작은 배치에서 일반화 성능을 0.8–0.9% 향상시킨다.

ABSTRACT

Progress in deep learning is slowed by the days or weeks it takes to train large models. The natural solution of using more hardware is limited by diminishing returns, and leads to inefficient use of additional resources. In this paper, we present a large batch, stochastic optimization algorithm that is both faster than widely used algorithms for fixed amounts of computation, and also scales up substantially better as more computational resources become available. Our algorithm implicitly computes the inverse Hessian of each mini-batch to produce descent directions; we do so without either an explicit approximation to the Hessian or Hessian-vector products. We demonstrate the effectiveness of our algorithm by successfully training large ImageNet models (Inception-V3, Resnet-50, Resnet-101 and Inception-Resnet-V2) with mini-batch sizes of up to 32000 with no loss in validation error relative to current baselines, and no increase in the total number of steps. At smaller mini-batch sizes, our optimizer improves the validation error in these models by 0.8-0.9%. Alternatively, we can trade off this accuracy to reduce the number of training steps needed by roughly 10-30%. Our work is practical and easily usable by others -- only one hyperparameter (learning rate) needs tuning, and furthermore, the algorithm is as computationally cheap as the commonly used Adam optimizer.

연구 동기 및 목표

  • 대규모 딥 네URAL 네트워크 학습에서 증가하는 월타임 병목 현상을 해결하기 위해 확장 가능하고 실용적인 최적화 알고리즘을 개발하는 것.
  • 모델 일반화 성능 저하 없이 효율적인 대규모 배치 학습을 가능하게 하여, 일반적으로 존재하는 속도와 정확도 사이의 상충관계를 극복하는 것.
  • 직접 헤시안 근사나 고비용의 헤시안-벡터 곱을 계산하지 않고도 이계 정보를 통합하여 향상된 내림값 방향을 확보하는 것.
  • 학습률 이외에 조정이 필요한 하이퍼파rameter가 하나뿐인 Adam과 동일한 사용 용이성을 확보하면서도, 기존 방법들보다 빠르고 정확도가 높은 성능을 달성하는 최적화기 설계

제안 방법

  • 알고리즘은 각 미니배치의 헤시안을 은닉적으로 역행렬화하는 데에 네이만 급수 전개를 사용하는 중간 최적화 문제를 풀어 내림값 방향을 계산한다.
  • 헤시안 행렬의 직접 표현을 피하기 위해 헤시안 적용을 단일 그래디언트 평가로 대체함으로써 효율적인 계산을 가능하게 한다.
  • 헤시안-벡터 곱이나 헤시안 행렬의 저장 없이도 네이만 급수를 활용해 헤시안 역행렬을 근사한다.
  • 알고리즘은 표준 딥 러닝 학습 파이프라인에 원활하게 통합될 수 있도록 미분 가능한 최적화 단계로 구현된다.
  • 학습률 하나의 하이퍼파rameter만을 사용하며, Adam과 유사한 계산 비용을 유지해 대규모 모델에 실용적으로 적용 가능하다.
  • 이론적 분석은 ResNet-50, ResNet-101, Inception-V3, Inception-ResNet-V2 아키텍처를 사용한 ImageNet에서의 대규모 실험을 통해 검증되었다.

실험 결과

연구 질문

  • RQ1직접 헤시안 계산이나 높은 계산 비용 없이도 이계 최적화 방법을 대규모 딥 러닝에 실용적으로 적용할 수 있는가?
  • RQ2네이만 급수를 통한 은닉 헤시안 역행렬화가 배치 크기가 증가함에 따라 성능을 선형적으로 스케일링하면서도 모델 일반화 성능을 유지할 수 있는가?
  • RQ3기본 최적화기들인 Adam이나 RMSProp과 비교해 작은 미니배치 크기에서 Neumann 최적화기가 일반화 성능을 향상시킬 수 있는가?
  • RQ4기울기 클리핑이 일반적인 순서-순서 RNN 모델과 같은 비시각 모델에서도 최적화기가 잘 작동하는가?

주요 결과

  • Neumann 최적화기는 기준 모델과 비교해 검증 정확도가 저하되지 않은 채로 ResNet-50에서 최대 32,000의 미니배치 크기까지 선형 스케일링을 달성한다.
  • 더 작은 미니배치 크기(예: 4,000)에서 모든 평가된 모델에서 top-1 검증 오차가 0.8–0.9% 향상되었으며, 이는 훈련 손실에 변화가 없음에도 불구하고 성립한다.
  • 일반화 성능 향상은 더 빠른 훈련으로 전환 가능하다: 기준 정확도를 유지하면서 반복 수를 10–30% 줄일 수 있다.
  • 알고리즘은 Adam과 유사한 계산 비용을 유지하며, 학습률 조정 외에 추가 설정이 필요 없고, 실질적으로 쉽게 구현할 수 있다.
  • 정규화 기법을 추가하면 성능이 더욱 향상되며, 배치 크기 4,000에서 ResNet-50의 top-1 오차는 정규화 없이 23.5%에서 정규화 시 23.0%로 감소한다.
  • 시퀀스-투-시퀀스 Tacotron 모델에서는 최적화기가 성능 향상을 이룰 수 없었으며, 이는 극단적인 기울기 클리핑 상황에서 헤시안 근사가 붕괴되기 때문일 것으로 추정된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.