Skip to main content
QUICK REVIEW

[논문 리뷰] Proportionate gradient updates with PercentDelta

Sami Abu-El-Haija|arXiv (Cornell University)|2017. 08. 24.
Tensor decomposition and applications참고 문헌 10인용 수 5
한 줄 요약

이 논문은 각 학습 가능한 텐서의 L1-노름에 비례하여 기울기를 스케일링하는 기울기 업데이트 규칙인 PercentDelta를 제안한다. 이는 딥 네ural 네트워크의 모든 레이어가 동일한 상대적 속도로 학습되도록 보장한다. 모든 텐서의 평균 L1-노름을 통해 기울기를 정규화함으로써, 고정된 학습 예산 조건에서도 SGD, Adam, AdaGrad, LARS와 비교해 더 빠른 수렴 속도와 높은 테스트 정확도를 달성한다.

ABSTRACT

Deep Neural Networks are generally trained using iterative gradient updates. Magnitudes of gradients are affected by many factors, including choice of activation functions and initialization. More importantly, gradient magnitudes can greatly differ across layers, with some layers receiving much smaller gradients than others. causing some layers to train slower than others and therefore slowing down the overall convergence. We analytically explain this disproportionality. Then we propose to explicitly train all layers at the same speed, by scaling the gradient w.r.t. every trainable tensor to be proportional to its current value. In particular, at every batch, we want to update all trainable tensors, such that the relative change of the L1-norm of the tensors is the same, across all layers of the network, throughout training time. Experiments on MNIST show that our method appropriately scales gradients, such that the relative change in trainable tensors is approximately equal across layers. In addition, measuring the test accuracy with training time, shows that our method trains faster than other methods, giving higher test accuracy given same budget of training steps.

연구 동기 및 목표

  • 딥 네ural 네트워크에서 레이어 간 기울기 크기의 비균형 문제를 해결함으로써 전체 학습 속도 저하를 방지한다.
  • 역전파를 사용한 4층 피드포워드 네트워크에서 기울기 흐름을 분석함으로써 비균형 학습 현상을 체계화한다.
  • 초기 가중치 크기나 활성화 함수에 관계없이 모든 레이어 간 상대적 변화율을 명시적으로 동일하게 맞추는 방법을 제안한다.
  • 고정된 학습 예산 조건에서 비례 학습이 더 빠른 수렴 속도와 높은 테스트 정확도를 이끌어내는 것으로 실험적으로 입증한다.

제안 방법

  • 각 레이어의 기울기를 모든 학습 가능한 텐서의 평균 L1-노름으로 나누어 기울기를 스케일링함으로써, 레이어 간 상대적 변화가 비례하도록 보장한다.
  • 업데이트 규칙은 다음과 같이 정의된다: $ \Delta W_j = \eta \cdot \gamma(t) \cdot \frac{\partial J}{\partial W_j} \cdot \frac{\|W_j\|_1}{\text{mean}(\|W_k\|_1)} $, 여기서 $ \|W_j\|_1 $는 j번째 가중치 텐서의 L1-노름이다.
  • 학습률 스케줄 $ \gamma(t) $ 는 선형 감소하며, 발산을 방지하기 위해 최소 임계값 $ \beta $ 를 가진다.
  • 기존의 모멘텀과 호환되며, 최소한의 수정으로 어떤 최적화기에도 적용 가능하다.
  • 이 방법은 모든 학습 단계에서 각 텐서의 L1-노름 상대적 변화가 거의 동일하게 유지됨을 보장한다.
  • 알고리즘은 하이퍼파ram터가 합리적인 범위 내에 있을 경우, 그 선택에 대해 민감하지 않도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1딥 네ural 네트워크에서 기울기 크기가 왜 레이어 간에 크게 다를지, 그리고 이로 인해 학습 속도에 어떤 영향을 미치는가?
  • RQ2모든 레이어 간 상대적 변화율을 명시적으로 동일하게 맞출 수 있는가? 이를 통해 학습 수렴을 향상시킬 수 있는가?
  • RQ3비례 기울기 스케일링이 기존 최적화 방법에 비해 더 빠른 수렴 속도와 높은 테스트 정확도를 제공하는가?
  • RQ4비례 학습이 어떤 모델 아키텍처에서 가장 유익한가?
  • RQ5학습률 및 감쇠 스케줄과 같은 하이퍼파ram터 선택에 대해 제안된 방법은 얼마나 견고한가?

주요 결과

  • 고정된 학습 스텝 수로 학습했을 때, PercentDelta는 MNIST 데이터셋에서 SGD, Adam, AdaGrad, LARS보다 높은 테스트 정확도를 달성한다.
  • 이 방법은 모든 학습 가능한 텐서의 L1-노름 상대적 변화가 모든 레이어에서 매 학습 단계에서 거의 동일하게 유지됨을 보장한다.
  • 실험 결과, PercentDelta는 기준 방법보다 더 빠르게 학습을 진행하며, 동일한 학습 예산 조건에서 더 높은 성능을 달성한다.
  • 학습률 $ \eta $ 와 모멘텀 파ram터 $ m $ 의 하이퍼파ram터 선택에 대해 매우 견고하며, 합리적인 범위 내에서는 문제가 없다.
  • PercentDelta는 모멘텀과 호환되며, 기존 최적화기와의 통합이 매우 간편하다.
  • 이 방법은 특히 기울기 기여가 균형 잡히지 않은 상황, 예를 들어 임베딩과 네트워크를 동시에 학습할 때, 소프트 어텐션 모델, 전역 바이어스가 있는 행렬 분해 등에서 가장 유익하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.