Skip to main content
QUICK REVIEW

[논문 리뷰] The Effect of Network Width on Stochastic Gradient Descent and Generalization: an Empirical Study

Daniel Park, Jascha Sohl‐Dickstein|arXiv (Cornell University)|2019. 05. 09.
Stochastic Gradient Optimization Techniques참고 문헌 34인용 수 16
한 줄 요약

이 논문은 네트워크의 너비가 확률적 경사 하강법(SGD) 최적화 및 일반화에 미치는 영향을 조사하며, 가중치 초기화와 파rameterization를 고려한 정규화된 노이즈 스케일을 도입한다. 이 연구는 최적의 테스트 정확도가 이 노이즈 스케일이 너비에 비례할 때 도달되며, 이는 왜 더 넓은 네트워크가 더 잘 일반화되고, 배치 정규화가 없는 경우 최적의 배치 크기가 너비에 따라 감소하는지를 설명한다.

ABSTRACT

We investigate how the final parameters found by stochastic gradient descent are influenced by over-parameterization. We generate families of models by increasing the number of channels in a base network, and then perform a large hyper-parameter search to study how the test error depends on learning rate, batch size, and network width. We find that the optimal SGD hyper-parameters are determined by a "normalized noise scale," which is a function of the batch size, learning rate, and initialization conditions. In the absence of batch normalization, the optimal normalized noise scale is directly proportional to width. Wider networks, with their higher optimal noise scale, also achieve higher test accuracy. These observations hold for MLPs, ConvNets, and ResNets, and for two different parameterization schemes ("Standard" and "NTK"). We observe a similar trend with batch normalization for ResNets. Surprisingly, since the largest stable learning rate is bounded, the largest batch size consistent with the optimal normalized noise scale decreases as the width increases.

연구 동기 및 목표

  • 네트워크 너비가 SGD의 최적 하이퍼파라미터와 최종 테스트 정확도에 미치는 영향을 이해하는 것.
  • 배치 정규화가 없는 경우에도 SGD의 최적 노이즈 스케일이 네트워크 너비에 따라 달라지는지 조사하는 것.
  • 가중치 초기화와 파rameterization를 보정한 정규화된 노이즈 스케일이 다양한 아키텍처에서 최적의 훈련 성능을 예측할 수 있는지 평가하는 것.
  • 최적의 노이즈 조건 하에서 넓은 네트워크가 안정적인 학습률과 최대 배치 크기에 미치는 영향을 탐구하는 것.

제안 방법

  • 기본 네트워크의 채널 수를 늘려 모델의 가족을 생성함으로써 선형적인 모델 가족을 구성하고 네트워크 너비를 다양하게 조절함.
  • 학습률, 배치 크기, 너비에 대한 광범위한 하이퍼파라미터 서치를 수행하며, '표준' 및 'NTK' 파arameterization 방식을 모두 사용함.
  • 핵심 지표로는 정규화된 노이즈 스케일 $ g = \frac{\epsilon N_{\text{train}}}{B \cdot \sigma^2} $ 이며, 여기서 $ \sigma $ 는 초기화 시 가중치 스케일임.
  • 다양한 너비와 하이퍼파라미터 조건에서의 테스트 정확도를 비교하여 각 너비에 대한 최적의 하이퍼파라미터 설정을 도출함.
  • MLP, ConvNets, ResNets를 대상으로 배치 정규화 유무에 관계없이 분석함.
  • 다양한 아키텍처와 파arameterization 방식에서 정규화된 노이즈 스케일의 강건성을 검증하며, 성능 지표로는 후기 시점의 평균 테스트 정확도를 사용함.

실험 결과

연구 질문

  • RQ1네트워크 너비는 SGD의 최적 하이퍼파라미터(학습률 및 배치 크기)와 일반화에 어떻게 영향을 미치는가?
  • RQ2다양한 네트워크 너비에서 최적의 테스트 정확도를 예측할 수 있는 단일한 정규화된 노이즈 스케일이 존재하는가?
  • RQ3최적의 노이즈 스케일과 너비의 관계가 다양한 아키텍처(MLP, ConvNet, ResNet)와 파arameterization 방식에서 유지되는가?
  • RQ4배치 정규화는 너비와 최적의 노이즈 스케일 간의 관계에 어떤 영향을 미치는가?
  • RQ5수치적 안정성은 네트워크 너비가 증가함에 따라 최대 배치 크기에 어떤 제약을 가하는가?

주요 결과

  • 배치 정규화가 없는 경우, MLP, ConvNets, ResNets 전반에 걸쳐 최적의 정규화된 노이즈 스케일이 네트워크 너비에 직접 비례함.
  • 더 넓은 네트워크는 훈련 중 더 높은 노이즈 스케일을 견디고 이를 유리하게 활용할 수 있기 때문에 더 높은 테스트 정확도를 달성함.
  • 가장 안정적인 학습률은 상한선에 의해 제한되며, 이는 최적의 노이즈 스케일을 유지하는 데 필요한 최대 배치 크기가 너비 증가에 따라 감소하도록 유도함.
  • NTK 및 표준 파arameterization 모두에서, 안정성을 위해 학습률을 조정할 경우 최적의 배치 크기가 너비에 반비례함.
  • 배치 정규화가 있는 경우, ResNets는 너비 비례 노이즈 스케일 경향을 따르지만, ConvNets는 그렇지 않아 아키텍처 및 정규화에 따라 다른 행동을 보임.
  • 이 연구는 추가적인 정규화가 적용되지 않는 한, 테스트 정확도가 포화 상태에 도달할 수 있는 임계 너비가 존재할 수 있으며, 이는 도달 가능한 노이즈 스케일의 상한선 때문임을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.