[논문 리뷰] Minimum weight norm models do not always generalize well for over-parameterized problems
이 논문은 과다 매개변수화된 설정에서 최소 무게 노름 해가 가장 잘 일반화된다는 가정을 도전한다. 단순화된 및 실제 딥러닝 시나리오에서의 경험적 분석을 통해, 적응형 최적화 방법이 SGD보다도 성능을 뛰어넘을 수 있음을 보여주며, 이는 무게 노름 최소화가 일반화 성능의 보편적 지표가 아니라는 것을 시사한다.
This work is substituted by the paper in arXiv:2011.14066. Stochastic gradient descent is the de facto algorithm for training deep neural networks (DNNs). Despite its popularity, it still requires fine tuning in order to achieve its best performance. This has led to the development of adaptive methods, that claim automatic hyper-parameter optimization. Recently, researchers have studied both algorithmic classes via toy examples: e.g., for over-parameterized linear regression, Wilson et. al. (2017) shows that, while SGD always converges to the minimum-norm solution, adaptive methods show no such inclination, leading to worse generalization capabilities. Our aim is to study this conjecture further. We empirically show that the minimum weight norm is not necessarily the proper gauge of good generalization in simplified scenaria, and different models found by adaptive methods could outperform plain gradient methods. In practical DNN settings, we observe that adaptive methods can outperform SGD, with larger weight norm output models, but without necessarily reducing the amount of tuning required.
연구 동기 및 목표
- 과다 매개변수화된 머신러닝 문제에서 최소 무게 노름 해가 일관되게 더 잘 일반화되는지 조사하기.
- 단순화된 및 실제 딥 네트워크 설정에서 SGD에 비해 적응형 최적화 방법의 일반화 성능 평가하기.
- SGD의 최소 노름 인덕티브 바이어스가 좋은 일반화를 위해 필수 조건인지 결정하기.
- 최소 노름 해로 수렴하지는 않지만 여전히 뛰어난 일반화 성능을 달성할 수 있는가를 평가하기.
제안 방법
- 과다 매개변수화된 선형 회귀 모델에서 최적화 동역학을 경험적으로 평가하여 단순화된 시험대로 활용하기.
- 통제된 과다 매개변수화된 설정에서 SGD와 적응형 방법(예: Adam, RMSProp) 간의 일반화 성능 비교하기.
- 다양한 최적화 방법에서 무게 노름 크기와 일반화 오차 간의 관계 분석하기.
- SGD와 적응형 방법을 사용한 실질적인 딥 네트워크 훈련 평가하여 테스트 정확도와 무게 노름 크기 측정하기.
- 노름 최소화가 아닌 최적화 방법 간의 일반화 행동의 괴리 정도를 설명하기 위해 토이 예제 사용하기.
- 단순화된 및 실제 DNN 설정 모두에서 무게 노름 크기와 무관하게 모델의 일반화 성능 관찰하기.
실험 결과
연구 질문
- RQ1과다 매개변수화된 문제에서 최소 무게 노름 해가 항상 더 잘 일반화되는가?
- RQ2적응형 최적화 방법이 더 큰 무게 노름을 유도함에도 불구하고 일반화 성능에서 SGD를 능가할 수 있는가?
- RQ3SGD의 최소 노름 인덕티브 바이어스는 딥러닝에서 좋은 일반화를 위해 충분하거나 필수 조건인가?
- RQ4실제 딥 네트워크 훈련 시나리오에서 적응형 방법의 일반화 성능는 SGD와 어떻게 비교되는가?
주요 결과
- 최소 무게 노름 해가 과다 매개변수화된 문제에서 보편적으로 더 잘 일반화되는 것은 아니며, 널리 공유된 가정을 도전한다.
- Adam과 같은 적응형 방법은 더 큰 무게 노름을 유도함에도 불구하고 일반화 성능에서 SGD를 능가할 수 있다.
- 단순 선형 회귀 설정에서는 적응형 방법이 SGD보다 일반화 성능이 열 劣하지만, 실질적인 DNN에서는 종종 SGD를 능가한다.
- SGD와 적응형 방법 간의 성능 격차는 무게 노름 크기 때문만은 아니며, 일반화에 영향을 주는 다른 요소들이 존재함을 시사한다.
- 어떤 경우에서는 SGD를 능가하지만, 적응형 방법 역시 여전히 다량의 하이퍼파rameter 튜닝이 필요하며, 이는 자동 최적화라는 주장과 모순된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.