[논문 리뷰] On the infinite width limit of neural networks with a standard parameterization
이 논문은 일관된 학습률 스케일링을 유지하고 상대적 레이어 너비 영향을 보존하며 폭이 무한대에 가까워질 때 안정적인 기울기 흐름을 보장하는 신경망을 위한 개선된 표준 파arameterization을 제안한다. NTK나 단순 표준 파arameterization과는 달리, 이는 발산하지 않는 잘 정의된 신경접선핵(Neural Tangent Kernel)을 도출하며, 유한한 너비에서의 학습 동역학과 더 잘 일치하고 실험적으로 유사하거나 우수한 성능을 달성한다.
There are currently two parameterizations used to derive fixed kernels corresponding to infinite width neural networks, the NTK (Neural Tangent Kernel) parameterization and the naive standard parameterization. However, the extrapolation of both of these parameterizations to infinite width is problematic. The standard parameterization leads to a divergent neural tangent kernel while the NTK parameterization fails to capture crucial aspects of finite width networks such as: the dependence of training dynamics on relative layer widths, the relative training dynamics of weights and biases, and overall learning rate scale. Here we propose an improved extrapolation of the standard parameterization that preserves all of these properties as width is taken to infinity and yields a well-defined neural tangent kernel. We show experimentally that the resulting kernels typically achieve similar accuracy to those resulting from an NTK parameterization, but with better correspondence to the parameterization of typical finite width networks. Additionally, with careful tuning of width parameters, the improved standard parameterization kernels can outperform those stemming from an NTK parameterization. We release code implementing this improved standard parameterization as part of the Neural Tangents library at https://github.com/google/neural-tangents.
연구 동기 및 목표
- 기존의 무한 너비 신경망 파arameterization에서 유한 너비 학습 동역학을 유지하지 못하는 모순을 해결하기 위해.
- 너비가 증가함에 따라 발산하는 단순 표준 파arameterization에서의 신경접선핵 문제를 해결하기 위해.
- 실제 학습 관행과 일치하는 안정적이고 유한한 학습률 스케일을 무한 너비 근사에서 유지하기 위해.
- NTK 파arameterization과 달리, 가중치와 편향의 상대적 학습 동역학이 유지되도록 하기 위해.
- 잘 정의된 신경접선핵을 도출하면서도 일반적인 유한 너비 네트워크 행동과 밀접하게 일치하는 파arameterization을 개발하기 위해.
제안 방법
- 각 레이어의 너비를 $ n^l = sN^l $로 설정하고 $ s \to \infty $로 갈 때 무한 너비 근사를 도입하기 위해 너비 스케일링 인자 $ s $ 를 도입한다.
- 아핀 레이어를 $ z^{l+1} = \frac{1}{\sqrt{s}} W^l y^l + b^l $ 로 재정의하며, $ W^l \sim \mathcal{N}(0, \sigma_w^2 / N^l) $ 이 되도록 하여 분산 스케일링을 유지한다.
- 무한 너비 근사에서 일정한 편향 기여를 유지하기 위해 $ b^l \sim \mathcal{N}(0, \sigma_b^2) $ 를 사용한다.
- 이 파arameterization에서 유도된 무한 너비 NNGP 및 NTK 커널을 도출하여 잘 정의된 형태로 수렴함을 보인다.
- 몬테카를로 시뮬레이션을 통해 커널 동역학을 검증하고 Neural Tangents 라이브러리에 통합한다.
- 일반화 성능을 최적화하기 위해 레이어 너비 $ N^l $ 를 튜닝하며, 특정 설정에서 NTK 커널보다 뛰어난 성능을 보임을 입증한다.
실험 결과
연구 질문
- RQ1단순 파arameterization을 무한 너비로 확장할 수 있을까? 이 경우 신경접선핵이 발산하거나 유한 너비 학습 동역학을 상실하지 않는가?
- RQ2개선된 표준 파arameterization은 무한 너비 근사에서 레이어 너비의 상대적 영향이 유지되는가?
- RQ3레이어 너비 파arameter를 정교하게 튜닝할 경우, 개선된 표준 파arameterization은 NTK 파arameterization보다 더 좋은 일반화 성능을 달성할 수 있는가?
- RQ4무한 너비에서 개선된 표준 파arameterization과 NTK 파arameterization 간에 가중치와 편향의 학습 역학은 어떻게 비교되는가?
- RQ5개선된 표준 파arameterization은 실질적인 유한 너비 네트워크 학습을 더 잘 반영하는 신경접선핵을 도출하는가?
주요 결과
- 개선된 표준 파arameterization은 발산하지 않는 잘 정의된 신경접선핵을 도출하며, 이는 단순 표준 파arameterization과는 다르다.
- 유도된 커널은 완전히 연결된 ReLU 네트워크에서 NTK 파arameterization과 유사한 테스트 정확도를 달성한다.
- 레이어 너비 $ N^l $ 를 정교하게 튜닝함으로써, 개선된 표준 파arameterization은 완전히 연결된 네트워크에서 일반화 성능에서 NTK 파arameterization을 능가할 수 있다.
- 개선된 파arameterization은 레이어 너비의 상대적 영향이 유지되며, 이는 NTK 파arameterization에서 너비가 증가함에 따라 상실되는 바이다.
- 가중치와 편향의 상대적 학습 동역학이 유지되며, 이는 NTK 파arameterization에서 편향이 과도하게 강조되는 것과는 다르다.
- 편향 기여는 너비가 증가함에 따라 일정하게 유지되며, 가중치 기여는 $ N^l $ 비례로 증가하므로 넓은 네트워크에서는 편향의 영향력이 감소한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.