Skip to main content
QUICK REVIEW

[논문 리뷰] The Onset of Variance-Limited Behavior for Networks in the Lazy and Rich Regimes

Alexander Atanasov, Blake Bordelon|arXiv (Cornell University)|2022. 12. 23.
Model Reduction and Neural Networks인용 수 4
한 줄 요약

이 논문은 넓은 신경망에서 분산 제한 일반화의 시작 시점을 규명하며, 유한한 너비 효과가 훈련 세트 크기 $ P^* \sim \sqrt{N} $ 에서 두드러지게 나타나며, 이 시점 이후로 일반화 성능이 무한 너비 성능 이하로 떨어진다는 것을 보여준다. 저자들은 이 현상이 최종 신경 기저 커널(Neural Tangent Kernel, NTK)의 변동성과 관련이 있음을 밝혀내었으며, 특징 학습과 앙상블 평균화가 분산을 억제하고 이 크리티컬 $ P^* $ 이후로도 일반화 성능을 향상시킨다는 것을 입증한다.

ABSTRACT

For small training set sizes $P$, the generalization error of wide neural networks is well-approximated by the error of an infinite width neural network (NN), either in the kernel or mean-field/feature-learning regime. However, after a critical sample size $P^*$, we empirically find the finite-width network generalization becomes worse than that of the infinite width network. In this work, we empirically study the transition from infinite-width behavior to this variance limited regime as a function of sample size $P$ and network width $N$. We find that finite-size effects can become relevant for very small dataset sizes on the order of $P^* \sim \sqrt{N}$ for polynomial regression with ReLU networks. We discuss the source of these effects using an argument based on the variance of the NN's final neural tangent kernel (NTK). This transition can be pushed to larger $P$ by enhancing feature learning or by ensemble averaging the networks. We find that the learning curve for regression with the final NTK is an accurate approximation of the NN learning curve. Using this, we provide a toy model which also exhibits $P^* \sim \sqrt{N}$ scaling and has $P$-dependent benefits from feature learning.

연구 동기 및 목표

  • 유한 너비 신경망이 무한 너비 신경망보다 일반화 성능이 열 劣하기 시작하는 비중 훈련 세트 크기 $ P^* $ 를 규명하는 것.
  • 신경 기저 커널(NTK)의 분산이 유한 너비 일반화 오차를 유도하는 방식을 이해하는 것.
  • 특징 학습과 앙상블 평균화가 분산 제한 행동을 얼마나 억제할 수 있는지 조사하는 것.
  • 최종 경험적 NTK(eNTK f )를 사용한 커널 회귀와 신경망 학습 곡선 간의 대응 관계를 검증하는 것.
  • 실제 네트워크에서 관찰된 주요 스케일링 행동을 재현하는 토이 무작위 특징 모델을 구축하는 것.

제안 방법

  • 다양한 너비 $ N $, 훈련 세트 크기 $ P $, 출력 스케일 $ \alpha $ 를 가진 ReLU 네트워크를 다항 회귀에 대해 실험적으로 분석하여 러디와 리치 영역 간의 조절을 수행한다.
  • 최종 경험적 NTK(eNTK f )를 사용하여 신경망의 일반화 오차를 근사하고, 실제 학습 곡선과의 강한 일치를 보여준다.
  • 랜덤 초기화 간의 최종 NTK 분산을 분석하여 유한 너비 변동성을 정량화한다.
  • 모델 평균화와 데이터 증강을 통해 앙상블 평균화를 적용하여 분산 유도 오차를 감소시킨다.
  • 노이즈가 포함된 무작위 특징 모델을 도입하여 $ P^* \sim \sqrt{N} $ 스케일링과 특징 학습에 의한 정렬 기반 향상 효과를 분석적으로 재현한다.
  • 다른 네트워크 깊이, 입력 차원, 중심화 방법 간의 일반화 오차와 분산을 비교하여 아키텍처 효과를 분리한다.

실험 결과

연구 질문

  • RQ1유한 너비 신경망이 무한 너비 신경망보다 일반화 성능이 열 劣하기 시작하는 훈련 세트 크기 $ P $ 는 어느 정도인가?
  • RQ2최종 신경 기저 커널(NTK)의 분산이 유한 너비 일반화 오차를 어떻게 유도하는가?
  • RQ3특징 학습과 앙상블 평균화가 유한 너머에서 분산 제한 행동을 얼마나 억제할 수 있는가?
  • RQ4최종 경험적 NTK(eNTK f )를 사용한 커널 회귀는 실제 신경망 학습 곡선을 얼마나 잘 근사하는가?
  • RQ5간단한 무작위 특징 모델이 관찰된 $ P^* \sim \sqrt{N} $ 스케일링과 특징 학습의 이점을 재현할 수 있는가?

주요 결과

  • ReLU 네트워크가 다항 회귀에서 유한 너비 네트워크가 무한 너비 네트워크보다 성능이 열 劣하기 시작하는 임계 샘플 크기 $ P^* $ 는 $ P^* \sim \sqrt{N} $ 으로 스케일링된다.
  • 유한 너비 네트워크의 일반화 오차는 랜덤 초기화에 따른 분산에 의해 주로 결정되며, 특히 러디 영역에서 분산 제한 영역을 정의한다.
  • 앙상블 평균화가 분산을 크게 감소시키고 일반화 성능을 향상시키며, 특히 분산 제한 영역에서 두드러진다.
  • 작은 출력 스케일 $ \alpha $ 나 고차수 다항식 작업에 의해 유도되는 특징 학습은 $ P^* $ 이전과 이후 모두에서 일반화 성능을 향상시키며, 주로 최종 NTK와 목표 함수 간의 정렬을 향상시킴으로써 기여한다.
  • 신경망의 학습 곡선은 최종 경험적 NTK(eNTK f )를 사용한 커널 회귀에 의해 잘 근사되며, 이는 네트워크 행동의 대체 측정 기준으로서 eNTK f 의 타당성을 검증한다.
  • 토이 무작위 특징 모델은 $ P^* \sim \sqrt{N} $ 스케일링과 특징 학습에 의한 정렬 기반 이점을 재현하며, 관찰된 현상의 메커니즘을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.