Skip to main content
QUICK REVIEW

[논문 리뷰] More Than a Toy: Random Matrix Models Predict How Real-World Neural Representations Generalize

Alexander Wei, Wei Hu|arXiv (Cornell University)|2022. 03. 11.
Neural Networks and Applications인용 수 8
한 줄 요약

이 논문은 과다매개변수화된 신경망에서 일반화 리스크를 정확하게 예측하는 데 랜덤 매트릭스 이론, 특히 일반화된 교차검증(GCV) 추정량이 효과적임을 보여준다. 기존의 노름-기반 및 스펙트럼-기반 경계보다 뛰어난 성능을 보이며, 국소 랜덤 매트릭스 법칙이 성립할 경우 GCV가 진짜 리스크로 수렴함을 증명한다. 또한 사전 훈련된 모델이 더 잘 일반화되는 이유는 고유값 감쇠 외에도 표현 정렬이 핵심 요소임을 밝힌다.

ABSTRACT

Of theories for why large-scale machine learning models generalize despite being vastly overparameterized, which of their assumptions are needed to capture the qualitative phenomena of generalization in the real world? On one hand, we find that most theoretical analyses fall short of capturing these qualitative phenomena even for kernel regression, when applied to kernels derived from large-scale neural networks (e.g., ResNet-50) and real data (e.g., CIFAR-100). On the other hand, we find that the classical GCV estimator (Craven and Wahba, 1978) accurately predicts generalization risk even in such overparameterized settings. To bolster this empirical finding, we prove that the GCV estimator converges to the generalization risk whenever a local random matrix law holds. Finally, we apply this random matrix theory lens to explain why pretrained representations generalize better as well as what factors govern scaling laws for kernel regression. Our findings suggest that random matrix theory, rather than just being a toy model, may be central to understanding the properties of neural representations in practice.

연구 동기 및 목표

  • 과다매개변수화된 딥 러닝 모델에서 실제 세계의 일반화를 포괄하기 위해 필요한 이론적 가정을 규명하는 것.
  • 대규모 신경망과 실제 데이터를 사용한 현실적인 설정에서 고전적 일반화 경계(노름-기반 및 스펙트럼-기반)가 성립하는지 평가하는 것.
  • 사전 훈련된 표현이 고유값 감쇠가 더 느리더라도 왜 무작위 초기화된 표현보다 더 잘 일반화되는지 탐구하는 것.
  • 핵심 기반 회귀에서의 스케일링 법칙을 지배하는 요소를 규명하는 것.
  • 일반화 성능을 예측하기 위해 정렬과 고유값 감쇠를 샘플 효율적으로 추정하는 방법을 개발하는 것.

제안 방법

  • 실제 데이터를 사용해 CIFAR-100에서 ResNet-50 및 ResNet-34의 표현에 대해 커널 리지 회귀의 일반화 리스크를 경험적으로 평가한다.
  • 일반화된 교차검증(GCV) 추정량이 노름-기반 및 스펙트럼-기반 일반화 예측자와의 성능을 비교한다.
  • 국소 랜덤 매트릭스 법칙(Knowles & Yin, 2017)이 성립할 경우, GCV가 진짜 일반화 리스크로 수렴함을 증명한다. 이는 비대칭 공변수와 고노름 진짜 함수 조건 하에서도 성립한다.
  • 최근의 고차원 리지 회귀에 대한 랜덤 매트릭스 분석을 현실적인 신경망 표현으로 일반화한다.
  • GCV 추정량을 활용해 정렬과 고유값 감쇠를 샘플 효율적으로 추정하는 방법을 유도하며, 이는 스케일링 법칙의 예측에 활용된다.
  • 국소 마르첸코-파스트르 법칙을 경험적으로 검증하기 위해 $ f( heta, N) = y^T (XX^T + N heta I)^{-1}y $ 가 $ ilde{ heta}( heta, N) = ig( extstyle extstyle rac{1}{N} extstyle extstyle rac{1}{ heta + ilde{ u}_i} ig)^{-1} $ 에만 의존하는지 테스트한다. 이는 데이터셋 크기 변화에 관계없이 일관성을 확인한다.

실험 결과

연구 질문

  • RQ1노름 또는 스펙트럼 기반 고전적 일반화 경계가 실제 데이터로 훈련된 과다매개변수화된 신경망에서 일반화 리스크를 정확히 예측할 수 있는가?
  • RQ2고유값 감쇠가 더 느리더라도 사전 훈련된 신경망 표현이 왜 무작위 초기화된 표현보다 더 잘 일반화되는가?
  • RQ3핵심 기반 회귀에서 관찰된 스케일링 법칙을 지배하는 요소는 무엇인가?
  • RQ4일반화된 교차검증(GCV) 추정량이 다양한 데이터셋 크기와 정규화 강도에서 일관되게 일반화 리스크를 예측할 수 있는가?
  • RQ5특히 국소 마르첸코-파스트르 법칙을 포함한 랜덤 매트릭스 법칙이 현실적인 딥 러닝 설정에서 얼마나 잘 성립하는가?

주요 결과

  • ResNet-34의 경험적 NTK를 사용해 CIFAR-100에서 19.9%의 테스트 오차를 기록한 GCV 추정량은, 리스크 예측 정확도에서 미세조정된 ResNet(15.9%)를 뛰어넘는다.
  • 노름 기반 일반화 경계는 진짜 함수의 커널 노름이 실제로 무한대에 가까워지기 때문에 빈약하거나 데이터셋 크기가 증가함에 따라 증가한다.
  • GCV 추정량은 다양한 설정에서 정확성을 유지한다: 다양한 데이터셋 크기, 정규화 강도, 모델 아키텍처(ResNet-50, ResNet-34), 데이터(CIFAR-100), 그리고 무작위 및 사전 훈련된 표현 모두 포함된다.
  • 이론적 분석을 통해 국소 랜덤 매트릭스 법칙이 성립할 경우, GCV가 진짜 일반화 리스크로 수렴함을 증명한다. 이는 비대칭 공변수와 고노름 진짜 함수 조건 하에서도 성립한다.
  • 사전 훈련된 표현이 무작위 표현보다 더 잘 일반화되는 것은 고유값 감쇠가 더 빠르기 때문이 아니라, 진짜 함수와 인구 공분산 행렬 간의 정렬이 더 우수하기 때문이다.
  • 랜덤 매트릭스 이론에서 유도된 정렬과 고유값 감쇠에 대한 샘플 효율적인 추정량은 자연 데이터 기반 핵심 기반 회귀의 스케일링 법칙 예측에 정확하게 작용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.