Skip to main content
QUICK REVIEW

[논문 리뷰] Bayes-optimal Learning of Deep Random Networks of Extensive-width

Hugo Cui, Florent Krząkała|arXiv (Cornell University)|2023. 02. 01.
Machine Learning and Algorithms인용 수 6
한 줄 요약

이 논문은 가우시안 입력을 가진 깊고 광범위한 너비를 가진 랜덤 신경망에서 베이즈 최적의 테스트 오차에 대한 폐쇄형 표현을 유도한다. 이는 새로운 가우시안 등가성 성질(GEP) 추측을 사용하여 이루어지며, 릿지 및 커널 회귀가 선형 증가하는 샘플 규모에서 베이즈 최적성을 달성하는 것으로 보여진다. 반면 샘플 수가 차원보다 더 빠르게 증가할 경우 신경망이 이러한 방법들을 능가하여 과다 매개변수화된 설정에서의 우수성을 입증한다.

ABSTRACT

We consider the problem of learning a target function corresponding to a deep, extensive-width, non-linear neural network with random Gaussian weights. We consider the asymptotic limit where the number of samples, the input dimension and the network width are proportionally large. We propose a closed-form expression for the Bayes-optimal test error, for regression and classification tasks. We further compute closed-form expressions for the test errors of ridge regression, kernel and random features regression. We find, in particular, that optimally regularized ridge regression, as well as kernel regression, achieve Bayes-optimal performances, while the logistic loss yields a near-optimal test error for classification. We further show numerically that when the number of samples grows faster than the dimension, ridge and kernel methods become suboptimal, while neural networks achieve test error close to zero from quadratically many samples.

연구 동기 및 목표

  • 깊고 광범위한 너비를 가진 랜덤 신경망에 대해 가우시안 입력을 가진 정보이론적으로 최소화된 테스트 오차(베이즈 최적 오차)를 규명하는 것.
  • 릿지 및 커널 회귀와 같은 표준 경험 리스크 최소화(ERM) 방법이 이 베이즈 최적 오차를 달성할 수 있는지 확인하는 것.
  • 샘플 수가 입력 차원보다 더 빠르게 증가할 경우 선형 방법과 신경망 간의 성능 격차를 조사하는 것.
  • 깊은 베이즈 가우시안 등가성 성질(GEP)을 통해 딥 러닝의 일반화를 이론적으로 이해하는 기초를 마련하는 것.

제안 방법

  • 딥 베이즈 가우시안 등가성 성질(GEP) 추측을 제안하여 깊은 랜덤 네트워크의 출력 통계가 베이지안 추론 하에서 가우시안 프로세스와 연결됨을 밝힘.
  • 비례 규모에서(n ∝ d) 통계역학 및 渐近 분석을 사용하여 회귀 및 분류 문제에 대한 베이즈 최적 테스트 오차에 대한 폐쇄형 표현을 유도.
  • 레플리카 방법과 캐비티 방법을 적용하여 릿지, 커널, 랜덤 피처 회귀의 점근적 테스트 오차를 계산.
  • 석점 방정식과 모멘트 매칭 기법을 사용하여 고차원 극한에서 릿지 및 로지스틱 회귀의 일반화 오차를 특성화.
  • n이 d를 초과하여 증가하는 영역을 탐색하기 위해 수치 시뮬레이션을 수행하며, 이는 GEP의 적용 가능 범위를 초월함.
  • 무한한 너비 극한에서 베이지안 추론과 커널 방법 간의 등가성을 기반으로 하되, 이는 광범위한 너비 네트워크로 확장됨.
Figure 1: (solid lines) Theoretical predition for the Bayes MSE ( 12 ), for a one-hidden layer rectangular neural network ( $\gamma_{1}=1$ ) with shifted ReLU activation $\sigma_{1}(\cdot)=(\cdot)_{+}-\nicefrac{{1}}{{\sqrt{2\pi}}}$ . (red crosses) Monte Carlo simulations using the Gibbs sampling alg
Figure 1: (solid lines) Theoretical predition for the Bayes MSE ( 12 ), for a one-hidden layer rectangular neural network ( $\gamma_{1}=1$ ) with shifted ReLU activation $\sigma_{1}(\cdot)=(\cdot)_{+}-\nicefrac{{1}}{{\sqrt{2\pi}}}$ . (red crosses) Monte Carlo simulations using the Gibbs sampling alg

실험 결과

연구 질문

  • RQ1깊고 광범위한 너비를 가진 랜덤 신경망과 가우시안 입력을 가진 경우, 점근적 베이즈 최적 테스트 오차는 무엇인가?
  • RQ2릿지 및 커널 회귀가 이러한 네트워크에서 비례 규모(n ∝ d)에서 베이즈 최적 오차를 달성할 수 있는가?
  • RQ3n이 d를 초과하여 증가할 경우, 릿지 및 커널 방법의 성능은 기울기로 훈련된 신경망과 비교해 어떻게 되는가?
  • RQ4딥 베이즈 가우시안 등가성 성질(GEP)은 폐쇄형 오차 표현 유도에 있어 어떤 역할을 하는가?
  • RQ5로지스틱 회귀는 깊은 랜덤 네트워크를 사용한 분류 과제에서 거의 최적의 성능을 달성하는가?

주요 결과

  • 회귀 문제에서 최적의 정규화를 가진 릿지 및 커널 회귀가 베이즈 최적 테스트 오차를 달성하며, 최적 정규화 파라미터에 대한 폐쇄형 표현이 도출됨.
  • 분류 문제에서는 릿지 및 로지스틱 회귀가 베이즈 최적 오차에 매우 가까운 테스트 오차를 제공하지만, 정확히 일치하지는 않아 근사 최적성으로 간주됨.
  • 샘플 수가 입력 차원을 초과하여 증가하는 영역(n ≫ d)에서는 릿지 및 커널 방법이 최적이 아니며, 기울기로 훈련된 신경망은 테스트 오차가 거의 0에 가까워짐.
  • 딥 베이즈 가우시안 등가성 성질(GEP)은 비례 규모에서 점근적으로 성립할 것으로 추측되며, 이는 폐쇄형 오차 표현 유도의 기초가 됨.
  • 수치 결과는 과다 매개변수화된 설정에서 신경망이 선형 방법보다 뚜렷이 뛰어남을 확인하며, 이는 그들의 인덕티브 바이어스 우수성에 기인함.
  • 이 연구는 가우시안 입력 가정 하에 선형 추정기들이 선형적으로 많은 샘플에서 광범위한 너머의 네트워크의 선형 성분 이외의 것을 학습할 수 없다고 규명함.
Figure 2: Targets ( 1 ) with $L=1$ (top) and $L=2$ (bottom) hidden layers , with $\sigma_{1,2}(x)=\tanh(2x)$ activation, widths $k_{1,2}=700$ , and $\Delta_{a}=\Delta_{1,2}=1,~{}\Delta=0$ , in dimension $d=500$ . The Bayes-optimal MSE ( 12 ) (dashed black) is contrasted to the replica predictions an
Figure 2: Targets ( 1 ) with $L=1$ (top) and $L=2$ (bottom) hidden layers , with $\sigma_{1,2}(x)=\tanh(2x)$ activation, widths $k_{1,2}=700$ , and $\Delta_{a}=\Delta_{1,2}=1,~{}\Delta=0$ , in dimension $d=500$ . The Bayes-optimal MSE ( 12 ) (dashed black) is contrasted to the replica predictions an

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.