[논문 리뷰] Predicting the Outputs of Finite Networks Trained with Noisy Gradients
이 논문은 노이즈가 있는 기울기, 가중치 감쇠, 유한한 너비를 가진 유한한 너비의 딥 네ural 네트워크(DNN)의 출력을 예측하기 위한 분석 프레임워크를 제안한다. 이 프레임워크는 이러한 네트워크가 무한한 너비 근처에서 신경망 가우시안 프로세스(NNGP)로 수렴함을 보이며, 신경 탄성 커널(NTK)으로 수렴하지는 않음을 밝힌다. 임의의 활성화 함수와 깊이에 대해 유한한 너비 보정(FWC)을 유도하여, 실제 네트워크 출력을 높은 정확도로 예측하고, 이미지 분류 과제에서 GP 기반 모델보다 성능 향상을 크게 이룬다.
A recent line of works studied wide deep neural networks (DNNs) by approximating them as Gaussian Processes (GPs). A DNN trained with gradient flow was shown to map to a GP governed by the Neural Tangent Kernel (NTK), whereas earlier works showed that a DNN with an i.i.d. prior over its parameters maps to the so-called Neural Network Gaussian Process (NNGP). Here we consider a DNN training protocol, involving noise, weight decay and finite width, whose outcome corresponds to a certain non-Gaussian stochastic process. An analytical framework is then introduced to analyze this non-Gaussian process, whose deviation from a GP is controlled by the finite width. Our contribution is three-fold: (i) In the infinite width limit, we establish a correspondence between DNNs trained with noisy gradients and the NNGP, not the NTK. (ii) We provide a general analytical form for the finite width correction (FWC) for DNNs with arbitrary activation functions and depth and use it to predict the outputs of empirical finite networks with high accuracy. Analyzing the FWC behavior as a function of n, the training set size, we find that it is negligible for both the very small n regime, and, surprisingly, for the large n regime (where the GP error scales as O(1/n)). (iii) We flesh-out algebraically how these FWCs can improve the performance of finite convolutional neural networks (CNNs) relative to their GP counterparts on image classification tasks.
연구 동기 및 목표
- 노이즈가 있는 기울기와 가중치 감쇠로 학습된 유한한 너비 DNN의 통계적 행동을 이해하기 위해.
- 주어진 학습 프로토콜 하에서 이러한 DNN과 무한한 너비 근처에서의 신경망 가우시안 프로세스(NNGP) 사이의 이론적 대응 관계를 수립하기 위해.
- 임의의 활성화 함수와 네트워크 깊이에 적용 가능한 일반적인 분석적 형태의 유한한 너비 보정(FWC)을 도출하기 위해.
- 유한한 네트워크의 예측 성능에 대한 FWC의 영향을 정량화하기 위해, 특히 GP 근사치와의 비교를 중심으로.
- FWC가 컨volutional 신경망(CNN)의 일반화 성능을 어떻게 향상시키는지 대수적으로 설명하기 위해.
제안 방법
- 노이즈가 있는 기울기와 가중치 감쇠로 학습된 DNN에서 유한한 너비 보정(FWC)에 대한 일반적인 분석적 표현을 유도하며, 이는 임의의 활성화 함수와 깊이에 적용 가능하다.
- 무한한 너비 근처에서의 펌핑 전개를 사용하여 NNGP에서의 이탈을 모델링하고, 유한한 너비로 인한 비가우시안 효과를 포착한다.
- 무한한 너비 근처에서 DNN 출력 분포가 NNGP로 수렴함을 입증하며, 주어진 학습 프로토콜 하에서는 NTK로 수렴하지는 않음을 보였다.
- FWC 프레임워크를 사용하여 다양한 아키텍처와 데이터셋에서 실제 유한한 네트워크의 출력을 고정밀도로 예측하고, 이를 검증하였다.
- 학습 세트 크기 n에 따른 FWC의 스케일링을 분석하여, 작은 n과 큰 n의 두 경우 모두에서 보정이 근본적으로 무시할 만큼 작음을 보였다.
- FWC가 컨볼루션 아키텍처 분석에 어떻게 대수적으로 통합될 수 있는지 설명하며, GP 모델을 초월한 일반화 성능 향상을 설명한다.
실험 결과
연구 질문
- RQ1노이즈가 있는 기울기와 가중치 감쇠로 학습된 DNN이 무한한 너비 근처에서 NNGP로 수렴하는가, 아니면 NTK로 수렴하는가?
- RQ2임의의 활성화 함수와 네트워크 깊이에 대해 일반적인 분석적 형태의 유한한 너비 보정(FWC)을 도출할 수 있는가?
- RQ3FWC는 학습 세트 크기 n에 따라 어떻게 스케일링되며, 작은 n과 큰 n의 두 영역에서 예측 정확도에 어떤 영향을 미치는가?
- RQ4유한한 CNN의 성능을 GP 근사치에 비해 FWC가 얼마나 향상시키는가?
- RQ5FWC는 어떻게 대수적으로 컨볼루션 아키텍처 분석에 통합되어, GP 모델을 초월한 일반화 성능을 설명할 수 있는가?
주요 결과
- 무한한 너비 근처에서, 노이즈가 있는 기울기와 가중치 감쇠로 학습된 DNN는 신경망 가우시안 프로세스(NNGP)로 수렴하며, 신경 탄성 커널(NTK)으로는 수렴하지 않는다.
- 유도된 유한한 너비 보정(FWC) 프레임워크는 다양한 아키텍처와 활성화 함수에서 실제 유한한 너비 네트워크의 출력을 높은 정확도로 정확히 예측한다.
- 작은 학습 세트 크기(n) 영역과 큰 n 영역 모두에서 FWC는 무시할 만큼 작으며, GP 오차가 O(1/n)로 스케일링됨을 보여, 데이터셋 크기 변화에 대해 매우 강건함을 시사한다.
- 비록 FWC의 크기가 작지만, 이미지 분류 벤치마크에서 GP 대비 유한한 컨볼루션 신경망(CNN)의 성능 향상에 크게 기여한다.
- FWC 프레임워크는 유한한 너비 효과가 비차별적이며, 유한한 CNN이 GP 근사치를 초월하는 일반화 성능 향상을 대수적으로 설명함을 드러낸다.
- 노이즈 있는 학습을 하는 유한한 너비 DNN와 NNGP 사이에 원칙적인 분석적 연결을 수립하였으며, FWC는 GP 기반 예측에 체계적인 보정을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.