Skip to main content
QUICK REVIEW

[논문 리뷰] A self consistent theory of Gaussian Processes captures feature learning effects in finite CNNs

Gadi Naveh, Zohar Ringel|arXiv (Cornell University)|2021. 06. 08.
Gaussian Processes and Bayesian Inference인용 수 6
한 줄 요약

이 논문은 초기화 시 네트워크의 고차 누산량에서 유도된 비선형 목표 이동을 도입하여, 유한한 컨volution 신경망(CNN)에서의 특징 학습을 포괄하는 자기일관성 있는 가우시안 프로세스(GP) 이론을 개발한다. 이 프레임워크는 특징 학습과 레이지 학습 영역 사이의 뚜렷한 상전이를 드러내며, 무한한 폭의 근처가 아니더라도 실험 결과와 강한 일치를 보이며, 표준 GP 근사 이론을 넘어서는 강한 유한-DNN 효과를 분석할 수 있는 비파erturbative 분석 도구를 제공한다.

ABSTRACT

Deep neural networks (DNNs) in the infinite width/channel limit have received much attention recently, as they provide a clear analytical window to deep learning via mappings to Gaussian Processes (GPs). Despite its theoretical appeal, this viewpoint lacks a crucial ingredient of deep learning in finite DNNs, laying at the heart of their success -- feature learning. Here we consider DNNs trained with noisy gradient descent on a large training set and derive a self consistent Gaussian Process theory accounting for strong finite-DNN and feature learning effects. Applying this to a toy model of a two-layer linear convolutional neural network (CNN) shows good agreement with experiments. We further identify, both analytical and numerically, a sharp transition between a feature learning regime and a lazy learning regime in this model. Strong finite-DNN effects are also derived for a non-linear two-layer fully connected network. Our self consistent theory provides a rich and versatile analytical framework for studying feature learning and other non-lazy effects in finite DNNs.

연구 동기 및 목표

  • 실제 DNN의 성공에 필수적인, 표준 무한폭 GP 근사에서 특징 학습을 포괄하지 못하는 제한점을 해결하기 위해.
  • 표준 무한폭 GP 및 NTK 극한을 넘어서 강한 유한-DNN 효과, 특히 레이지가 아닌 학습 동역학을 고려할 수 있는 비파erturbative 분석 프레임워크를 개발하기 위해.
  • 분석적 및 수치적 방법을 통해 유한 DNN에서 특징 학습과 레이지 학습 영역 사이의 상전이를 식별하고 특성화하기 위해.
  • 표준 GP 사전분포보다 일반화 및 예측 성능을 향상시키기 위해 비선형성 및 유한폭 보정을 포함하는 GP 프레임워크를 확장하기 위해.
  • 특히 컨volution 아키텍처에서, 유한 DNN의 가려진 층에서의 가중치 동역학과 통계적 성질을 연구하기 위한 통합된 분석 도구를 제공하기 위해.

제안 방법

  • 노이즈가 있는 경사 하강법로 훈련되는 유한 DNN에 대한 자기일관성 있는 GP 이론을 유도하며, 초기화 시 네트워크 출력의 고차 누산량을 통해 유한폭 보정을 반영하는 이동된 목표 함수를 포함한다.
  • 초기화 시 DNN 출력의 두 번째 및 세 번째 누산량을 포함하는 비선형 자기일관성 방정식을 도입하여 목표 이동을 예측함으로써, 특징 학습 효과를 정확하게 모델링할 수 있도록 한다.
  • 교사-학생 설정에서 두 층의 선형 CNN에 프레임워크를 적용하여, 강한 유한-DNN 영역에서도 실험 결과와 일치하는 분석적 예측을 유도한다.
  • 가려운 층 가중치의 사후 공분산을 연구하기 위해 프레임워크를 활용하여, 스펙트럼 서명에 기반한 특징 학습과 레이지 학습 단계 사이의 뚜렷한 상전이를 식별한다.
  • 비선형 두 층의 완전 연결 네트워크로 접근을 확장하여, 유한-DNN 보정 덕분에 표준 GP 근사보다 뚜렷한 성능 향상을 보임을 입증한다.
  • 점근적 분석과 대규모 N 스케일링을 활용하여 핵심 매개변수(α, β)의 감쇠 비율을 유도하며, n ~ Md가 DNN 매개변수에 충분한 제약 조건을 제공함으로써 양호한 일반화를 보장함을 입증한다.

실험 결과

연구 질문

  • RQ1표준 무한폭 GP 근사에서 부재한 특징 학습 효과를 포괄하기 위해, 유한 DNN에서의 가우시안 프로세스 프레임워크는 어떻게 확장될 수 있는가?
  • RQ2노이즈가 있는 경사 하강법으로 훈련된 유한 DNN에서, 고차 누산량(예: 세 번째 누산량)의 역할은 효과적인 목표 이동을 결정하는 데 어떤 기여를 하는가?
  • RQ3유한 CNN에서 특징 학습과 레이지 학습 영역 사이에 뚜렷한 상전이가 존재하는가, 그리고 이를 분석적으로 특성화할 수 있는가?
  • RQ4표준 GP 사전분포에 비해 유한-DNN 보정이 일반화 성능에 얼마나 기여하는가, 특히 사전분포가 데이터에 존재하는 제약(예: 정정의 행렬, 가중치 공유)을 포괄하지 못할 경우에 대해?
  • RQ5특히 가려운 층 가중치의 사후 공분산 스펙트럼을 통해, 특징 학습의 유무가 어떻게 반영되는가?

주요 결과

  • 제안된 자기일관성 있는 GP 이론은 노이즈가 있는 경사 하강법로 훈련된 유한 DNN의 평균 예측기 값을 정확히 예측하며, 무한폭 근처가 아니더라도 실험 결과와 강한 일치를 보인다.
  • 이론은 두 층의 선형 CNN에서 특징 학습과 레이지 학습 영역 사이의 뚜렷한 상전이를 식별하며, 노이즈가 있는 위샤르트 행렬에서의 저질서 신호 복원과 유사하다.
  • 특징 학습 영역은 학생의 가려운 층 가중치의 사후 공분산에서 명확한 스펙트럼 서명을 통해 정의되며, 이는 교사의 특징이 충분히 강력할 때에만 나타난다.
  • 유한-DNN 보정은 특히 데이터가 제약(예: 정정의 행렬, 가중치 공유)을 부여할 경우, 표준 GP 사전분포보다 성능을 크게 향상시킨다.
  • 점근적 분석에 따르면 매개변수 α와 β는 O(σ²/(λ₀n)) 비율로 감쇠하며, n ~ Md가 DNN 매개변수를 교사의 값에 가깝게 제약하기에 충분한 데이터를 제공함을 입증하여, 양호한 일반화를 위한 스케일링을 검증한다.
  • 이 프레임워크는 비파erturbative이며 분석적으로 다룰 수 있는 방법을 제공하여, 유한 DNN에서의 레이지가 아닌 효과, 특히 가중치 동역학과 일반화를 연구하는 데 적용 가능하며, 선형 모델을 넘어서 비선형 아키텍처에도 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.