[논문 리뷰] The Influence of Learning Rule on Representation Dynamics in Wide Neural Networks
이 논문은 무한한 너비를 가진 깊은 신경망에서 다양한 학습 규칙—경사 하강법, 피드백 정렬(FA), 직접 피드백 정렬(DFA), 헤브시안 학습, 게이트드 선형 네트워크(GLN)—이 표현 동역학을 어떻게 형성하는지 분석한다. 동적 평균장 이론(DMFT) 프레임워크를 사용하여 각 규칙이 시간에 따라 변하는 효과적 신경 접선 커널(eNTK)을 유도함을 보여주며, FA와 DFA가 풍부한 영역에서 깊이에 따라 변화하는 특징 학습을 가능하게 하며, 헤브와 GLN은 제한되거나 임계적인 특징 적응이 없음을 밝혀낸다.
It is unclear how changing the learning rule of a deep neural network alters its learning dynamics and representations. To gain insight into the relationship between learned features, function approximation, and the learning rule, we analyze infinite-width deep networks trained with gradient descent (GD) and biologically-plausible alternatives including feedback alignment (FA), direct feedback alignment (DFA), and error modulated Hebbian learning (Hebb), as well as gated linear networks (GLN). We show that, for each of these learning rules, the evolution of the output function at infinite width is governed by a time varying effective neural tangent kernel (eNTK). In the lazy training limit, this eNTK is static and does not evolve, while in the rich mean-field regime this kernel's evolution can be determined self-consistently with dynamical mean field theory (DMFT). This DMFT enables comparisons of the feature and prediction dynamics induced by each of these learning rules. In the lazy limit, we find that DFA and Hebb can only learn using the last layer features, while full FA can utilize earlier layers with a scale determined by the initial correlation between feedforward and feedback weight matrices. In the rich regime, DFA and FA utilize a temporally evolving and depth-dependent NTK. Counterintuitively, we find that FA networks trained in the rich regime exhibit more feature learning if initialized with smaller correlation between the forward and backward pass weights. GLNs admit a very simple formula for their lazy limit kernel and preserve conditional Gaussianity of their preactivations under gating functions. Error modulated Hebb rules show very small task-relevant alignment of their kernels and perform most task relevant learning in the last layer.
연구 동기 및 목표
- 비생물학적으로 타당한가 아닌가에 관계없이 다양한 학습 규칙이 깊은 신경망의 표현 동역학과 기능적 인덕티브 바이어스에 어떤 영향을 미치는지 이해하기 위해.
- 학습 규칙이 깊이 있는 네트워크에서의 특징 및 예측 동역학에 미치는 영향을 분석하며, 특히 러스트 및 풍부(특징 학습) 영역에서 중점적으로 다룬다.
- 다양한 학습 규칙에 대해 시간에 따라 변하는 효과적 신경 접선 커널(eNTK)을 특징짓는 동적 평균장 이론(DMFT) 프레임워크를 개발하기 위해.
- 특히 깊이에 따라 변화하는 특징 적응과 기울기-가짜 기울기 정렬을 고려할 때, FA, DFA, 헤브, GLN 네트워크의 표현 학습 능력을 비교하기 위해.
- FA와 DFA에서 초기 피드백 가중치 상관관계의 역할을 조사하고, 이가 풍부한 영역에서 표현 진화에 미치는 영향을 분석하기 위해.
제안 방법
- 시간에 따라 변하는 효과적 신경 접선 커널(eNTK)을 사용하여 무한한 너비의 네트워크에서 학습 규칙 동역학을 위한 일반적인 프레임워크를 유도한다.
- 동적 평균장 이론(DMFT)을 적용하여 각 학습 규칙에 대한 eNTK를 계산함으로써 커널 진화의 분석적 및 수치적 연구를 가능하게 한다.
- 피드포워드와 피드백 가중치 간의 부분적인 상관관계를 允허하는 일반화된 FA 규칙을 도입하여 eNTK를 제어 가능한 방식으로 수정한다.
- 무한한 너비 근사에서의 사다리꼴 및 섭동 이론을 사용하여 커널 변동성과 공분산 구조(예: Φℓ 및 Gℓ 분산이 1/N 비례로 스케일링됨)를 계산한다.
- 깊은 선형 네트워크에 대해 eNTK의 폐쇄형 해를 유도하고, 비선형 네트워크에 대해서는 DMFT 형식을 사용한 수치적 절차를 개발한다.
- 커널 변동성과 너비 및 층에 따른 분산 스케일링을 실험적으로 검증함으로써 DMFT 예측의 타당성을 입증한다.
실험 결과
연구 질문
- RQ1학습 규칙의 선택(예: GD, FA, DFA, 헤브, GLN)이 넓은 신경망에서 효과적 신경 접선 커널(eNTK)의 진화에 어떤 영향을 미치는가?
- RQ2피드백 정렬(FA)과 직접 피드백 정렬(DFA)에서 전방 및 후방 가중치 간의 초기 상관관계가 풍부한 영역에서 표현 학습에 어떤 역할을 하는가?
- RQ3다양한 학습 규칙이 여러 층을 걸쳐 특징을 학습하는 데 얼마나 효과적인가, 특히 비러스트(비라스트) 학습 영역에서 중점적으로 비교된다.
- RQ4헤브시안 학습과 게이트드 선형 네트워크(GLN)가 기울기 하강법에 비해 작업에 관련된 특징 적응을 얼마나 보이는가?
- RQ5풍부한 영역에서의 동적 eNTK가 기울기-가짜 기울기 정렬과 네트워크의 기능적 인덕티브 바이어스와 어떻게 관련되어 있는가?
주요 결과
- 러스트 영역에서는 DFA와 헤브는 마지막 층의 특징만을 사용하여 학습할 수 있으나, 전체 FA는 초기 전방 및 피드백 가중치 간 상관관계가 비영이면 더 이른 층도 활용할 수 있다.
- 풍부한 영역에서는 FA와 DFA가 시간에 따라 변화하고 깊이에 따라 달라지는 eNTK를 나타내며, 이는 러스트 근사에서보다 더 깊은 특징 적응을 가능하게 한다.
- 직관에 반해, 풍부한 영역에서 초기 전방 및 피드백 가중치 간 상관관계가 낮을수록 FA 네트워크가 더 뚜렷한 특징 학습을 보인다.
- GLN 네트워크는 전활성화의 조건부 가우시안성을 유지하며, 러스트 근사에서 eNTK에 대한 단순한 폐쇄형 표현을 제공하며, GD와 유사한 동역학을 보인다.
- 헤브시안 학습은 최소한의 작업 관련 커널 정렬을 보이며, 대부분의 학습이 마지막 층에서 일어나 깊이에 따른 특징 적응이 제한됨을 시사한다.
- DMFT 프레임워크는 커널 분산이 1/N 비례로 스케일링됨을 예측하며, Φℓ 분산은 층 깊이에 따라 증가하고 Gℓ 분산은 깊이에 따라 감소함을 확인하였으며, 실험적으로 검증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.