Skip to main content
QUICK REVIEW

[논문 리뷰] Luck Matters: Understanding Training Dynamics of Deep ReLU Networks

Yuandong Tian, Tina Jiang|arXiv (Cornell University)|2019. 05. 31.
Generative Adversarial Networks and Image Synthesis참고 문헌 41인용 수 14
한 줄 요약

이 논문은 딥 ReLU 네트워크의 학습 동역학을 설명하기 위해 교사-학생 설정을 사용하는 이론적 프레임워크를 제안한다. 학생 노드가 교사 노드와 높은 오버랩을 가진 초기화될 경우 수렴 속도가 빨라지며, 관련성이 없는 노드의 팬아웃 가중치는 0으로 수렴함을 보여주며, 이는 '운좋은' 초기화와 웨너-테이크-all 동역학을 통해 과매개변수화, 암묵적 정규화, 러키 티켓을 설명한다.

ABSTRACT

We analyze the dynamics of training deep ReLU networks and their implications on generalization capability. Using a teacher-student setting, we discovered a novel relationship between the gradient received by hidden student nodes and the activations of teacher nodes for deep ReLU networks. With this relationship and the assumption of small overlapping teacher node activations, we prove that (1) student nodes whose weights are initialized to be close to teacher nodes converge to them at a faster rate, and (2) in over-parameterized regimes and 2-layer case, while a small set of lucky nodes do converge to the teacher nodes, the fan-out weights of other nodes converge to zero. This framework provides insight into multiple puzzling phenomena in deep learning like over-parameterization, implicit regularization, lottery tickets, etc. We verify our assumption by showing that the majority of BatchNorm biases of pre-trained VGG11/16 models are negative. Experiments on (1) random deep teacher networks with Gaussian inputs, (2) teacher network pre-trained on CIFAR-10 and (3) extensive ablation studies validate our multiple theoretical predictions.

연구 동기 및 목표

  • 비볼록 딥 러닝 문제에서 확률적 경사하강법(SGD)이 좋은 해를 찾는 이유를 이해한다.
  • 과매개변수화된 딥 ReLU 네트워크의 일반화 능력을 설명한다.
  • 과매개변수화, 암묵적 정규화, 러키 티켓과 같은 이상한 현상들을 통합적으로 설명한다.
  • 초기화 오버랩과 학생 노드의 수렴 속도 및 가중치 감쇠 사이의 이론적 프레임워크를 제공한다.

제안 방법

  • 고정된 ReLU 교사 네트워크에 대해 과매개변수화된 학생 네트워크를 사용하는 교사-학생 학습 설정을 사용한다.
  • 노드의 활성화 영역을 E_j = {x : f_j(x) > 0}로 정의하고, 학생에서 교사 노드로의 기울기 흐름을 분석한다.
  • 학습 초기에 교사 노드와 높은 오버랩(활성화 영역의 겹침)을 가진 학생 노드가 더 빠르게 수렴함을 증명한다(정리 4).
  • 2층 네트워크에서 교사 노드와 오버랩이 없는 학생 노드의 팬아웃 가중치가 0으로 감쇠하여 웨너-테이크-all 행동이 나타남을 보인다(정리 5).
  • 상향식 조절(β)과 헤시안 분석을 사용하여 최적화 과정에서 기울기 신호가 어떻게 전파되고 안정화되는지 모델링한다.
  • 랜덤 가우시안 입력, CIFAR-10, 배치노멀라이제이션 및 과매개변수화에 대한 아블레이션 연구를 통한 실험을 통해 이론적 예측을 검증한다.

실험 결과

연구 질문

  • RQ1과매개변수화된 ReLU 네트워크가 높은 용량을 지닌 데도 왜 잘 일반화되는가?
  • RQ2학습 중에 학생 노드의 기울기 흐름은 교사 노드와의 오버랩에 어떻게 의존하는가?
  • RQ3왜 훈련된 ReLU 네트워크에 러키 티켓이 존재하는가?
  • RQ4왜 SGD로 훈련된 딥 네트워크에서 평탄한 최소값이 나타나는가?
  • RQ5배치노멀라이제이션이 학생 네트워크의 수렴 속도와 노드 유사성에 어떻게 영향을 미치는가?

주요 결과

  • 정리 4에 의해 증명된 바와 같이, 교사 노드와 높은 초기 오버랩을 가진 학생 노드는 그들의 수렴 속도가 상당히 빠르게 나타난다.
  • 2층 과매개변수화된 ReLU 네트워크에서 교사 노드와 오버랩이 없는 학생 노드의 팬아웃 가중치는 0으로 감쇠하여 웨너-테이크-all 행동이 나타남을 보였다(정리 5).
  • 가우시안 입력에 대한 실험에서 노드 유사도(ρ)는 학습 중에 증가하며, 깊은 층에서 더 빠른 수렴과 배치노멀라이제이션의 성능 향상이 관찰되었다.
  • CIFAR-10에서 학생 네트워크는 교사보다 약 1% 높은 테스트 정확도를 기록했으며, 배치노멀라이제이션이 수렴 속도를 가속화하고 노드 순서 상관관계를 향상시켰다.
  • 아블레이션 연구를 통해 과매개변수화가 ρ의 수렴을 안정화하고 가속화하는 것으로 확인되었으며, 유한한 데이터셋은 활성화 영역이 희박하기 때문에 유사도 증가가 멈출 수 있음을 보였다.
  • H*와 β* 행렬의 시각화 결과, 높은 상관관계를 가진 학생 노드는 최적화 후 강력한 상향식 조절과 교사 노드와 일치하는 활성화 패턴을 발달시킴을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.