Skip to main content
QUICK REVIEW

[논문 리뷰] A type of generalization error induced by initialization in deep neural networks

Yaoyu Zhang, Zhi‐Qin John Xu|arXiv (Cornell University)|2019. 05. 19.
Model Reduction and Neural Networks참고 문헌 34인용 수 14
한 줄 요약

이 논문은 비영인 무작위 초기화에 의해 유도되는 딥 네ural 네트워크(DNNs)의 일반화 오차를 규명하며, 신경 탄성 커널(NTK) 영역에서 DNNs가 매arameter space에서 초기 가중치에 가장 가까운 전역 최소값으로 수렴함을 보여주고, 이는 초기화가 비영일 경우 오차가 증가하게 되는 원인임을 밝혀낸다. 저자들은 이러한 오차를 제거하고 학습을 가속화하기 위해 반대칭 초기화(ASI)를 제안하며, NTK 및 비-NTK 영역 모두에서 이론적 및 실험적 검증을 수행한다.

ABSTRACT

How initialization and loss function affect the learning of a deep neural network (DNN), specifically its generalization error, is an important problem in practice. In this work, by exploiting the linearity of DNN training dynamics in the NTK regime \citep{jacot2018neural,lee2019wide}, we provide an explicit and quantitative answer to this problem. Focusing on regression problem, we prove that, in the NTK regime, for any loss in a general class of functions, the DNN finds the same \emph{global} minima---the one that is nearest to the initial value in the parameter space, or equivalently, the one that is closest to the initial DNN output in the corresponding reproducing kernel Hilbert space. Using these optimization problems, we quantify the impact of initial output and prove that a random non-zero one increases the generalization error. We further propose an antisymmetrical initialization (ASI) trick that eliminates this type of error and accelerates the training. To understand whether the above results hold in general, we also perform experiments for DNNs in the non-NTK regime, which demonstrate the effectiveness of our theoretical results and the ASI trick in a qualitative sense. Overall, our work serves as a baseline for the further investigation of the impact of initialization and loss function on the generalization of DNNs, which can potentially guide and improve the training of DNNs in practice.

연구 동기 및 목표

  • 초기화와 손실 함수가 딥 네ural 네트워크의 일반화 오차에 미치는 영향을 이해하는 것.
  • NTK 영역에서 비영 초기화가 일반화 오차에 미치는 영향을 정량화하는 것.
  • 이러한 초기화 유도 오차를 줄이고 학습 효율성을 향상시키는 방법을 개발하는 것.
  • 이론적 발견이 NTK 영역을 초월해 비-NTK 실용적 DNN에 적용되는지 실험적으로 검증하는 것.

제안 방법

  • NTK 영역에서 이론적 분석을 수행하며, DNN 학습 동역학의 선형성에 기반한다.
  • 저자들은 DNNs가 매개변수 공간에서 초기 가중치에 가장 가까운 전역 최소값으로 수렴함을 증명하며, 이는 재생 커널 힐베르트 공간에서 초기 출력과 가장 가까운 것과 동치임을 보여준다.
  • 일반적인 손실 함수의 클래스를 고려하여, 최적화 경로가 특정 손실 함수에 따라 달라지지 않음을 보여준다.
  • 초기 출력이 일반화 오차에 미치는 영향을 정량화하며, 비영 초기화가 오차를 증가시킨다는 것을 밝혀낸다.
  • 초기 출력을 0으로 만들기 위해 대칭 초기화를 보장함으로써 초기화 유도 오차를 제거하는 반대칭 초기화(ASI) 기법을 제안한다.
  • 이론적 발견과 ASI의 효과 및 강건성을 검증하기 위해 NTK 및 비-NTK 영역 모두에서 실험을 수행한다.

실험 결과

연구 질문

  • RQ1NTK 영역에서 비영 무작위 초기화는 DNN의 일반화 오차에 어떻게 영향을 미치는가?
  • RQ2다양한 초기화가 전역 최소값으로 수렴함에도 불구하고 일반화 오차가 다른 이유는 무엇인가?
  • RQ3초기화에 의해 유도되는 일반화 오차를 체계적으로 줄이거나 제거할 수 있는가?
  • RQ4NTK 영역에서 관찰된 이론적 행동이 실용적인 비-NTK DNN에까지 확장되는가?
  • RQ5제안된 반대칭 초기화(ASI)는 초기화 유도 오차를 줄이고 학습을 가속화하는 데 얼마나 효과적인가?

주요 결과

  • NTK 영역에서, 일반적인 손실 함수의 어떤 것이라도 DNNs가 매개변수 공간에서 초기 가중치에 가장 가까운 전역 최소값으로 수렴한다.
  • 이 수렴 지점은 재생 커널 힐베르트 공간에서 초기 DNN 출력과 가장 가까운 것과 대응하며, 이는 초기화에 의해 유도되는 일반화 오차를 정량화한다.
  • 비영 무작위 초기화는 기능 공간에서 최적 해가 원점에서 벗어나기 때문에 일반화 오차를 증가시킨다.
  • 제안된 반대칭 초기화(ASI)는 초기 출력을 0으로 만들기 때문에 초기화 유도 오차를 제거하며, 이로 인해 기능 공간에서 원점과 일치하는 해로 수렴하게 된다.
  • 비-NTK 영역에서의 실험 결과는 이론적 통찰과 ASI 기법이 질적으로 효과적임을 보여주며, 더 넓은 적용 가능성을 시사한다.
  • 결과는 초기화와 손실 함수가 DNN 일반화에 미치는 역할을 이해하는 기초를 마련하며, 학습 안정성과 성능 향상에 실용적 영향을 미친다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.