Skip to main content
QUICK REVIEW

[논문 리뷰] On the Activation Function Dependence of the Spectral Bias of Neural Networks

Qingguo Hong, Jonathan W. Siegel|arXiv (Cornell University)|2022. 08. 09.
Neural Networks and Applications인용 수 9
한 줄 요약

이 논문은 ReLU 신경망의 스펙트럴 바이어스를 유한요소법과 연결시켜 이론적으로 설명하며, ReLU를 조각별 선형 B-스플라인인 햇 활성화 함수로 교체하면 이 바이어스가 제거됨을 예측한다. 경험적으로는 햇 활성화 함수를 사용하는 네트워크가 훨씬 더 빠르게 학습되고 일반화 성능이 뛰어나며, 스펙트럴 바이어스가 활성화 함수에 따라 달라지며 보편적인 것은 아님을 보여준다.

ABSTRACT

Neural networks are universal function approximators which are known to generalize well despite being dramatically overparameterized. We study this phenomenon from the point of view of the spectral bias of neural networks. Our contributions are two-fold. First, we provide a theoretical explanation for the spectral bias of ReLU neural networks by leveraging connections with the theory of finite element methods. Second, based upon this theory we predict that switching the activation function to a piecewise linear B-spline, namely the Hat function, will remove this spectral bias, which we verify empirically in a variety of settings. Our empirical studies also show that neural networks with the Hat activation function are trained significantly faster using stochastic gradient descent and ADAM. Combined with previous work showing that the Hat activation function also improves generalization accuracy on image classification tasks, this indicates that using the Hat activation provides significant advantages over the ReLU on certain problems.

연구 동기 및 목표

  • ReLU 신경망이 학습 도중 저주파 성분을 선호하는 이유를 이해하기 위해.
  • ReLU 네트워크를 유한요소법과 연결하는 이론적 프레임워크를 개발하여 이 바이어스를 설명하기 위해.
  • ReLU 활성화 함수를 햇 함수(조각별 선형 B-스플라인)로 수정하면 스펙트럴 바이어스가 제거될 것임을 예측하기 위해.
  • 햇 활성화 함수를 사용하는 네트워크에서 스펙트럴 바이어스가 없음을 경험적으로 검증하기 위해.
  • 햇 활성화 함수를 사용하는 네트워크가 ReLU 네트워크보다 더 빠르게 학습되고 일반화 성능이 뛰어나다는 것을 보여주기 위해.

제안 방법

  • 이론적 분석을 통해 ReLU 네트워크를 메쉬 위의 조각별 선형 근사로 모델링하고, 이를 유한요소법과 연결한다.
  • 네트워크의 특징 맵과 관련된 커널 행렬의 고유값 분석을 통해 저주파 모드가 더 빨리 학습됨을 밝힌다.
  • 햇 활성화 함수는 조각별 선형 B-스플라인 기저 함수로 정의되며, 스무스함과 국소적 지지도 특성으로 ReLU와 다름.
  • 네트워크의 헤시안 또는 커널 행렬의 고유값에 대한 이론적 경계를 유도하여, 햇 활성화 함수를 사용할 경우 스펙트럴 바이어스가 감소함을 보여준다.
  • 심층 및 얕은 네트워크에서 합성 및 실재 데이터를 사용해 수렴 속도와 주파수 학습 역학을 측정함으로써 경험적 검증을 수행한다.
  • 손실 수렴 및 일반화 성능를 비교하기 위해 확률적 경사 하강법과 ADAM을 사용하여 학습 효율성을 평가한다.

실험 결과

연구 질문

  • RQ1ReLU 네트워크의 스펙트럴 바이어스는 그 활성화 함수에서 기인하는가, 아니면 과다 매개변수화된 모델의 일반적 성질인가?
  • RQ2스펙트럴 바이어스는 유한요소법과의 연결을 통해 이론적으로 설명될 수 있는가?
  • RQ3ReLU를 햇 활성화 함수로 교체하면 신경망 학습에서 스펙트럴 바이어스가 제거되는가?
  • RQ4햇 활성화 함수를 사용하는 네트워크는 ReLU 네트워크보다 더 빠르게 학습되고 일반화 성능이 뛰어나게 되는가?
  • RQ5스펙트럴 바이어스는 다양한 최적화 알고리즘과 네트워크 아키텍처에 대해 강건한가?

주요 결과

  • 이론적 분석은 ReLU 네트워크가 조각별 선형 구조를 지녀, 이는 유한요소 근사와 일치하므로 스펙트럴 바이어스를 나타냄을 확인한다.
  • 조각별 선형 B-스플라인인 햇 활성화 함수는 더 균일한 주파수 학습을 가능하게 하여 스펙트럴 바이어스를 제거한다.
  • 경험적 결과는 SGD와 ADAM 최적화 하에서 햇 활성화 함수를 사용하는 네트워크가 ReLU 네트워크보다 훨씬 더 빠르게 학습됨을 보여준다.
  • 햇 활성화 함수를 사용하는 네트워크는 이미지 분류 과제에서 개선된 일반화 성능를 보이며, 이는 이전 연구 결과와 일치한다.
  • 스펙트럴 바이어스는 보편적이지 않으며, 활성화 함수의 선택에 따라 결정되며, 햇 활성화 함수를 사용할 경우 바이어스가 없음을 보여준다.
  • 커널 행렬의 고유값에 대한 이론적 경계는 햇 활성화 함수를 사용할 경우 고주파 성분의 학습 속도가 증가함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.