Skip to main content
QUICK REVIEW

[논문 리뷰] Approximation Rates for Neural Networks with General Activation Functions

Jonathan W. Siegel, Jinchao Xu|arXiv (Cornell University)|2019. 04. 04.
Neural Networks and Applications참고 문헌 27인용 수 6
한 줄 요약

이 논문은 푸리에 분석과 바론 노름 제약 조건을 활용하여 일반적인 활성화 함수를 가진 두 층 신경망에 대해 치수에 의존하지 않는 근사 속도를 확립한다. 다항식적으로 감쇠하는 활성화 함수의 경우 $ n^{-1/2} $ 수렴 속도를 증명하고, 유계이고 적분 가능한 활성화 함수의 경우 더 약한 $ n^{-1/4} $ 속도를 도출하며, 미묘한 조건 하에 계층적 표본 추출을 통해 속도를 향상시킨다.

ABSTRACT

We prove some new results concerning the approximation rate of neural networks with general activation functions. Our first result concerns the rate of approximation of a two layer neural network with a polynomially-decaying non-sigmoidal activation function. We extend the dimension independent approximation rates previously obtained to this new class of activation functions. Our second result gives a weaker, but still dimension independent, approximation rate for a larger class of activation functions, removing the polynomial decay assumption. This result applies to any bounded, integrable activation function. Finally, we show that a stratified sampling approach can be used to improve the approximation rate for polynomially decaying activation functions under mild additional assumptions.

연구 동기 및 목표

  • 시그모이드형이나 주기적 유형을 초월한 일반적인 활성화 함수에 대해 두 층 신경망의 치수에 의존하지 않는 근사 속도를 확장하기 위해.
  • 푸리에 분석과 바론 노름 제약 조건을 활용하여 다항식적으로 감쇠하는 활성화 함수의 개선된 수렴 속도를 확립하기 위해.
  • 다항식 감쇠를 요구하지 않는 더 넓은 범주인 유계이고 적분 가능한 활성화 함수로 결과를 일반화하기 위해.
  • 미묘한 추가 가정 하에 계층적 표본 추출 기법을 통해 근사 속도를 향상시키기 위해.
  • 얕은 네트워크가 바론 노름 정규화를 통해 치수의 저주를 어떻게 극복하는지 이해하기 위한 이론적 기초를 제공하기 위해.

제안 방법

  • 목표 함수와 활성화 함수의 푸리에 변환을 바탕으로 근사 오차를 표현하기 위해 푸리에 분석을 사용한다.
  • 소볼레프 공간에서 근사 오차를 제한하기 위해 부드러움의 척도로 바론 노름 $ \|f\|_{\mathcal{B}^{s}} $ 를 활용한다.
  • 일반적인 활성화 함수에 대해 치수에 의존하지 않는 경계를 도출하기 위해 활성화 함수의 근사 적분 표현을 적용한다.
  • 파arameter 공간을 분할하여 근사 오차의 분산을 줄임으로써 수렴 속도를 향상시키는 계층적 표본 추출 전략을 도입한다.
  • 랜덤 매개변수에 대한 기대값을 사용하여 $ H^m(\Omega) $-노름에서 오차 경계를 유도하고, 오차를 최소화하기 위해 표본 추출 매개변수를 최적화한다.
  • 농도 경계를 사용한 $ L^2 $-노름 오차 추정을 통해 고확률 근사 보장을 이끌어낸다.

실험 결과

연구 질문

  • RQ1두 층 신경망의 $ n^{-1/2} $ 근사 속도가 다항식 감쇠를 보이는 활성화 함수로 확장될 수 있는가?
  • RQ2다항식 감쇠가 없는 일반적인 유계이고 적분 가능한 활성화 함수에 대해 가능한 최고의 근사 속도는 무엇인가?
  • RQ3미묘한 정규성 가정 하에 계층적 표본 추출이 신경망 근사의 수렴 속도를 향상시킬 수 있는가?
  • RQ4바론 노름은 높은 치수에서 얕은 네트워크의 근사 능력에 어떻게 영향을 미치는가?
  • RQ5ReLU나 시그모이드형 함수에서 관찰된 것처럼 일반적인 활성화 함수에 대해 $ n^{-1/2} $ 속도를 달성할 수 있는가?

주요 결과

  • 다항식적으로 감쇠하는 활성화 함수의 경우, 논문은 치수에 의존하지 않는 근사 속도 $ n^{-1/2} $ 를 확립하며, 이는 이전 결과에서 로그 인자를 제거하여 향상된 것이다.
  • 일반적인 유계이고 적분 가능한 활성화 함수(예: 유계 변동성)의 경우, 논문은 더 약하지만 여전히 치수에 의존하지 않는 속도 $ n^{-1/4} $ 를 증명하며, 시그모이드형이나 주기적 함수를 초월한 결과를 확장한다.
  • 계층적 표본 추출을 적용함으로써 다항식적으로 감쇠하는 활성화 함수에 대해 최적의 매개변수 선택 하에 개선된 수렴 속도 $ n^{-1/2 - \frac{\min(p-1,\epsilon)}{(d+1)(2 + \min(p-1,\epsilon))}} $ 를 달성한다.
  • 주기적 활성화 함수의 경우, 계층적 표본 추출 접근법은 기준 $ n^{-1/2} $ 속도를 초월하는 $ n^{-1/2 - \frac{\epsilon}{(d+1)(2 + \epsilon)}} $ 속도를 도출한다.
  • 결과는 목표 함수가 유한한 바론 노름 $ \|f\|_{\mathcal{B}^{m+\epsilon}} $ 을 가진다는 가정 하에 유도되었으며, 이는 이전의 소볼레프 기반 분석에서 사용된 것보다 더 약한 부드러움 조건이다.
  • 이론적 프레임워크는 목표 함수가 바론 노름이 유계일 경우, 강력한 부드러움 가정 없이도 얕은 네트워크가 치수의 저주를 극복할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.