Skip to main content
QUICK REVIEW

[논문 리뷰] Sharp Bounds on the Approximation Rates, Metric Entropy, and $n$-widths of Shallow Neural Networks

Jonathan W. Siegel, Jinchao Xu|arXiv (Cornell University)|2021. 01. 29.
Advanced Numerical Analysis Techniques참고 문헌 68인용 수 9
한 줄 요약

이 논문은 매끄럽게 매개변수화된 사전 프레임워크를 도입하여, ReLU^k 및 시그모이드형 활성화 함수를 갖는 얕은 신경망에 대한 근사율, 거리 함수, n-너비의 날카운 경계를 확립한다. 변동 공간에서 최적의 수렴 속도를 증명하며, ReLU^k 네트워크가 주어진 함수 클래스에서 가능한 한 가장 좋은 근사 오차 감소 속도인 $ n^{-1/2 - 1/(2d)} $ 의 순서를 달성함을 보여준다. 이는 주어진 클래스에서 날카로운 경계이다.

ABSTRACT

In this article, we study approximation properties of the variation spaces corresponding to shallow neural networks with a variety of activation functions. We introduce two main tools for estimating the metric entropy, approximation rates, and $n$-widths of these spaces. First, we introduce the notion of a smoothly parameterized dictionary and give upper bounds on the non-linear approximation rates, metric entropy and $n$-widths of their absolute convex hull. The upper bounds depend upon the order of smoothness of the parameterization. This result is applied to dictionaries of ridge functions corresponding to shallow neural networks, and they improve upon existing results in many cases. Next, we provide a method for lower bounding the metric entropy and $n$-widths of variation spaces which contain certain classes of ridge functions. This result gives sharp lower bounds on the $L^2$-approximation rates, metric entropy, and $n$-widths for variation spaces corresponding to neural networks with a range of important activation functions, including ReLU$^k$ activation functions and sigmoidal activation functions with bounded variation.

연구 동기 및 목표

  • 다양한 활성화 함수를 갖는 얕은 신경망에 대한 근사율, 거리 함수, n-너비의 날카운 상한 및 하한을 확립하기.
  • 바나흐 공간에서 비선형 사전 근사 분석을 위한 매끄럽게 매개변수화된 사전 기반의 이론적 프레임워크를 개발하기.
  • 리지 함수에 대응하는 변동 공간에서 얕은 네트워크의 최적 근사 성능를 특성화하기.
  • ReLU^k 네트워크가 그 변동 공간에서 가능한 한 최고의 수렴 속도를 달성함을 보여주어 기존 결과의 최적성 확인하기.

제안 방법

  • 바나흐 공간에서 사전 원소가 가중치와 편향의 매끄러운 함수에 의해 매개변수화되는 매끄럽게 매개변수화된 사전의 개념을 도입한다.
  • 매개변수화의 매끄러움 차수에 기반하여 이러한 사전의 절대 볼록 코어의 근사율, 거리 함수, n-너비에 대한 상한을 유도한다.
  • ReLU^k 및 시그모이드 활성화 함수를 갖는 얕은 신경망에서 유도되는 리지 함수 사전에 상한 프레임워크를 적용한다.
  • 제어된 $ L^2 $-거리와 기하 측도 이론적 추론을 사용하여, 거리 함수와 n-너비의 하한을 구하는 새로운 방법을 개발한다.
  • 하한 기법을 사용하여 ReLU^k 네트워크의 근사율 $ n^{-1/2 - 1/(2d)} $ 가 최적임을 증명한다. 이는 유계 변동성을 갖는 시그모이드 네트워크에게도 적용된다.
  • ReLU^k 네트워크의 변동 공간과 매개변수화된 사전의 볼록 코어 간의 동치성을 확립함으로써 정밀한 거리 함수 및 n-너비 추정이 가능해진다.

실험 결과

연구 질문

  • RQ1ReLU^k 및 시그모이드 활성화 함수를 갖는 얕은 신경망의 근사율에 대한 날카운 상한 및 하한은 무엇인가?
  • RQ2얕은 네트워크의 변동 공간에 대한 거리 함수와 n-너비는 네트워크의 폭과 차원에 따라 어떻게 척도가 변하는가?
  • RQ3$ L^2 $-노름에서 ReLU^k 네트워크의 근사율 $ n^{-1/2 - 1/(2d)} $ 가 최적이 되는지 증명할 수 있는가?
  • RQ4사전의 매개변수화의 매끄러움이 근사 및 거리 함수 경계에 어떤 영향을 미치는가?
  • RQ5특히 유계가 아닌 함수인 ReLU^k에 대해 경계는 활성화 함수의 선택에 얼마나 의존하는가?

주요 결과

  • 양면 $ L^2 $-노름에서 얕은 ReLU^k 네트워크의 근사율은 $ O(n^{-1/2 - 1/(2d)}) $ 으로 상한과 하한이 모두 존재하며, 이는 이 속도의 최적성 증명이다.
  • 유계 변동성을 갖는 시그모이드 활성화 함수에 대해서도 동일한 근사율 $ n^{-1/2 - 1/(2d)} $ 이 최적임을 보여주며, 이는 계수들이 $ \ell^\infty $ 에 유계일 때에도 성립한다.
  • 변동 공간 $ B_1(\mathbb{P}_k^d) $ 의 거리 함수는 $ \epsilon_n(B_1(\mathbb{P}_k^d)) \gtrsim n^{-1/2 - 1/(2d)} $ 를 만족하며, 이는 상한과 정확히 일치하여 날카로운 경계임을 확인한다.
  • 변동 공간 $ B_1(\mathbb{P}_k^d) $ 의 $ n $-너비는 속도 $ n^{-1/2 - 1/(2d)} $ 로 감소하며, 이는 이 클래스에 대해 가능한 한 최선의 속도이다.
  • 제어된 $ L^2 $-거리와 갖는 리지 함수의 넷을 구성하고, 비영인 차이의 집합에 대해 측도 이론적 추론을 사용하는 방법은 날카운 하한을 도출한다.
  • 결과는 일반적인 유계 변동성을 갖는 시그모이드 함수로 확장되며, 이는 더 강한 매끄러움 조건이 변동 공간의 근사율을 향상시키지 못함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.