[논문 리뷰] Optimal rates of approximation by shallow ReLU$^k$ neural networks and applications to nonparametric regression
이 논문은 하이퍼볼드 공간 단위 구의 함수의 변동성 노름을 분석하여 얕은 ReLU$^k$ 신경망의 최적 근사율을 확립한다. 얕은 네트워크가 힐더-스무쓰 함수의 비모수적 회귀에서 최소최대 최적 수렴률을 달성하며, 이 결과는 과다 매개변수화된 및 컨volutional 신경망으로까지 확장되어 거의 최적의 수율을 보인다.
We study the approximation capacity of some variation spaces corresponding to shallow ReLU$^k$ neural networks. It is shown that sufficiently smooth functions are contained in these spaces with finite variation norms. For functions with less smoothness, the approximation rates in terms of the variation norm are established. Using these results, we are able to prove the optimal approximation rates in terms of the number of neurons for shallow ReLU$^k$ neural networks. It is also shown how these results can be used to derive approximation bounds for deep neural networks and convolutional neural networks (CNNs). As applications, we study convergence rates for nonparametric regression using three ReLU neural network models: shallow neural network, over-parameterized neural network, and CNN. In particular, we show that shallow neural networks can achieve the minimax optimal rates for learning Hölder functions, which complements recent results for deep neural networks. It is also proven that over-parameterized (deep or shallow) neural networks can achieve nearly optimal rates for nonparametric regression.
연구 동기 및 목표
- 얕은 ReLU$^k$ 신경망의 뉴런 수를 기준으로 최적의 근사율을 확립하기 위해.
- 얕은 ReLU$^k$ 네트워크와 관련된 변동성 공간의 근사 능력을 분석하기 위해.
- 얕은, 과다 매개변수화된, 그리고 컨volutional 신경망의 세 가지 모델을 사용하여 비모수적 회귀의 수렴률을 도출하기 위해.
- 얕은 네트워크가 힐더-스무쓰 함수에 대해 최소최대 최적 수렴률을 달성함을 보여주어 기존의 깊은 네트워크 결과를 보완하기 위해.
- 유도된 근사 경계를 사용하여 깊이 있는 네트워크와 컨volutional 네트워크로의 분석을 확장하기 위해.
제안 방법
- 함수 클래스 $\mathcal{F}_{\sigma_k}(M)$을 정의하여, 측도 $\mu$의 총 변동성이 유계인 무한한 너비의 얕은 ReLU$^k$ 네트워크의 집합으로, 즉 $\|\mu\| \leq M$.
- 구면 조화함수를 통한 함수의 적분 표현과 마우레이 유형의 랜덤 샘플링 추론을 사용하여 근사 오차를 변동성 노름에 따라 제한한다.
- 다음과 같은 근사 속도를 확립한다: $\|h - f\|_{L^\infty} \lesssim M^{-2\alpha/(d+2k+1-2\alpha)}$ ($h \in \mathcal{H}^\alpha$ 이고 $\alpha < (d+2k+1)/2$ 일 때).
- 변동성 노름 근사 결과를 [55, 57]의 랜덤 근사 경계와 결합하여 유한한 너비의 얕은 네트워크에 대한 최적 수율을 도출한다.
- 근사 경계를 적용하여 절단을 포함한 경험 리스크 최소화를 통한 비모수적 회귀의 일반화 오차 경계를 유도한다.
- 가짜 차원과 코팅 수의 추론을 사용하여 네트워크 클래스의 복잡도를 제어하며, 특히 CNN과 과다 매개변수화된 모델에 대해 유의미하다.
실험 결과
연구 질문
- RQ1힐더 공간 $\mathcal{H}^\alpha$의 함수에 대해 얕은 ReLU$^k$ 신경망이 달성할 수 있는 최적의 근사율은 무엇인가요?
- RQ2얕은 ReLU$^k$ 네트워크는 힐더-스무쓰 함수의 비모수적 회귀에서 최소최대 최적 수렴률을 달성할 수 있나요?
- RQ3얕은 네트워크의 근사율은 깊이 있는 네트워크와 컨volutional 네트워크로 어떻게 확장될 수 있나요?
- RQ4과다 매개변수화된 신경망은 비모수적 회귀에서 거의 최적의 수율을 달성할 수 있나요?
- RQ5활성화 함수의 거듭제곱 $k$가 근사율과 부드러움 임계값을 결정하는 데 어떤 역할을 하나요?
주요 결과
- 다음 조건에서 $\alpha < (d+2k+1)/2$ 이면, $L^\infty$ 노름에서 얕은 ReLU$^k$ 네트워크의 근사 오차는 $\mathcal{O}(M^{-2\alpha/(d+2k+1-2\alpha)})$로 감소한다. 여기서 $M$은 측도의 총 변동성이다.
- 다음 조건에서 $\alpha < (d+2k+1)/2$ 이면, 얕은 ReLU$^k$ 네트워크는 $\mathcal{H}^\alpha$에 대해 최적의 근사율 $\mathcal{O}(N^{-\alpha/d})$를 달성한다. 이는 Mhaskar의 결과를 ReLU$^k$로 일반화한 것이다.
- 얕은 신경망은 힐더 함수 학습에서 최소최대 최적 수렴률을 달성하며, 비모수적 회귀에서 가능한 최고의 속도와 일치한다.
- 과다 매개변수화된 (깊이 있거나 얕은) 신경망은 비모수적 회귀에서 거의 최적의 수렴률을 달성하며, 오차 경계는 $\mathcal{O}(n^{-\alpha/(d+\alpha)}(\log n)^4)$의 순서를 가진다.
- 렐루 활성화 함수를 사용하는 컨volutional 신경망($k=1$)은 $\mathcal{F}_\sigma(1)$에 대해 $\mathcal{O}(n^{-(d+3)/(3d+3)}(\log n)^4)$의 수렴률을 달성한다. 이는 기존 결과보다 略적으로 더 우수하다.
- 근사 결과는 소볼레프 노름으로도 확장 가능하며, 이는 향후 연구를 위해 다른 부드러움 공간으로의 일반화 가능성을 시사하지만, 이는 아직 미해결 과제로 남아 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.