Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Network Approximation: Achieving Arbitrary Accuracy with Fixed Number of Neurons

Zuowei Shen, Haizhao Yang|arXiv (Cornell University)|2021. 07. 06.
Neural Networks and Applications참고 문헌 43인용 수 15
한 줄 요약

이 논문은 주기적인 삼각파형과 소프트시그모이드 함수를 조합한 새로운, 단순하고 계산 가능한 활성화 함수를 제안한다. 이는 고정된 유한한 너비(36d(2d+1))와 깊이(11)를 가진 전방향 신경망이 d차원 초입방체 위의 임의의 연속 함수를 보편적으로 근사할 수 있도록 한다. 주요 기여는 이러한 네트워크가 매개변수를 조정함으로써 임의의 작은 오차 내에서 임의의 연속 함수를 근사할 수 있음을 증명한 것이다. 이는 보편적인 근사 능력을 지닌 고정 크기의 네트워크를 확립한다.

ABSTRACT

This paper develops simple feed-forward neural networks that achieve the universal approximation property for all continuous functions with a fixed finite number of neurons. These neural networks are simple because they are designed with a simple, computable, and continuous activation function $σ$ leveraging a triangular-wave function and the softsign function. We first prove that $σ$-activated networks with width $36d(2d+1)$ and depth $11$ can approximate any continuous function on a $d$-dimensional hypercube within an arbitrarily small error. Hence, for supervised learning and its related regression problems, the hypothesis space generated by these networks with a size not smaller than $36d(2d+1) imes 11$ is dense in the continuous function space $C([a,b]^d)$ and therefore dense in the Lebesgue spaces $L^p([a,b]^d)$ for $p\in [1,\infty)$. Furthermore, we show that classification functions arising from image and signal classification are in the hypothesis space generated by $σ$-activated networks with width $36d(2d+1)$ and depth $12$ when there exist pairwise disjoint bounded closed subsets of $\mathbb{R}^d$ such that the samples of the same class are located in the same subset. Finally, we use numerical experimentation to show that replacing the rectified linear unit (ReLU) activation function by ours would improve the experiment results.

연구 동기 및 목표

  • 보편적 근사를 가능하게 하는 단순하고 계산 가능한 활성화 함수를 개발한다.
  • 너비 36d(2d+1)와 깊이 11인 깊은 전방향 네트워크가 [a,b]^d 위의 임의의 연속 함수를 임의의 오차 내에서 근사할 수 있음을 증명한다.
  • 추가적인 한 층을 통해 분류 함수를 정확히 표현할 수 있음을 보여준다.
  • 이 활성화 함수의 근사 능력에 대한 이론적 근거를 회귀 및 분류 과제 모두에서 제공한다.

제안 방법

  • 활성화 함수 σ는 조각 함수로 구성된다: σ₁(x) = |x| on [-1,1]이며 주기 2로 주기적으로 연장되고, σ₂(x) = x/(|x|+1) for x < 0으로, 주기성과 높은 비선형성을 동시에 가지는 하이브리드 함수를 형성한다.
  • 11개의 비선형 층을 조합하며, O(d²)개의 비영 매개변수를 사용하는 애프라인 변환을 매개변수화한다.
  • 증명 과정은 삼각파형 성분의 주기성과 소프트시그모이드 함수의 비선형성을 활용하여 스텝 함수를 시뮬레이션하고 임의의 연속 함수를 근사한다.
  • 수학적 귀납법을 사용하여 출력 집합 {τ(wa₁), ..., τ(wa_J)}가 [0,1]^J 내에서 조밀함을 보여주어 보편적 근사를 가능하게 한다.
  • ε > 0에 대해, 고정된 크기의 네트워크가 매개변수를 조정함으로써 C([a,b]^d)에 속하는 임의의 f를 ε 이내로 근사할 수 있음을 보장한다.
  • 분류 함수 ∑ r_j · 1_{E_j}를 정확히 실현하기 위해 추가로 2개의 뉴런을 가진 은닉 층을 사용한다. 여기서 E_j는 서로소인 닫힌 유계 집합이며, r_j는 서로 다른 유리수이다.

실험 결과

연구 질문

  • RQ1고정 크기의 깊은 신경망과 단순하고 계산 가능한 활성화 함수를 사용하여 d차원 초입방체 위의 연속 함수에 대해 보편적 근사를 달성할 수 있는가?
  • RQ2주기성과 비선형 성분을 결합한 제안된 활성화 함수가 뿐만 아니라 매개변수 조정만으로도 임의의 연속 함수를 근사할 수 있는가?
  • RQ3이러한 네트워크는 ℝ^d의 서로소인 유계 닫힌 부분집합 위에서 정의된 분류 함수를 정확히 표현할 수 있는가?
  • RQ4이 활성화 함수를 사용하여 보편적 근사를 달성하기 위해 필요한 최소 네트워크 너비와 깊이는 얼마인가?
  • RQ5제안된 활성화 함수는 실용적 학습 과제에서 표준 ReLU와 수치적으로 어떻게 비교되는가?

주요 결과

  • 제안된 활성화 함수 σ를 사용하는 너비 36d(2d+1)와 깊이 11인 깊은 신경망은 매개변수 조정을 통해 [a,b]^d 위의 임의의 연속 함수를 임의로 작은 오차 ε 이내로 근사할 수 있다.
  • 너비 36d(2d+1)와 깊이 11인 σ-기반 네트워크의 가설 공간은 C([a,b]^d)에서 조밀하며, 따라서 p ∈ [1, ∞)에 대해 L^p([a,b]^d)에서도 조밀하다.
  • 추가로 너비 2인 은닉 층을 하나 더 사용하면, 임의의 분류 함수 ∑_{j=1}^J r_j · 1_{E_j}를 정확히 표현할 수 있다. 여기서 J ∈ ℕ⁺, r_j는 서로 다른 유리수이며, E_j ⊆ ℝ^d는 서로소인 유계 닫힌 집합이다.
  • 네트워크 아키텍처는 최대 5437(d+1)(2d+1)개의 비영 매개변수를 필요로 하며, 이는 목표 함수나 허용 오차 ε과 무관하다.
  • 수치 실험 결과, ReLU를 제안된 활성화 함수로 대체함으로써 실용적 학습 과제에서 성능 향상이 관찰되었다.
  • 활성화 함수 σ는 기본 보편 활성화 함수(EUAF)로 증명되었으며, 해당 네트워크는 EUAF 네트워크로 불리게 되었으며, 고정 크기의 보편 근사기의 새로운 클래스를 확립하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.