Skip to main content
QUICK REVIEW

[논문 리뷰] Achieve the Minimum Width of Neural Networks for Universal Approximation

Yongqiang Cai|arXiv (Cornell University)|2022. 09. 23.
Model Reduction and Neural Networks인용 수 4
한 줄 요약

이 논문은 유한한 도메인에서 $ L^p $ 및 연속 노름에 대한 보편적 근사화를 위해 필요한 피드포워드 신경망의 최소 폭에 대한 보편적 하한값 $ w^{*}_{\text{min}} = \max(d_x, d_y) $을 확립한다. 이 하한값이 최적임을 입증하기 위해 누설 ReLU 및 UOE 활성화 함수를 사용하여 네트워크를 구축하였으며, 신경 ODE와 유량 맵 근사화를 활용하여 최적의 폭을 달성하였다. 이는 오랫동안 남아있던 임의의 활성화 함수에 대해 최소 폭을 묻는 열린 문제를 해결한다.

ABSTRACT

The universal approximation property (UAP) of neural networks is fundamental for deep learning, and it is well known that wide neural networks are universal approximators of continuous functions within both the $L^p$ norm and the continuous/uniform norm. However, the exact minimum width, $w_{\min}$, for the UAP has not been studied thoroughly. Recently, using a decoder-memorizer-encoder scheme, \citet{Park2021Minimum} found that $w_{\min} = \max(d_x+1,d_y)$ for both the $L^p$-UAP of ReLU networks and the $C$-UAP of ReLU+STEP networks, where $d_x,d_y$ are the input and output dimensions, respectively. In this paper, we consider neural networks with an arbitrary set of activation functions. We prove that both $C$-UAP and $L^p$-UAP for functions on compact domains share a universal lower bound of the minimal width; that is, $w^*_{\min} = \max(d_x,d_y)$. In particular, the critical width, $w^*_{\min}$, for $L^p$-UAP can be achieved by leaky-ReLU networks, provided that the input or output dimension is larger than one. Our construction is based on the approximation power of neural ordinary differential equations and the ability to approximate flow maps by neural networks. The nonmonotone or discontinuous activation functions case and the one-dimensional case are also discussed.

연구 동기 및 목표

  • 임의의 활성화 함수를 가진 피드포워드 신경망에서 보편적 근사화를 위해 필요한 정확한 최소 폭을 규명하는 것.
  • 모든 $ L^p $- 및 연속 노름 보편적 근사화에 적용 가능한 최소 폭에 대한 보편적 하한값을 설정하는 것.
  • 이 최소 폭을 달성하는 신경망 아키텍처를 구축하여 하한값의 날카로움을 입증하는 것.
  • 특히 비단조화 및 비연속 활성화 함수가 최소 폭 달성에 미치는 영향을 탐구하는 것.
  • 신경 ODE와 유량 맵 근사화를 통해 보편적 근사화를 위상적 성질과 연결하는 것.

제안 방법

  • 레벨 집합과 호메오모르피즘을 기반으로 한 반례와 위상적 추론을 사용하여 보편적 하한값 $ w^{*}_{\text{min}} = \max(d_x, d_y) $을 유도한다.
  • 신경 미분방정식(ODE) 기반의 새로운 구축 방식을 제안하여, ODE의 유량 맵이 신경망에 의해 근사 가능함을 보이며 최소 폭에서 보편적 근사화를 달성함을 보여준다.
  • C-UAP에 대해 인코더-기억-디코더 프레임워크를 사용하며, $ \lfloor x \rfloor $ 및 UOE(최대치 순서화) 함수와 같은 비연속 활성화 함수를 통합한다.
  • 누설 ReLU 네트워크가 최소 폭 $ \max(d_x, d_y, 2) $을 달성하고, 누설 ReLU+ABS 또는 UOE+FLOOR 네트워크가 $ \max(d_x, d_y) $를 달성함을 보이며, 특정 조건 하에서 최적성을 입증한다.
  • 연속적이고 단조적인 활성화 함수(예: 누설 ReLU)가 $ d_x \geq d_y $일 경우 하한값을 달성할 수 없음을 위상적 추론을 통해 입증하며, 이는 호메오모르피즘이 비자명한 레벨 집합을 가진 함수를 근사할 수 없기 때문이다.
  • UOE 활성화 함수를 사용하여 $ d_x = 1 $의 경우를 분석함으로써 $ w^{*}_{\text{min}} = d_y $를 달성하고, 위상 불변성을 통해 고차원으로 확장한다.

실험 결과

연구 질문

  • RQ1임의의 활성화 함수를 가진 피드포워드 신경망에서 보편적 근사화를 위해 필요한 최소 폭에 대한 보편적 하한값은 무엇인가?
  • RQ2이 하한값은 특정 활성화 함수를 통해 달성될 수 있는가? 만약 가능하면 어떤 함수인가?
  • RQ3신경 ODE와 유량 맵 근사화가 최소 폭 보편적 근사화 달성에 어떻게 기여하는가?
  • RQ4왜 연속적이고 단조적인 활성화 함수는 특정 경우에 최소 폭을 달성하지 못하는가? 이에 배경이 되는 위상적 제약 조건은 무엇인가?
  • RQ5최소 폭 $ \max(d_x, d_y) $는 연속적 활성화 함수만으로도 달성 가능한가, 아니면 비연속적 또는 비단조화 함수가 필수적인가?

주요 결과

  • 임의의 활성화 함수를 가진 신경망의 최소 폭에 대한 보편적 하한값은 $ w^{*}_{\text{min}} = \max(d_x, d_y) $이며, 이는 유한 도메인에서 $ L^p $- 및 연속 노름 보편적 근사화에 모두 적용된다.
  • 이 하한값은 날카로움을 띤다: 누설 ReLU 네트워크는 $ w^{*}_{\text{min}} = \max(d_x, d_y, 2) $를 달성하고, 누설 ReLU+ABS 또는 UOE+FLOOR 네트워크는 $ w^{*}_{\text{min}} = \max(d_x, d_y) $를 달성함으로써 최적성을 입증한다.
  • $ L^p $-UAP의 경우, $ d_x > 1 $ 또는 $ d_y > 1 $일 때 누설 ReLU 네트워크가 신경 ODE와 유량 맵의 근사 능력을 활용하여 최소 폭 $ \max(d_x, d_y) $를 달성한다.
  • $ C $-UAP의 경우, $ d_x = 1 $일 때 $ w^{*}_{\text{min}} = d_y $를 달성하기 위해 UOE+FLOOR 네트워크를 사용함으로써 최소 폭 $ \max(d_x, d_y) $를 달성한다.
  • 위상적 제약 조건을 통해 연속적이고 단조적인 활성화 함수(예: 누설 ReLU)는 $ d_x \geq d_y $일 경우 하한값을 달성할 수 없음을 입증하며, 이는 호메오모르피즘이 비자명한 레벨 집합을 가진 함수를 근사할 수 없기 때문이다.
  • 신경 ODE 기반의 구축 방식은 보편적 근사화에 대해 기하학적 및 위상적 관점을 제공하며, 미분형 사상과 유량 맵 근사화와의 연결을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.