[논문 리뷰] Approximation capabilities of neural networks on unbounded domains
이 논문은 ReLU, ELU, 시그모이드 등의 단조성 활성화 함수를 갖는 얕은 신경망이 $L^p$ 함수를 $\mathbb{R} \times [0,1]^n$ 에서 $p \geq 2$ 에 대해 전역적으로 근사할 수 있음을 입증하지만, $m \geq 2$ 일 때 $\mathbb{R}^m \times [0,1]^n$ 에서는 어떤도 nonzero $L^p$ 함수를 표현하지 못함을 보여준다. 반면, 깊이가 3인 깊은 ReLU 네트워크는 $L^p(\mathbb{R}^n)$ 에서 전역 근사 가능성을 증명하며, 이는 비한정 영역에서 함수를 표현할 때 깊이의 본질적 이점임을 드러낸다.
In this paper, we prove that a shallow neural network with a monotone sigmoid, ReLU, ELU, Softplus, or LeakyReLU activation function can arbitrarily well approximate any L^p(p>=2) integrable functions defined on R*[0,1]^n. We also prove that a shallow neural network with a sigmoid, ReLU, ELU, Softplus, or LeakyReLU activation function expresses no nonzero integrable function defined on the Euclidean plane. Together with a recent result that the deep ReLU network can arbitrarily well approximate any integrable function on Euclidean spaces, we provide a new perspective on the advantage of multiple hidden layers in the context of ReLU networks. Lastly, we prove that the ReLU network with depth 3 is a universal approximator in L^p(R^n).
연구 동기 및 목표
- 비한정 영역, 특히 $\mathbb{R} \times [0,1]^n$ 과 $\mathbb{R}^m \times [0,1]^n$ 에서 얕은 신경망의 근사 능력을 조사하기 위해.
- ReLU, ELU, 시그모이드 등의 일반적인 활성화 함수를 갖는 얕은 네트워크가 비한정 영역에서 비영인 적분 가능 함수를 표현할 수 있는지 판단하기 위해.
- 비한정 영역에서 $L^p$ 함수를 근사할 때 깊은 ReLU 네트워크의 깊이가 가지는 표현적 이점에 대해 명확히 하기 위해.
- 비한정이고 비콤팩트 영역의 맥락에서 전역 근사 성질의 새로운 이론적 기반을 확립하기 위해.
제안 방법
- 균일 연속성과 푸리에 분석의 성질을 이용해, 단조성이고 다항식이 아닌 활성화 함수를 갖는 얕은 네트워크가 $p \geq 2$ 에 대해 $L^p(\mathbb{R} \times [0,1]^n)$ 함수를 근사할 수 있음을 증명하기 위해.
- 이러한 네트워크가 $m \geq 2$ 일 때 $\mathbb{R}^m \times [0,1]^n$ 에서는 어떤도 nonzero $L^p$ 함수를 표현하지 못함을 보여주기 위해, 이러한 영역에서 생성되는 함수 공간이 자명하다는 것을 증명하기 위해.
- 푸비니 정리를 사용하여, $\mathbb{R} \times \mathbb{R}^+$ 에서의 표현 불가능성 결과를 고차원 비한정 영역으로 확장하기 위해.
- 깊이 3의 ReLU 활성화 함수를 사용해 컴팩트하게 지지된, 영이 아닌 함수 $F$ 를 구성하고, 그 이동 및 스케일링이 $L^p(\mathbb{R}^n)$ 에서 조밀함을 증명하기 위해.
- ReLU 네트워크의 덧셈 및 애매변환에 대한 닫힘 성질과 함께, $F$ 의 스케일링 및 이동 복사본 집합 $S_F$ 가 $L^p(\mathbb{R}^n)$ 에서 조밀함을 활용하기 위해.
- 만일 $F$ 가 적분 가능하고 유계이며 거의 everywhere 연속적이며 영이 아닌 경우, [20]의 정리 5.1을 적용하여 $S_F$ 가 $L^p(\mathbb{R}^n)$ 에서 조밀함을 보임을 증명하기 위해.
실험 결과
연구 질문
- RQ1ReLU 또는 시그모이드 활성화 함수를 갖는 얕은 신경망이 $p \geq 2$ 에 대해 $\mathbb{R} \times [0,1]^n$ 에서 어떤도 $L^p$ 함수를 근사할 수 있는가?
- RQ2표준 활성화 함수를 갖는 얕은 네트워크가 $m \geq 2$ 일 때 $\mathbb{R}^m \times [0,1]^n$ 에서 어떤도 nonzero $L^p$ 함수를 표현하는가?
- RQ3ReLU 네트워크가 $L^p(\mathbb{R}^n)$ 에서 전역 근사자로 작동하기 위해 필요한 최소 깊이는 얼마인가?
- RQ4비한정 영역과 비콤팩트 영역에서 얕은 네트워크의 표현력은 어떻게 다름을 보이는가?
- RQ5비한정 영역에서 함수를 근사할 때 깊은 ReLU 네트워크의 깊이가 가지는 이점에 대한 이론적 근거는 무엇인가?
주요 결과
- 단조성 시그모이드, ReLU, ELU, 소프트플러스, 리키루렐리 활성화 함수를 갖는 얕은 신경망은 $p \geq 2$ 에 대해 $L^p(\mathbb{R} \times [0,1]^n)$ 함수를 임의로 잘 근사할 수 있다.
- 동일한 활성화 함수를 갖는 얕은 네트워크는 $m \geq 2$ 일 때 $\mathbb{R}^m \times [0,1]^n$ 에서는 어떤도 nonzero $L^p$ 함수를 표현하지 못하며, 이는 $\mathbb{R} \times \mathbb{R}^+$ 도 포함된다.
- 깊이 3(두 개의 은닉층 포함)인 ReLU 네트워크는 $p \in [1, \infty)$ 에 대해 $L^p(\mathbb{R}^n)$ 에서 전역 근사자로 작동하며, 이는 이전의 깊이 기준을 향상시킨다.
- 깊이 3의 ReLU 활성화 함수를 사용해 구성한 함수 $F$ 는 연속적이고, 음이 아닌, 컴팩트하게 지지되며, 영이 아니며, 그 이동 및 스케일링 복사본이 $L^p(\mathbb{R}^n)$ 에서 조밀함을 이룬다.
- 깊이 3의 ReLU 네트워크가 $\mathbb{R}^m \times [0,1]^n$ 에서 표현 불가능한 것은, 균일 연속성과 감쇠 조건으로 인해 $\mathbb{R} \times \mathbb{R}^+$ 에서도 비영인 함수를 표현할 수 없기 때문이다.
- 이 결과는 깊이의 본질적 이점이 드러나며, 얕은 네트워크가 고차원 비한정 영역에서 실패하는 반면, 깊이가 3인 깊은 네트워크는 $L^p(\mathbb{R}^n)$ 에서 전역 근사가 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.