Skip to main content
QUICK REVIEW

[논문 리뷰] Depth Separation for Neural Networks

Amit Daniely|arXiv (Cornell University)|2017. 02. 27.
Neural Networks and Applications인용 수 17
한 줄 요약

이 논문은 구 $ \mathbb{S}^{d-1} \times \mathbb{S}^{d-1} $ 위에서 정의된 특정 라디얼 함수 $ f(x, x') = g(\langle x, x' \rangle) $에 대해, $ g $ 가 저차수 다항함수로 잘 근사되지 않는 한, 다항식 크기이자 지수적 가중치 유계성 조건을 만족하는 깊이-2 신경망으로는 근사가 불가능하다는 것을 증명함으로써, 두 층과 세 층 신경망 간의 깊이 분리 성질을 확립한다. 핵심 결과는 $ g(x) = \sin(\pi d^3 x) $ 인 경우, 깊이-2 신경망은 $ 2^{\Omega(d \log d)} $ 개의 뉴런을 필요로 하지만, 깊이-3 신경망은 다항식 폭으로 이러한 함수를 근사할 수 있음을 보여주며, 균일 분포 하에서 표현 능력의 강력한 분리를 입증한다.

ABSTRACT

Let $f:\mathbb{S}^{d-1} imes \mathbb{S}^{d-1} o\mathbb{S}$ be a function of the form $f(\mathbf{x},\mathbf{x}') = g(\langle\mathbf{x},\mathbf{x}' angle)$ for $g:[-1,1] o \mathbb{R}$. We give a simple proof that shows that poly-size depth two neural networks with (exponentially) bounded weights cannot approximate $f$ whenever $g$ cannot be approximated by a low degree polynomial. Moreover, for many $g$'s, such as $g(x)=\sin(πd^3x)$, the number of neurons must be $2^{Ω\left(d\log(d) ight)}$. Furthermore, the result holds w.r.t.\ the uniform distribution on $\mathbb{S}^{d-1} imes \mathbb{S}^{d-1}$. As many functions of the above form can be well approximated by poly-size depth three networks with poly-bounded weights, this establishes a separation between depth two and depth three networks w.r.t.\ the uniform distribution on $\mathbb{S}^{d-1} imes \mathbb{S}^{d-1}$.

연구 동기 및 목표

  • 균일 분포 하에서 $ \mathbb{S}^{d-1} \times \mathbb{S}^{d-1} $ 위에서 깊이-2와 깊이-3 신경망 간의 표현 능력에 대한 엄밀한 분리를 확립하기 위해.
  • 작은 깊이-2 신경망으로 표현이 불가능한 광범위한 함수 클래스 $ f(x, x') = g(\langle x, x' \rangle) $ 를 규명하기 위해.
  • 깊이-2 신경망이 요구하는 뉴런 수에 대해 강력한 하한을 제시하여, 이전의 지수적 $ d $ 의 종속성 초월하여 $ d \log d $ 의 지수적 종속성을 입증하기 위해.
  • 깊이-3 아키텍처가 이러한 함수를 효율적으로 근사할 수 있음을 보여주어, 깊이-3 아키텍처 유리성을 입증하기 위해.

제안 방법

  • 구 위에서의 조화 분석, 특히 차수 $ n $ 의 구 조화 다항식으로의 투영을 사용하여 근사 오차를 분석한다.
  • 측도 $ \mu_d $ 하에서 $ f $ 와 차수-$(n-1)$ 다항식 공간 사이의 $ L^2 $-거리인 $ A_{n,d}(f) $ 를 정의하여 최적의 다항근사 오차를 캡처한다.
  • 모든 깊이-2 신경망과 목표 함수 $ F(x, x') = f(\langle x, x' \rangle) $ 사이의 $ L^2 $-거리에 대한 하한을 유도하며, 이는 $ A_{n,d}(f) $ 와 네트워크 폭/가중치 유계 조건에 의존한다.
  • 레마 6에 기반한 알려진 결과(리프루-근사)를 활용하여, 제어 가능한 폭과 가중치 유계 조건을 만족하는 깊이-3 신경망을 구성한다.
  • 측도 $ \mu_d $ 가 $ x \mapsto x_1 $ 를 통해 구 $ \mathbb{S}^{d-1} $ 위의 균일 측도의 후퇴임을 이용하여 정규직교 다항식 이론을 적용할 수 있도록 한다.
  • 레전드르 다항식과 그 성질을 활용하여 고차원에서 $ f $ 와 그 근사 오차의 행동을 분석한다.

실험 결과

연구 질문

  • RQ1다항식 크기와 지수적 유계 가중치를 갖는 깊이-2 ReLU 신경망은 구 위의 라디얼 함수 $ f(x, x') = g(\langle x, x' \rangle) $ 를 근사할 수 있는가?
  • RQ2만약 $ g $ 가 저차수 다항함수로 잘 근사되지 않는다면, 이러한 깊이-2 신경망이 필요한 최소 뉴런 수는 얼마인가?
  • RQ3다항식 폭과 유계 가중치를 갖는 깊이-3 신경망은 동일한 함수 클래스를 효율적으로 근사할 수 있는가?
  • RQ4균일 분포 하에서 $ \mathbb{S}^{d-1} \times \mathbb{S}^{d-1} $ 는 두 층과 세 층 신경망 간의 엄밀한 깊이 분리를 지원하는가?

주요 결과

  • $ g(x) = \sin(\pi d^3 x) $ 인 경우, 가중치가 $ 2^d $ 이하인 모든 깊이-2 ReLU 신경망의 근사 오차는 최소 $ \frac{1}{50e^2\pi^2} $ 이며, 이는 $ 2^{\Omega(d \log d)} $ 개의 뉴런을 필요로 함.
  • 이 하한은 이전 연구들이 단지 $ d $ 의 지수적 종속성만 보였던 것과 달리, $ d \log d $ 의 지수적 종속성을 입증함으로써 더 강력함.
  • 결과는 자연스럽고 대칭적인 도메인인 $ \mathbb{S}^{d-1} \times \mathbb{S}^{d-1} $ 위의 균일 분포 하에서도 성립함.
  • 증명은 고급 도구인 온도 분포를 사용하지 않고 기본적인 조화 분석에 기반하여 짧고 간결함.
  • 반면, 깊이-3 ReLU 신경망은 폭 $ \frac{16\pi d^5}{\epsilon} $ 과 가중치가 $ 2\pi d^3 $ 이하로 제어 가능한 조건에서 $ F(x, x') = f(\langle x, x' \rangle) $ 를 근사할 수 있으며, 이는 효율적인 표현 능력을 보여줌.
  • 논문은 엄밀한 깊이 분리를 확립하였으며, 일부 함수에 대해 깊이-2 신경망은 초다항식 크기의 네트워크가 필요로 하지만, 깊이-3 신경망은 다항식 크기로 동일한 근사를 달성함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.