Skip to main content
QUICK REVIEW

[논문 리뷰] Size and Depth Separation in Approximating Benign Functions with Neural Networks

Gal Vardi, Daniel Reichman|arXiv (Cornell University)|2021. 01. 30.
Machine Learning and Algorithms참고 문헌 43인용 수 4
한 줄 요약

이 논문은 '유해하지 않은' 함수—다항식적으로 유계된 리프시츠 상수와 효율적인 계산 가능성 조건을 만족하는 함수—를 근사하는 데에 ReLU 신경망의 표현 능력을 조사한다. 이는 이러한 함수에 대해 깊이 및 크기 분리 성립을 증명하는 데에 복잡도 이론적 장벽을 규명하며, 깊이 4를 초월하는 깊이 분리나 O(d log²d)를 초월하는 크기 분리를 증명하는 것은 계산 복잡도 이론에서 오랫동안 남아있는 문제를 해결하는 것으로 이어질 것임을 보여준다. 또한, Ω(d/log d) 크기의 네트워크가 필요로 하는 명시적인 유해하지 않은 함수를 구성함으로써, O(d)와 o(d/log d) 크기의 네트워크 사이에 엄격한 분리를 입증한다.

ABSTRACT

When studying the expressive power of neural networks, a main challenge is to understand how the size and depth of the network affect its ability to approximate real functions. However, not all functions are interesting from a practical viewpoint: functions of interest usually have a polynomially-bounded Lipschitz constant, and can be computed efficiently. We call functions that satisfy these conditions "benign", and explore the benefits of size and depth for approximation of benign functions with ReLU networks. As we show, this problem is more challenging than the corresponding problem for non-benign functions. We give barriers to showing depth-lower-bounds: Proving existence of a benign function that cannot be approximated by polynomial-size networks of depth $4$ would settle longstanding open problems in computational complexity. It implies that beyond depth $4$ there is a barrier to showing depth-separation for benign functions, even between networks of constant depth and networks of nonconstant depth. We also study size-separation, namely, whether there are benign functions that can be approximated with networks of size $O(s(d))$, but not with networks of size $O(s'(d))$. We show a complexity-theoretic barrier to proving such results beyond size $O(d\log^2(d))$, but also show an explicit benign function, that can be approximated with networks of size $O(d)$ and not with networks of size $o(d/\log d)$. For approximation in $L_\infty$ we achieve such separation already between size $O(d)$ and size $o(d)$. Moreover, we show superpolynomial size lower bounds and barriers to such lower bounds, depending on the assumptions on the function. Our size-separation results rely on an analysis of size lower bounds for Boolean functions, which is of independent interest: We show linear size lower bounds for computing explicit Boolean functions with neural networks and threshold circuits.

연구 동기 및 목표

  • 유해하지 않은 함수—다항식적으로 유계된 리프시츠 상수와 효율적인 계산 가능성 조건을 만족하는 함수—의 근사에서 네트워크 크기와 깊이가 어떻게 영향을 미치는지 이해하는 것.
  • 특히 실제 학습 작업의 맥락에서 깊이와 크기가 이러한 함수 근사에 있어 의미 있는 이점을 제공하는지 조사하는 것.
  • 유해하지 않은 함수에 대해 깊이 및 크기 분리를 증명하는 데에 존재하는 기본적인 복잡도 이론적 장벽을 규명하는 것.
  • 요구되는 네트워크 크기 또는 깊이에서 엄격한 분리를 보여주는 명시적인 유해하지 않은 함수의 예를 구성하는 것.

제안 방법

  • 유해하지 않은 함수를 다항식(d)으로 유계된 리프시츠 상수를 가지며, 지수적 또는 다항식 시간 내에서 계산 가능한 함수로 정의한다.
  • 깊이 분리를 증명하는 문제를 알려진 복잡도 이론적 가정, 예를 들어 EXP ⊈ TC⁰_{k-2}로 환원한다.
  • 이동된 입력에 대한 확률적 평균을 사용하여, 단일 네트워크가 이동된 정의역에서 함수를 근사할 수 있음을 보이며, 이로 인해 크기 감소가 가능해진다.
  • 명시적인 부울 함수(예: 집합의 상호배타성)를 계산하는 O(d) 크기의 신경망을 구성하며, 이 함수는 다항식적으로 유계된 리프시츠 성질을 가진다.
  • 네트워크 근사 결과에 임계값 변환을 적용하여 부울 출력을 복구하고, 네트워크 크기와 부울 회로 하한값을 연결한다.
  • 기존의 임계값 회로에 대한 선형 크기 하한값을 활용하여, ReLU 네트워크에 대한 크기 하한값을 도출한다.

실험 결과

연구 질문

  • RQ1깊이가 깊이 4를 초월할 경우, 특히 깊이 4를 초월하는 깊이에서 유해하지 않은 함수 근사에 있어 유의미한 이점을 제공할 수 있는가?
  • RQ2유해하지 않은 함수에 대해 상수 깊이 네트워크에서 깊이 분리를 증명하는 데에 기본적인 복잡도 이론적 장벽이 존재하는가?
  • RQ3유해하지 않은 함수에 대해 크기 분리를 증명할 수 있으며, 이러한 증명의 한계는 무엇인가?
  • RQ4명시적인 유해하지 않은 함수를 근사하기 위해 필요한 최소 네트워크 크기는 얼마이며, 기존 하한값과 비교해보면 어떠한가?
  • RQ5유해하지 않은 함수에 대한 크기 및 깊이 분리는 TC⁰ 및 P와 같은 복잡도 클래스와 어떻게 관련이 있는가?

주요 결과

  • 유해하지 않은 함수가 깊이 4 이상의 다항식 크기 네트워크로 근사될 수 없다는 것을 증명하는 것은 EXP ⊈ TC⁰_{k-2}를 의미하며, 이는 복잡도 이론에서 오랫동안 남아있는 주요 문제이다.
  • O(d log²d)를 초월하는 크기 분리를 증명하는 데에는 복잡도 이론적 장벽이 존재하며, 이러한 결과는 회로 복잡도 이론에서 오랜 동안 남아있던 문제를 해결하게 된다.
  • O(d) 크기의 네트워크로 근사될 수 있지만 o(d/log d) 크기의 네트워크로는 근사될 수 없는 명시적인 유해하지 않은 함수가 존재하며, 이는 초수렴 크기 분리를 입증한다.
  • L∞ 근사에서, 크기 O(d)와 크기 o(d) 사이에 엄격한 분리가 존재하며, 이는 일부 유해하지 않은 함수에 대해 O(d)가 점근적으로 최적임을 보여준다.
  • 임계값 회로에 대한 선형 크기 하한값은 동일한 부울 함수를 계산하는 ReLU 네트워크에 대해 선형 크기 하한값을 유도하며, 이는 네트워크 크기 하한값을 증명하는 데 새로운 길을 열어준다.
  • 논문은 다항식 시간 내에 계산 가능한 유해하지 않은 함수를 구성하였으며, 이는 상수 깊이, O(d) 크기의 ReLU 네트워크로 계산 가능하지만, L∞ 오차 1/3 이내로 근사하는 데에는 Ω(d) 크기의 네트워크가 필요로 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.