[논문 리뷰] Lower bounds over Boolean inputs for deep neural networks with ReLU gates
이 논문은 랜덤 제한과 서명 랭크 방법을 사용하여 부울 입력을 갖는 딥 ReLU 신경망의 크기에 대한 새로운 하한을 확립한다. LTF-of-ReLU 회로에서 1/2+ε 입력에서 앤드리에프 함수를 계산하는 데 있어서 거의 선형 크기 하한 Ω(ε²⁽¹⁻δ⁾n¹⁻δ)을 증명하며, 깊이가 O(n^ξ)이고 ξ<1/8인 ReLU 회로에 대해 차원에 대한 지수적 하한을, 하단층의 가중치 제약 조건 하에 도출한다.
Motivated by the resurgence of neural networks in being able to solve complex learning tasks we undertake a study of high depth networks using ReLU gates which implement the function $x \\mapsto \\max\\{0,x\\}$. We try to understand the role of depth in such neural networks by showing size lowerbounds against such network architectures in parameter regimes hitherto unexplored. In particular we show the following two main results about neural nets computing Boolean functions of input dimension $n$, 1. We use the method of random restrictions to show almost linear, $\\Omega(\\epsilon^{2(1-\\delta)}n^{1-\\delta})$, lower bound for completely weight unrestricted LTF-of-ReLU circuits to match the Andreev function on at least $\\frac{1}{2} +\\epsilon$ fraction of the inputs for $\\epsilon > \\sqrt{2\\frac{\\log^{\\frac {2}{2-\\delta}}(n)}{n}}$ for any $\\delta \\in (0,\\frac 1 2)$ 2. We use the method of sign-rank to show exponential in dimension lower bounds for ReLU circuits ending in a LTF gate and of depths upto $O(n^{\\xi})$ with $\\xi < \\frac{1}{8}$ with some restrictions on the weights in the bottom most layer. All other weights in these circuits are kept unrestricted. This in turns also implies the same lowerbounds for LTF circuits with the same architecture and the same weight restrictions on their bottom most layer. Along the way we also show that there exists a $\\mathbb{R}^ n\ ightarrow \\mathbb{R}$ Sum-of-ReLU-of-ReLU function which Sum-of-ReLU neural nets can never represent no matter how large they are allowed to be.
연구 동기 및 목표
- 부울 함수를 계산하는 회로에 대해 크기 하한을 확립함으로써 딥 ReLU 신경망에서 깊이의 역할을 이해하는 것.
- 기존 회로 복잡도 이론에서 다루지 않은 바이어스된 ReLU 기반 회로의 매개변수 영역을 탐색하는 것.
- 특히 표현 능력 측면에서 부울 입력에 제한된 ReLU 네트워크의 한계를 조사하는 것.
- 어떤 유한 크기의 Sum-of-ReLU-of-ReLU 함수도 어떤 크기의 유한한 Sum-of-ReLU 네트워크로도 표현될 수 없다는 것을 보여주는 것.
- 기존의 하한 기법인 랜덤 제한과 서명 랭크를 부울 입력을 갖는 ReLU 네트워크로 확장하는 것.
제안 방법
- 랜덤 입력 제한 하에서 LTF-of-ReLU 회로의 강건성을 분석하기 위해 랜덤 제한 기법을 적용하여 거의 선형 크기 하한을 도출한다.
- 서명 랭크 기법을 사용하여 깊이가 O(n^ξ)이고 ξ<1/8인 ReLU 회로에 대해 차원에 대한 지수적 하한을 유도한다. 이는 LTF 게이트로 끝나는 회로에 대해 적용된다.
- 각 층의 출력을 연속된 행과 열 분할에 따라 블록-상수 행렬으로 표현하는 행렬 기반의 ReLU 회로 표현을 사용한다.
- 회로 깊이에 대한 귀납적 추론을 적용하여, 하위 층의 블록-상수 행렬 합이 너비와 가중치 파rameter의 곱에 의해 제어되는 더 정교한 블록 구조를 갖는 행렬을 생성함을 보여준다.
- w개의 행렬 각각이 D개의 블록을 갖는 블록-상수일 때, 그 합은 O(w(D−1)+1)개의 연속된 블록을 갖는 행렬이 되며, 이는 회로 복잡도에 대한 귀납적 제어를 가능하게 한다는 핵심 주장 도입.
- ReLU 게이트를 max{0, b + ⟨w,x⟩}로 모델링하고, ReLU의 조각별 선형 성질을 활용하여 회로 출력을 하위 층 출력의 선형 조합에 대한 최대값 연산으로 표현한다.
실험 결과
연구 질문
- RQ1LTF 출력 게이트를 갖는 딥 ReLU 네트워크의 최소 크기는 무엇인가? 이는 앤드리에프 함수를 랜덤 추측보다 일정한 우월도로 계산할 수 있도록 해야 한다.
- RQ2하단층의 가중치 제약 조건 하에 부울 입력으로 제한된 ReLU 네트워크의 깊이가 유한할 경우, 지수적 크기 하한을 확립할 수 있는가?
- RQ3Sum-of-ReLU-of-ReLU로 계산 가능한 함수 중 어떤 함수도 어떤 크기의 유한한 Sum-of-ReLU 네트워크로도 표현될 수 없는가?
- RQ4랜덤 제한과 서명 랭크와 같은 고전적 회로 복잡도 기법이 부울 초입자에서 입력이 제한된 ReLU 네트워크에 어떻게 적용되는가?
- RQ5깊이와 가중치 제약 조건이 부울 함수를 계산할 때 ReLU 네트워크의 표현 능력에 어떤 영향을 미치는가?
주요 결과
- LTF-of-ReLU 회로에 대해 1/2+ε 이상의 입력에서 앤드리에프 함수를 계산하는 데 있어서, ε > √(2 log²⁽²−δ⁾(n)/n) 조건을 만족할 경우, 거의 선형 크기 하한 Ω(ε²⁽¹−δ⁾n¹−δ)을 확립한다. 여기서 δ∈(0,1/2).
- 하단층의 경미한 가중치 제약 조건 하에, 깊이가 O(n^ξ)이고 ξ<1/8인 ReLU 회로에 대해 서명 랭크 기법을 사용하여 차원에 대한 지수적 하한을 증명한다.
- 동일한 아키텍처와 가중치 제약 조건 하에, 동일한 지수적 하한이 LTF 회로에도 적용되며, 이는 임계값 게이트 네트워크로의 결과 확장을 가능하게 한다.
- 모든 크기의 유한한 Sum-of-ReLU 신경망으로도 표현될 수 없는 실수에서 실수로의 함수 f: ℝⁿ → ℝ 형태의 Sum-of-ReLU-of-ReLU 함수가 존재함을 증명한다.
- 귀납적 행렬 블록 구조 분석에 따르면, k층 ReLU 회로의 출력 행렬에 포함된 연속된 블록 수는 O((∏ᵢ₌₁ᵏ wᵢ)(mW))의 비율로 증가한다. 여기서 wᵢ는 각 층의 너비이고 W는 가중치 크기의 상한이다.
- 모든 층이 하단층을 제외하고 가중치 제약 없이 허용되더라도, 특정 부울 함수를 계산할 때 깊이와 가중치 제약 조건 하에서 여전히 강력한 제약을 받는다는 것이 분석을 통해 확인된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.