[논문 리뷰] Generalization Bounds for Neural Networks via Approximate Description Length
이 논문은 가중치 노름 제약 조건이 있는 완전 연결 신경망에 대해 더 날카운 일반화 경계를 유도하기 위해 새로운 근사 기술 길이(ADL) 프레임워크를 소개한다. 선형 및 비선형 연산을 사용한 함수 조합의 기술 길이를 분석함으로써, 샘플 복잡도 $\tilde{O}(dR^2/\epsilon^2)$를 확립하며, 이는 로그 요소를 제외한 최적성이며, 이전 경계보다 $d$ 배 향상된다. 특히 절대 노름이 아닌 초기화로부터의 가중치 편차를 고려할 경우 더욱 그렇다.
We investigate the sample complexity of networks with bounds on the magnitude of its weights. In particular, we consider the class \[ H=\left\{W_t\circρ\circ \ldots\circρ\circ W_{1} :W_1,\ldots,W_{t-1}\in M_{d, d}, W_t\in M_{1,d} ight\} \] where the spectral norm of each $W_i$ is bounded by $O(1)$, the Frobenius norm is bounded by $R$, and $ρ$ is the sigmoid function $\frac{e^x}{1+e^x}$ or the smoothened ReLU function $ \ln (1+e^x)$. We show that for any depth $t$, if the inputs are in $[-1,1]^d$, the sample complexity of $H$ is $ ilde O\left(\frac{dR^2}{ε^2} ight)$. This bound is optimal up to log-factors, and substantially improves over the previous state of the art of $ ilde O\left(\frac{d^2R^2}{ε^2} ight)$. We furthermore show that this bound remains valid if instead of considering the magnitude of the $W_i$'s, we consider the magnitude of $W_i - W_i^0$, where $W_i^0$ are some reference matrices, with spectral norm of $O(1)$. By taking the $W_i^0$ to be the matrices at the onset of the training process, we get sample complexity bounds that are sub-linear in the number of parameters, in many typical regimes of parameters. To establish our results we develop a new technique to analyze the sample complexity of families $H$ of predictors. We start by defining a new notion of a randomized approximate description of functions $f:X o\mathbb{R}^d$. We then show that if there is a way to approximately describe functions in a class $H$ using $d$ bits, then $d/ε^2$ examples suffices to guarantee uniform convergence. Namely, that the empirical loss of all the functions in the class is $ε$-close to the true loss. Finally, we develop a set of tools for calculating the approximate description length of classes of functions that can be presented as a composition of linear function classes and non-linear functions.
연구 동기 및 목표
- 고전적 일반화 경계와 딥 러닝의 경험적 성공 간 격차를 메우기 위해 가중치 크기 제약 조건을 통합하고자 한다.
- ReLU 및 시그모이드 네트워크에 대해 $\tilde{O}(d^2R^2/\epsilon^2)$의 최신 기술 샘플 복잡도 경계를 향상시키고자 한다.
- 신경망 함수 클래스의 샘플 복잡도를 분석하기 위한 새로운 이론적 프레임워크인 근사 기술 길이(ADL)를 개발하고자 한다.
- 초기화된 가중치에 대한 상대적 노름을 측정할 경우, 파rameter 수에 대해 비선형 샘플 복잡도가 달성 가능하다는 것을 보여주고자 한다.
- 작은 가중치 업데이트를 특징으로 하는 실용적 훈련 환경에 대해 노름 기반 일반화 경계의 적용 범위를 확장하고자 한다.
제안 방법
- 함수 $f: \mathcal{X} \to \mathbb{R}^d$ 에 대한 랜덤화된 근사 기술 길이를 $d$ 비트로 정의한다.
- 함수 클래스 $\mathcal{H}$ 가 길이 $d$ 의 근사 기술 길이를 갖는다면, $d/\epsilon^2$ 개의 샘플로 충분히 $\epsilon$ 이내로 균일 수렴이 가능하다는 것을 증명한다.
- 선형 연산과 비선형 활성화 함수의 조합에 대한 근사 기술 길이를 계산하기 위한 도구를 개발한다.
- 가중치 행렬의 스펙트럼 및 프로베니우스 노름 제약 조건을 사용하여 네트워크 클래스의 기술 길이를 제한한다.
- 시그모이드 및 스무드 리elu 활성화를 갖는 완전 연결 네트워크에 프레임워크를 적용하여, 기술 길이가 $O(dR^2)$ 로 스케일링됨을 보여준다.
- 가중치 노름을 초기화 행렬 $W_i^0$ 에 대해 측정하는 경우를 분석하여, $\|W_i - W_i^0\|_F \leq R$ 일 때 더 날카운 경계를 도출한다.
실험 결과
연구 질문
- RQ1절대 값이 아닌 초기화에 대한 상대적 가중치 노름을 측정함으로써, 깊은 네트워크에 대해 더 날카운 일반화 경계를 도출할 수 있는가?
- RQ2가중치가 유한한 완전 연결 네트워크에 대해 샘플 복잡도 $\tilde{O}(dR^2/\epsilon^2)$ 는 로그 요소를 제외한 최적성인가?
- RQ3근사 기술 길이(ADL) 프레임워크를 사용하여 파rameter 수에 대해 비선형일 수 있는 일반화 경계를 도출할 수 있는가?
- RQ4ADL 프레임워크는 컨볼루션 또는 잔여 연결 네트워크와 같은 다른 아키텍처로 확장 가능한가?
- RQ5ADL 접근법은 지도 학습을 초월하여 군집, 주성분 분석 및 사전 학습을 포함한 다른 분야로 일반화될 수 있는가?
주요 결과
- 논문은 ReLU 및 시그모이드 활성화를 갖는 완전 연결 신경망에 대해 $\tilde{O}(dR^2/\epsilon^2)$ 의 일반화 경계를 확립하며, 이는 로그 요소를 제외한 최적성이다.
- 이 경계는 이전 최신 기술 경계인 $\tilde{O}(d^2R^2/\epsilon^2)$ 보다 $d$ 배 향상된다.
- 가중치 노름을 초기화 행렬 $W_i^0$ 에 대해 측정할 경우, $R \sim \sqrt{d}$ 와 같은 일반적인 환경에서 파rameter 수에 대해 비선형 샘플 복잡도가 달성된다.
- 저자들은 $\tilde{O}(dR^2/\epsilon^2)$ 가 로그 요소를 제외한 최적성임을 보여주는 하한선을 증명하여 상한선의 최적성 확인한다.
- ADL 프레임워크는 선형 및 비선형 연산의 조합으로 구성된 함수 클래스 분석에 효과적임을 보이며, 일반화 분석을 위한 새로운 이론적 도구를 제공한다.
- 실험적 증거는 $\|W_i - W_i^0\|_F$ 가 $\|W_i\|_F$ 보다 훨씬 작은 편임을 시사하며, 개선된 경계의 실용적 관련성을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.