Skip to main content
QUICK REVIEW

[논문 리뷰] Generalization Bounds for Neural Networks via Approximate Description Length

Amit Daniely, Elad Granot|arXiv (Cornell University)|2019. 10. 13.
Neural Networks and Applications인용 수 5
한 줄 요약

이 논문은 가중치 노름 제약 조건이 있는 완전 연결 신경망에 대해 더 날카운 일반화 경계를 유도하기 위해 새로운 근사 기술 길이(ADL) 프레임워크를 소개한다. 선형 및 비선형 연산을 사용한 함수 조합의 기술 길이를 분석함으로써, 샘플 복잡도 $\tilde{O}(dR^2/\epsilon^2)$를 확립하며, 이는 로그 요소를 제외한 최적성이며, 이전 경계보다 $d$ 배 향상된다. 특히 절대 노름이 아닌 초기화로부터의 가중치 편차를 고려할 경우 더욱 그렇다.

ABSTRACT

We investigate the sample complexity of networks with bounds on the magnitude of its weights. In particular, we consider the class \[ H=\left\{W_t\circρ\circ \ldots\circρ\circ W_{1} :W_1,\ldots,W_{t-1}\in M_{d, d}, W_t\in M_{1,d} ight\} \] where the spectral norm of each $W_i$ is bounded by $O(1)$, the Frobenius norm is bounded by $R$, and $ρ$ is the sigmoid function $\frac{e^x}{1+e^x}$ or the smoothened ReLU function $ \ln (1+e^x)$. We show that for any depth $t$, if the inputs are in $[-1,1]^d$, the sample complexity of $H$ is $ ilde O\left(\frac{dR^2}{ε^2} ight)$. This bound is optimal up to log-factors, and substantially improves over the previous state of the art of $ ilde O\left(\frac{d^2R^2}{ε^2} ight)$. We furthermore show that this bound remains valid if instead of considering the magnitude of the $W_i$'s, we consider the magnitude of $W_i - W_i^0$, where $W_i^0$ are some reference matrices, with spectral norm of $O(1)$. By taking the $W_i^0$ to be the matrices at the onset of the training process, we get sample complexity bounds that are sub-linear in the number of parameters, in many typical regimes of parameters. To establish our results we develop a new technique to analyze the sample complexity of families $H$ of predictors. We start by defining a new notion of a randomized approximate description of functions $f:X o\mathbb{R}^d$. We then show that if there is a way to approximately describe functions in a class $H$ using $d$ bits, then $d/ε^2$ examples suffices to guarantee uniform convergence. Namely, that the empirical loss of all the functions in the class is $ε$-close to the true loss. Finally, we develop a set of tools for calculating the approximate description length of classes of functions that can be presented as a composition of linear function classes and non-linear functions.

연구 동기 및 목표

  • 고전적 일반화 경계와 딥 러닝의 경험적 성공 간 격차를 메우기 위해 가중치 크기 제약 조건을 통합하고자 한다.
  • ReLU 및 시그모이드 네트워크에 대해 $\tilde{O}(d^2R^2/\epsilon^2)$의 최신 기술 샘플 복잡도 경계를 향상시키고자 한다.
  • 신경망 함수 클래스의 샘플 복잡도를 분석하기 위한 새로운 이론적 프레임워크인 근사 기술 길이(ADL)를 개발하고자 한다.
  • 초기화된 가중치에 대한 상대적 노름을 측정할 경우, 파rameter 수에 대해 비선형 샘플 복잡도가 달성 가능하다는 것을 보여주고자 한다.
  • 작은 가중치 업데이트를 특징으로 하는 실용적 훈련 환경에 대해 노름 기반 일반화 경계의 적용 범위를 확장하고자 한다.

제안 방법

  • 함수 $f: \mathcal{X} \to \mathbb{R}^d$ 에 대한 랜덤화된 근사 기술 길이를 $d$ 비트로 정의한다.
  • 함수 클래스 $\mathcal{H}$ 가 길이 $d$ 의 근사 기술 길이를 갖는다면, $d/\epsilon^2$ 개의 샘플로 충분히 $\epsilon$ 이내로 균일 수렴이 가능하다는 것을 증명한다.
  • 선형 연산과 비선형 활성화 함수의 조합에 대한 근사 기술 길이를 계산하기 위한 도구를 개발한다.
  • 가중치 행렬의 스펙트럼 및 프로베니우스 노름 제약 조건을 사용하여 네트워크 클래스의 기술 길이를 제한한다.
  • 시그모이드 및 스무드 리elu 활성화를 갖는 완전 연결 네트워크에 프레임워크를 적용하여, 기술 길이가 $O(dR^2)$ 로 스케일링됨을 보여준다.
  • 가중치 노름을 초기화 행렬 $W_i^0$ 에 대해 측정하는 경우를 분석하여, $\|W_i - W_i^0\|_F \leq R$ 일 때 더 날카운 경계를 도출한다.

실험 결과

연구 질문

  • RQ1절대 값이 아닌 초기화에 대한 상대적 가중치 노름을 측정함으로써, 깊은 네트워크에 대해 더 날카운 일반화 경계를 도출할 수 있는가?
  • RQ2가중치가 유한한 완전 연결 네트워크에 대해 샘플 복잡도 $\tilde{O}(dR^2/\epsilon^2)$ 는 로그 요소를 제외한 최적성인가?
  • RQ3근사 기술 길이(ADL) 프레임워크를 사용하여 파rameter 수에 대해 비선형일 수 있는 일반화 경계를 도출할 수 있는가?
  • RQ4ADL 프레임워크는 컨볼루션 또는 잔여 연결 네트워크와 같은 다른 아키텍처로 확장 가능한가?
  • RQ5ADL 접근법은 지도 학습을 초월하여 군집, 주성분 분석 및 사전 학습을 포함한 다른 분야로 일반화될 수 있는가?

주요 결과

  • 논문은 ReLU 및 시그모이드 활성화를 갖는 완전 연결 신경망에 대해 $\tilde{O}(dR^2/\epsilon^2)$ 의 일반화 경계를 확립하며, 이는 로그 요소를 제외한 최적성이다.
  • 이 경계는 이전 최신 기술 경계인 $\tilde{O}(d^2R^2/\epsilon^2)$ 보다 $d$ 배 향상된다.
  • 가중치 노름을 초기화 행렬 $W_i^0$ 에 대해 측정할 경우, $R \sim \sqrt{d}$ 와 같은 일반적인 환경에서 파rameter 수에 대해 비선형 샘플 복잡도가 달성된다.
  • 저자들은 $\tilde{O}(dR^2/\epsilon^2)$ 가 로그 요소를 제외한 최적성임을 보여주는 하한선을 증명하여 상한선의 최적성 확인한다.
  • ADL 프레임워크는 선형 및 비선형 연산의 조합으로 구성된 함수 클래스 분석에 효과적임을 보이며, 일반화 분석을 위한 새로운 이론적 도구를 제공한다.
  • 실험적 증거는 $\|W_i - W_i^0\|_F$ 가 $\|W_i\|_F$ 보다 훨씬 작은 편임을 시사하며, 개선된 경계의 실용적 관련성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.