Skip to main content
QUICK REVIEW

[논문 리뷰] Fractal Structure and Generalization Properties of Stochastic Optimization Algorithms

Alexander Camuto, George Deligiannidis|arXiv (Cornell University)|2021. 06. 09.
Stochastic Gradient Optimization Techniques참고 문헌 27인용 수 10
한 줄 요약

이 논문은 무작위 반복 함수 시스템(RIFS)에서 유도된 불변 측도의 분수차원과 확률적 최적화 알고리즘의 일반화 성능 사이의 새로운 프레임워크를 제안한다. SGD와 같은 알고리즘을 RIFS로 모델링함으로써, 저자들은 일반화 오차가 기저가 되는 분수적 구조의 복잡성(Hausdorff 차원)에 의해 제한됨을 증명하며, 단계 크기, 배치 크기, 헤시안 기하학에 따라 명시적인 경계를 제시한다.

ABSTRACT

Understanding generalization in deep learning has been one of the major challenges in statistical learning theory over the last decade. While recent work has illustrated that the dataset and the training algorithm must be taken into account in order to obtain meaningful generalization bounds, it is still theoretically not clear which properties of the data and the algorithm determine the generalization performance. In this study, we approach this problem from a dynamical systems theory perspective and represent stochastic optimization algorithms as random iterated function systems (IFS). Well studied in the dynamical systems literature, under mild assumptions, such IFSs can be shown to be ergodic with an invariant measure that is often supported on sets with a fractal structure. As our main contribution, we prove that the generalization error of a stochastic optimization algorithm can be bounded based on the `complexity' of the fractal structure that underlies its invariant measure. Leveraging results from dynamical systems theory, we show that the generalization error can be explicitly linked to the choice of the algorithm (e.g., stochastic gradient descent -- SGD), algorithm hyperparameters (e.g., step-size, batch-size), and the geometry of the problem (e.g., Hessian of the loss). We further specialize our results to specific problems (e.g., linear/logistic regression, one hidden-layered neural networks) and algorithms (e.g., SGD and preconditioned variants), and obtain analytical estimates for our bound.For modern neural networks, we develop an efficient algorithm to compute the developed bound and support our theory with various experiments on neural networks.

연구 동기 및 목표

  • 고도의 용량을 지닌 현대 딥 네ural 네트워크가 잘 일반화되는 이유를 이론적으로 이해하는 데 있어 데이터 및 알고리즘의 동역학을 일반화 경계에 통합함으로써 이론적 간극을 메우기 위해.
  • SGD와 같은 확률적 최적화 알고리즘을 무작위 반복 함수 시스템(RIFS)으로 모델링하여 장기적인 불변 측도를 연구할 수 있도록 하기 위해.
  • 이러한 불변 측도의 분수기하학적 성질과 훈련된 모델의 일반화 오차 사이의 연결 고리를 설정하기 위해.
  • 알고리즘 하이퍼파rameter(단계 크기, 배치 크기)와 문제 기하학(Hessian, 데이터 분포)에 명시적으로 의존하는 명시적이고 비어 있지 않은 일반화 경계를 유도하기 위해.

제안 방법

  • 최소 배치 샘플링에 기반하여 유한한 집합에서 무작위로 선택된 함수에 해당하는 반복 함수 시스템(RIFS)으로서 확률적 최적화 알고리즘을 수학적으로 정의한다.
  • 동역학 시스템 이론을 활용하여, 미약한 조건 하에서 RIFS가 분수집합 위에 지지되는 유일한 불변 측도로 수렴함을 보인다.
  • 일반화 오차를 경험 위험과 인구 위험의 차이로 정의하고, 불변 측도의 Hausdorff 차원을 사용하여 이를 경계한다.
  • 무작위 함수의 리아풀로프 지수와 수축 성질을 이용하여 불변 측도의 Hausdorff 차원에 대한 상한을 도출한다.
  • 분수차원에 대한 경계를 활용하여 정보 이론적 및 기하학적 추론을 통해 알고리즘 및 데이터에 의존하는 명시적 일반화 오차 경계를 유도한다.
  • 현대 신경망에 대해 분수차원 기반 경계를 효율적으로 계산할 수 있는 알고리즘을 개발하여 실증적 검증을 가능하게 한다.

실험 결과

연구 질문

  • RQ1확률적 최적화 알고리즘의 일반화 성능을 그들의 불변 측도의 기하학적 복잡성과 이론적으로 어떻게 연결할 수 있는가?
  • RQ2알고리즘의 동역학에 의해 유도된 불변 측도의 분수적 구조가 일반화 오차를 결정하는 데 어떤 역할을 하는가?
  • RQ3분수차원을 통해 알고리즘 하이퍼파rameter(예: 단계 크기, 배치 크기)와 데이터 기하학(예: 손실 함수의 헤시안)에 명시적으로 의존하는 일반화 경계를 도출할 수 있는가?
  • RQ4이론적 경계는 현대 신경망에서의 실측 일반화 오차와 어떻게 비교되는가?
  • RQ5불변 측도의 분수차원은 효율적으로 추정할 수 있으며, 일반화 성능의 실용적 대체 측정치로 사용될 수 있는가?

주요 결과

  • 확률적 최적화 알고리즘의 일반화 오차는 해당 무작위 반복 함수 시스템(RIFS)의 불변 측도의 Hausdorff 차원에 의해 제한된다.
  • 일정한 단계 크기의 SGD에 대해, 불변 측도는 분수집합(예: 칸토어 유사 집합) 위에 지지되며, 그 Hausdorff 차원은 $ \frac{b \log(n/b)}{\log(1 / (1 - \eta M^{-1}\lambda + \frac{1}{4}\eta m^{-1}R^2))} $ 로 경계된다. 여기서 $ \lambda $ 는 헤시안의 최소 고유값이다.
  • 선형 회귀 및 로지스틱 회귀에서는 경계가 $ \frac{\log(n/b)}{\log(1 / (1 - \eta M^{-1}\lambda_r + \eta m^{-1}R^2 \cdot 2/t_0))} $ 로 단순화되며, 손실 함수의 곡률에 명시적인 의존성이 있다.
  • 일반화층이 하나인 신경망의 경우, 경계는 헤시안의 스펙트럼 성질과 활성화 함수의 이阶 도함수에 따라 달라지며, $ \overline{\dim}_{\mathrm{H}}\mu_{W|\mathbf{S}_n} \leq \frac{\log(n/b)}{\log(1 / (1 - \eta M^{-1}\lambda + \eta m^{-1}R^2 / (4\rho)))} $ 로 표현된다.
  • 유도된 경계는 비어 있지 않으며, 알고리즘 선택(단계 크기, 배치 크기)과 데이터 기하학(Hessian, 특성 노름)에 명시적으로 의존한다.
  • 딥 네트워크에 대해 분수차원 기반 경계를 효율적으로 계산할 수 있는 알고리즘을 개발하였으며, 실험을 통해 실측 일반화 오차와의 상관관계를 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.