Skip to main content
QUICK REVIEW

[논문 리뷰] An Analysis of the Expressiveness of Deep Neural Network Architectures Based on Their Lipschitz Constants

Siqi Zhou, Angela P. Schoellig|arXiv (Cornell University)|2019. 12. 24.
Neural Networks and Applications참고 문헌 18인용 수 6
한 줄 요약

이 논문은 깊이 신경망(DNN)의 표현력을 그들의 리프시츠 상수를 통해 분석하는 것을 제안하며, 랜덤 행렬 이론을 통해 가중치가 충분히 산산이 흩어져 있을 경우 리프시츠 상수가 깊이에 따라 지수적으로 증가하고 너비에 따라 다항식적으로 증가함을 보여준다. 주요 기여는 다양한 활성화 함수에 적용 가능한 이론적으로 탄탄하고 일반화 가능한 표현력 측정법을 제공하며, 안정적인 학습 기반 제어 시스템 설계에 대한 함의를 지닌다.

ABSTRACT

Deep neural networks (DNNs) have emerged as a popular mathematical tool for function approximation due to their capability of modelling highly nonlinear functions. Their applications range from image classification and natural language processing to learning-based control. Despite their empirical successes, there is still a lack of theoretical understanding of the representative power of such deep architectures. In this work, we provide a theoretical analysis of the expressiveness of fully-connected, feedforward DNNs with 1-Lipschitz activation functions. In particular, we characterize the expressiveness of a DNN by its Lipchitz constant. By leveraging random matrix theory, we show that, given sufficiently large and randomly distributed weights, the expected upper and lower bounds of the Lipschitz constant of a DNN and hence their expressiveness increase exponentially with depth and polynomially with width, which gives rise to the benefit of the depth of DNN architectures for efficient function approximation. This observation is consistent with established results based on alternative expressiveness measures of DNNs. In contrast to most of the existing work, our analysis based on the Lipschitz properties of DNNs is applicable to a wider range of activation nonlinearities and potentially allows us to make sensible comparisons between the complexity of a DNN and the function to be approximated by the DNN. We consider this work to be a step towards understanding the expressive power of DNNs and towards designing appropriate deep architectures for practical applications such as system control.

연구 동기 및 목표

  • 다양한 활성화 함수에 일반적으로 적용 가능한 일반적이고 해석 가능한 DNN 표현력 측정법을 개발하기 위해.
  • 완전히 연결된 피드포워드 DNN의 아키텍처적 깊이와 너비가 리프시츠 상수에 어떻게 영향을 미치는지 이해하기 위해.
  • 리프시츠 기반 분석을 통해 DNN 표현력과 학습 기반 제어 시스템의 안정성 간의 연관성을 규명하기 위해.
  • 이론적 분석에서 가우시안 분포를 가진 가중치를 가정하는 것이 실제 DNN에 얼마나 타당한지 평가하기 위해.
  • 시스템 제어와 같은 안전이 중요한 응용 분야에서 DNN 아키텍처 설계를 위한 지침을 제공하기 위해.

제안 방법

  • 저자는 1-리프시츠 활성화 함수와 i.i.d. 가우시안 가중치 행렬을 갖는 완전히 연결된 DNN을 모델링한다.
  • 랜덤 행렬 이론을 적용하여 DNN의 리프시츠 상수에 대한 기대 상한 및 하한을 유도한다.
  • 무거운 꼬리 특성을 가진 랜덤 행렬의 극단적 특이값을 분석하기 위해 Bai-Yin 법칙을 활용하여 가중치 행렬의 노름을 추정한다.
  • 리프시츠 상수는 리아푸노프 방정식의 해를 통해 유계화되며, 이는 네트워크 안정성과 아키텍처적 특성 간의 연결을 제공한다.
  • 50개의 DNN을 각 아키텍처당 샘플링하여 안정성 확률을 측정함으로써 실험적 검증을 수행한다.
  • 이론적 근사치를 훈련된 네트워크의 진짜 특이값과 비교하여 가우시안 가정의 탄력성 평가

실험 결과

연구 질문

  • RQ1무작위 가중치 초기화 하에서 DNN의 리프시츠 상수가 깊이와 너비에 따라 어떻게 척도가 변하는가?
  • RQ2리프시츠 상수가 다양한 활성화 함수에 걸쳐 일반적이고 해석 가능한 DNN 표현력 측정법으로 사용될 수 있는가?
  • RQ3리프시츠 상수는 학습 기반 제어 시스템의 안정성과 어떻게 관련이 있는가?
  • RQ4이론적 근사치를 위한 가우시안 가정이 실제 DNN의 가중치 행렬에 얼마나 타당한가?
  • RQ5제어 응용 분야에서 리프시츠 기반 표현력 분석으로부터 유도할 수 있는 DNN 설계 원칙은 무엇인가?

주요 결과

  • 가중치가 충분히 산산이 흩어져 있을 경우, DNN의 기대 리프시츠 상수는 깊이에 따라 지수적으로 증가하고 너비에 따라 다항식적으로 증가한다.
  • 300개의 뉴런을 갖는 단일 은닉층을 가진 DNN의 경우, 리프시츠 상수에 대한 추정 상한값은 안정성 기준 이하여 시스템 안정성을 보장한다.
  • 깊이가 증가하고 너비가 감소할수록 리프시츠 상수가 증가하여 시스템 안정성 확률이 감소하며, 10×30 아키텍처에서는 안정성 확률이 오직 32%에 불과하다.
  • 가우시안 가정 기반으로 유도된 최대 특이값의 이론적 근사치는 훈련된 네트워크의 진짜 값과 매우 유사하며, 오차는 $O(\sigma_w\sqrt{n})$ 수준이다.
  • 리프시츠 기반 표현력 측정법은 일반화 가능하며, DNN 복잡성과 근사하고자 하는 함수 간의 의미 있는 비교를 가능하게 한다.
  • 분석 결과는 깊이가 효율적인 함수 근사의 핵심 요소임을 지지하며, 이는 이전의 다른 측정법을 사용한 결과와 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.