Skip to main content
QUICK REVIEW

[논문 리뷰] Kolmogorov Width Decay and Poor Approximators in Machine Learning: Shallow Neural Networks, Random Feature Models and Neural Tangent Kernels

E Weinan, Stephan Wojtowytsch|arXiv (Cornell University)|2020. 05. 21.
Neural Networks and Applications참고 문헌 25인용 수 6
한 줄 요약

이 논문은 마르코프 너비 감쇠와 기계학습에서의 근사 한계를 연결하는 이론적 프레임워크를 수립하며, 얕은 신경망과 무작위 특징 모델이 $L^2$-노름에서 고차원 리프시츠 함수에 대해 열악한 근사자임을 보여준다. 이는 재생 커널 힐버트 공간(RKHS)과 무한히 넓은 신경망이 느린 마르코프 너비 감쇠로 인해 치명적인 차원의 역설에 시달리며, 같은 조건에서 두 층 신경망과 연관된 바론 공간이 훨씬 더 나은 근사 속도를 제공함을 증명한다.

ABSTRACT

We establish a scale separation of Kolmogorov width type between subspaces of a given Banach space under the condition that a sequence of linear maps converges much faster on one of the subspaces. The general technique is then applied to show that reproducing kernel Hilbert spaces are poor $L^2$-approximators for the class of two-layer neural networks in high dimension, and that multi-layer networks with small path norm are poor approximators for certain Lipschitz functions, also in the $L^2$-topology.

연구 동기 및 목표

  • 고차원 공간에서 기계학습 모델의 근사 능력에 대한 근본적 한계를 규명하는 것.
  • 이론적으로 표현력은 갖추고 있음에도 불구하고, 무작위 특징 모델과 무한히 넓은 신경망이 리프시츠 함수에 대해 왜 성능이 열 劣하는지 설명하는 것.
  • 마르코프 너비 감쇠를 바탕으로 한 일반적인 추상적 프레임워크를 수립하여 다양한 함수 공간 간의 근사 속도를 비교하는 것.
  • 두 층 네트워크에 연관된 바론 공간과 깊은 네트워크에 연관된 트리 구조 함수 공간이 고차원 $L^2$-근사에서 RKHS와 리프시츠 공간을 능가함을 보여주는 것.

제안 방법

  • Banach 공간의 두 부분공간에서 선형 연산자의 수렴 속도가 마르코프 너비 감쇠 속도와 연결되는 추상적 보조정리를 개발한다.
  • 이 보조정리를 적용하여 바론 공간(두 층 네트워크)과 리프시츠 공간 간의 근사, 그리고 RKHS와 바론 공간 간의 근사 비교를 수행한다.
  • 몬테카를로 유형의 적분 연산자를 사용하여 바론 공간과 리프시츠 공간에서의 수렴을 분석하고, 바론 공간에서 더 빠른 감쇠를 보임을 보인다.
  • RKHS 커널의 고유공간에 대한 투영을 사용하여 RKHS와 바론 공간 간의 수렴을 비교하고, RKHS에서 더 느린 감쇠를 드러낸다.
  • 연산자 노름 차이를 이용하여 마르코프 너비 감쇠에 대한 정량적 하한을 유도한다: $\|A_n - A\|_{L(X,W)} \leq C_X n^{-\alpha}$ 및 $\|A_n - A\|_{L(Y,W)} \geq c_Y n^{-\beta}$, 여기서 $\beta < \alpha$.
  • 너비 감쇠 속도 $\rho(t) \gtrsim t^{-\beta/(α - \beta)}$를 증명하여, 느린 감쇠가 열악한 근사 성능을 암시함을 보인다.

실험 결과

연구 질문

  • RQ1왜 무작위 특징 모델과 무한히 넓은 신경망은 $L^2$에서 고차원 리프시츠 함수를 효율적으로 근사하지 못하는가?
  • RQ2RKHS가 바론 공간에 비해 고차원에서 왜 성능이 열 劣하는가에 대한 근본적 이유는 무엇인가?
  • RQ3다양한 함수 공간 간의 기계학습 모델 근사 갭을 설명할 수 있는 일반적인 이론적 프레임워크가 존재하는가?
  • RQ4다른 부분공간에서 선형 연산자의 수렴 속도는 마르코프 너비 감쇠와 근사 품질에 어떻게 관련되는가?

주요 결과

  • 재생 커널 힐버트 공간(RKHS)은 고차원에서 두 층 신경망의 $L^2$-근사자로 열 劣하며, 마르코프 너비가 $t^{-\beta/(α - \beta)}$로 느리게 감쇠한다.
  • 무한히 넓은 무작위 특징 모델과 신경접선 커널(NTK)은 $L^2([0,1]^d)$에서 일반 리프시츠 함수를 근사할 때 차원의 역설에 시달린다.
  • 논문은 마르코프 너비 감쇠에 대한 일반적인 하한을 증명한다: $\rho(t) \geq C \cdot t^{-\beta/(α - \beta)}$ ($t \geq c_Y/(2C_X)$), 여기서 $\beta < \alpha$.
  • 유한한 바론 노름을 갖는 두 층 네트워크는 RKHS보다 $L^2$에서 훨씬 더 빠른 감쇠 속도로 함수를 근사할 수 있으며, 이는 훨씬 뛰어난 근사 능력을 시사한다.
  • 작은 경로 노름을 갖는 다층 네트워크 역시 고차원에서 리프시츠 함수를 근사하는 데에 열 劣한 근사자이며, 이는 차원의 역설을 확인한다.
  • 신경접선 커널(NTK)과 무작위 특징 커널은 동일한 고유값 감쇠 속도를 가지며, 이는 고차원에서 유사한 근사 제약을 암시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.