Skip to main content
QUICK REVIEW

[논문 리뷰] Nonparametric regression using over-parameterized shallow ReLU neural networks

Yunfei Yang, Ding‐Xuan Zhou|arXiv (Cornell University)|2023. 06. 14.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 가중치 제약 조건이 있는 과도하게 파rameter화된 얕은 ReLU 신경망이 호더 공간과 변동성 함수 공간 위에서 비모수 회귀에 대해 최소최대 최적 수렴 속도를 달성함을 보여준다. 국소적 라데마처 복잡도와 노름 기반 정규화를 활용하여, 호더 스무쓰니스 $ \alpha < (d+3)/2 $ 에 대해 수렴 속도 $ n^{-2\alpha/(d+2\alpha)} $ 를 확립하였으며, 이는 로그 인자 외에는 알려진 최소최대 하한값과 일치한다.

ABSTRACT

It is shown that over-parameterized neural networks can achieve minimax optimal rates of convergence (up to logarithmic factors) for learning functions from certain smooth function classes, if the weights are suitably constrained or regularized. Specifically, we consider the nonparametric regression of estimating an unknown $d$-variate function by using shallow ReLU neural networks. It is assumed that the regression function is from the Hölder space with smoothness $α&lt;(d+3)/2$ or a variation space corresponding to shallow neural networks, which can be viewed as an infinitely wide neural network. In this setting, we prove that least squares estimators based on shallow neural networks with certain norm constraints on the weights are minimax optimal, if the network width is sufficiently large. As a byproduct, we derive a new size-independent bound for the local Rademacher complexity of shallow ReLU neural networks, which may be of independent interest.

연구 동기 및 목표

  • 비모수 회귀에서 이론적 분석과 실용적 딥 러닝 간 격차를 메우기 위해 과도하게 파arameter화된 얕은 ReLU 네트워크를 연구한다.
  • 넓고 과도하게 파arameter화된 네트워크 위에서 제약 조건이 있는 최소 제곱 추정기들이 최소최대 최적 수렴 속도를 달성할 수 있음을 보인다.
  • 네트워크 크기 대신 가중치 노름을 사용하여 근사 오차와 일반화 오차 간의 트레이드오프를 분석한다.
  • 얕은 ReLU 네트워크의 국소적 라데마처 복잡도에 대해 기존의 네트워크 크기 의존성 없이 새로운 바ounds를 유도하며, 이는 별도의 이론적 관심사이다.

제안 방법

  • 과도하게 파arameter화된 얕은 ReLU 네트워크를 정규화하기 위해 노름 $ \kappa(\theta) = \sum_{i=1}^N |a_i| \|w_i\|_2 \leq M $ 을 사용하는 제약 조건이 있는 최소 제곱 추정기를 사용한다.
  • 국소화 기법을 적용하여 함수 클래스의 국소적 라데마처 복잡도를 유계로 만들며, 일반화 오차 제어를 향상시킨다.
  • 사슬화 추론과 대칭화를 활용하여 제약 조건이 있는 파arameter 공간 위에서의 경험 과정을 제어한다.
  • 얕은 ReLU 네트워크의 국소적 라데마처 복잡도에 대해 기존의 네트워크 크기 의존성 없이 새로운 바ounds를 유도하며, 이는 무한한 넓이 설정을 다룰 수 있도록 필수적이다.
  • 스타-엔트로피 적분과 메트릭 엔트로피를 사용하여 가중치 노름 기반의 함수 클래스의 복잡도를 제어한다.
  • 오차를 근사 오차와 추정 오차로 분해하며, 후자는 국소화된 복잡도 바ounds를 통해 제어한다.

실험 결과

연구 질문

  • RQ1과도하게 파arameter화된 얕은 ReLU 신경망은 비모수 회귀에서 최소최대 최적 수렴 속도를 달성할 수 있는가?
  • RQ2가중치 노름 $ \kappa(\theta) \leq M $ 을 통한 정규화가 과도하게 파arameter화된 영역에서 최적의 일반화를 가능하게 하는가?
  • RQ3얕은 ReLU 네트워크에 대해 크기 의존성이 없는 국소적 라데마처 복잡도 바ounds를 도출할 수 있는가?
  • RQ4가중치 제약 조건 하에서 호더 공간 $ \mathcal{H}^\alpha $ 와 변동성 공간 $ \mathcal{F}_\sigma(1) $ 의 회귀 함수에 대해 최적의 수렴 속도는 무엇인가?
  • RQ5국소화 기법의 사용이 표준 코팅 수 또는 VC 기반 방법에 비해 일반화 오차 바ounds를 어떻게 향상시키는가?

주요 결과

  • 제약 조건이 있는 최소 제곱 추정기를 사용한 얕은 ReLU 네트워크는 $ \alpha < (d+3)/2 $ 인 호더 공간 $ \mathcal{H}^\alpha $ 의 함수들에 대해 최소최대 최적 수렴 속도 $ n^{-2\alpha/(d+2\alpha)} $ 를 달성한다.
  • 변동성 공간 $ \mathcal{F}_\sigma(1) $ 에서는 최소최대 최적 수렴 속도 $ n^{-(d+3)/(2d+3)} $ 를 달성하며, 이는 알려진 하한값과 일치한다.
  • 얕은 ReLU 네트워크의 국소적 라데마처 복잡도에 대해 크기 의존성이 없는 새로운 바ounds가 도출되었으며, 이는 네트워크 폭에 영향을 받지 않으며 과도하게 파arameter화된 분석에 필수적이다.
  • 이전의 네트워크 크기 기반 바ounds를 대체하여 복잡도 추정에서 국소화 기법을 활용함으로써 수렴 속도 향상이 달성되었다.
  • 분석 결과, 일반화 오차는 네트워크 깊이나 폭이 아닌 가중치 노름을 통해 제어될 수 있음을 보여주며, 이는 넓고 과도하게 파arameter화된 네트워크의 실용적 성공을 뒷받침한다.
  • 분석 결과는 네트워크 폭 $ N $ 이 충분히 크다는 가정 하에 성립하며, 이는 함수 클래스가 목표 함수를 잘 근사할 수 있도록 충분히 풍부하다는 것을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.