Skip to main content
QUICK REVIEW

[논문 리뷰] Quantile regression with deep ReLU Networks: Estimators and minimax rates

Oscar Hernán Madrid Padilla, Wesley Tansey|arXiv (Cornell University)|2020. 10. 16.
Statistical Methods and Inference참고 문헌 56인용 수 7
한 줄 요약

이 논문은 깊이 있는 ReLU 신경망을 사용한 분위수 회귀에 대한 이론적 보장을 수립하며, 최소한의 가정 하에 조건부 분위수를 추정하는 데 있어 최소최대 최적 속도를 달성함을 보여준다. 네트워크의 깊이, 너비, 근사 오차에 따라 달라지는 추정 오차의 상한을 도출하여, 헬더-조합 및 베소프 클래스 함수에 대해 최소최대 최적 속도를 달성함을 증명한다. 이는 극단적으로 꼬인 오차 분포 조건 하에서도 성립한다.

ABSTRACT

Quantile regression is the task of estimating a specified percentile response, such as the median, from a collection of known covariates. We study quantile regression with rectified linear unit (ReLU) neural networks as the chosen model class. We derive an upper bound on the expected mean squared error of a ReLU network used to estimate any quantile conditional on a set of covariates. This upper bound only depends on the best possible approximation error, the number of layers in the network, and the number of nodes per layer. We further show upper bounds that are tight for two large classes of functions: compositions of Hölder functions and members of a Besov space. These tight bounds imply ReLU networks with quantile regression achieve minimax rates for broad collections of function types. Unlike existing work, the theoretical results hold under minimal assumptions and apply to general error distributions, including heavy-tailed distributions. Empirical simulations on a suite of synthetic response functions demonstrate the theoretical results translate to practical implementations of ReLU networks. Overall, the theoretical and empirical results provide insight into the strong performance of ReLU neural networks for quantile regression across a broad range of function classes and error distributions. All code for this paper is publicly available at https://github.com/tansey/quantile-regression.

연구 동기 및 목표

  • 딥 ReLU 네트워크의 분위수 회귀에 대한 이론적 기초를 제공함. 이는 이전 연구에서 통계적 보장이 부족했던 분야이다.
  • 모든 분위수 함수에 대해 ReLU 네트워크 추정기의 기대 평균제곱오차에 대한 상한을 수립함.
  • 헬더 함수의 조합 및 베소프 공간을 포함한 광범위한 함수 클래스에 대해 ReLU 네트워크가 최소최대 최적 속도를 달성함을 보임.
  • 오차 분포에 대한 최소한의 분포가정 조건 하에서도 이론적 결과가 성립함을 보장함. 이는 꼬인 오차 분포를 포함한다.
  • 비모수 추정 이론과 딥러닝을 연결하기 위해, 평균 회귀에서의 최소최대 결과를 분위수 회귀로 확장함.

제안 방법

  • 조건부 분위수 함수에 대한 ReLU 네트워크 추정기의 기대 평균제곱오차에 대한 상한을 도출함. 이는 최적 근사 오차, 네트워크 깊이 $L$, 너비 $U$ 에 따라 달라진다.
  • 일반화 오차를 제어하기 위해 라데마처 복잡도와 메트릭 엔트로피 기법을 적용함. ReLU 네트워크 함수 클래스의 커버링 수를 사용함.
  • Schmidt-Hieber(2017)의 신경망 커버링 수 결과를 활용하여 함수 클래스 위에서의 라데마처 과정의 기대 최대값을 유계화함.
  • 베소프 공간 $B^{s}_{p,q}([0,1]^d)$ 에 속하는 함수이며 $s > d/p$ 인 경우, 최소최대 속도 $n^{-2s/(2s+d)}$ 가 ReLU 네트워크를 통해 달성 가능함을 증명함.
  • 헬더 함수의 조합에 대해, 희소 ReLU 네트워크가 제곱오차 손실 하에서 최소최대 속도를 달성할 수 있음을 증명함.
  • 사슬 논법과 엔트로피 적분 상한을 활용하여 경험 위험 최소화기의 진짜 분위수 함수로부터의 편차를 제어함.

실험 결과

연구 질문

  • RQ1오차 분포에 대한 약한 가정 하에서 깊이 있는 ReLU 네트워크가 분위수 회귀에서 최소최대 최적 속도를 달성할 수 있는가?
  • RQ2ReLU 네트워크 추정기의 일반화 오차 상한은 무엇이며, 네트워크의 깊이와 너비에 어떻게 의존하는가?
  • RQ3ReLU 네트워크는 헬더 공간과 유사한 비연속적이거나 불규칙한 함수 클래스, 예를 들어 베소프 공간에 대해서도 최소최대 속도를 달성하는가?
  • RQ4오차 분포가 꼬인 경우에도 ReLU 네트워크를 통한 분위수 회귀에 대해 이론적 보장을 확보할 수 있는가?
  • RQ5ReLU 네트워크의 근사 오차는 분위수 회귀에서 통계적 추정 오차와 어떻게 관련되어 있는가?

주요 결과

  • ReLU 네트워크 분위수 회귀 추정기의 기대 평균제곱오차는 최적 근사 오차, 네트워크 깊이 $L$, 너비 $U$ 에 따라 달라지는 항에 의해 유계화되며, 오차에 대한 분포가정이 없음.
  • 헬더 함수의 조합에 속하는 함수에 대해, 희소 ReLU 네트워크 아키텍처가 존재하여 제곱오차 손실 하에서 최소최대 최적 속도를 달성함.
  • 베소프 공간 $B^{s}_{p,q}([0,1]^d)$ 에 속하고 $s > d/p$ 인 함수에 대해, 최소최대 속도 $n^{-2s/(2s+d)}$ 는 온건한 조건 하에서 ReLU 네트워크를 통해 달성 가능함.
  • 이론적 결과는 임의의 오차 분포에 대해 성립하며, 꼬인 오차 분포를 포함하므로 이론적 방법은 이상치 및 꼬인 노이즈에 대해 강건함.
  • 합성 데이터에 대한 경험적 시뮬레이션은 이론적 오차 상한이 실질적 성능으로 이어짐을 확인하여 이론적 결과를 검증함.
  • 추정 오차의 상한은 $\tilde{O}(\sqrt{F \epsilon_n \log n [\log L + L \log n]})$ 의 형태로 스케일링되며, 여기서 $\epsilon_n$ 은 근사 오차를 나타내고 $F$ 는 네트워크 용량 파라미터이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.