Skip to main content
QUICK REVIEW

[논문 리뷰] Fast rates for empirical risk minimization over càdlàg functions with bounded sectional variation norm

Aurélien Bibaut, Mark J. van der Laan|arXiv (Cornell University)|2019. 07. 22.
Statistical Methods and Inference참고 문헌 6인용 수 20
한 줄 요약

이 논문은 고차원 설정에서 국소적 연속성과 유사한 함수( càdlàg 함수)로 구성된 함수류에 대한 경험적 위험 최소화(empirical risk minimization)의 빠른 수렴 속도를 확립한다. 이 함수류의 새로운 표현 방식을 활용하고, 그들의 브라켓팅 엔트로피를 유계화함으로써, 저자들은 수렴 속도를 $ O_P(n^{-1/3}(\text{log}\,n)^{2(d-1)/3}a_n) $로 도출한다. 여기서 차원 $ d $ 는 오직 로그 인자에만 영향을 미치며, 이는 하위지수 오차 조건 하에서 고차원 비모수 추정에 특히 효과적임을 시사한다.

ABSTRACT

Empirical risk minimization over classes functions that are bounded for some version of the variation norm has a long history, starting with Total Variation Denoising (Rudin et al., 1992), and has been considered by several recent articles, in particular Fang et al., 2019 and van der Laan, 2015. In this article, we consider empirical risk minimization over the class $\mathcal{F}_d$ of càdlàg functions over $[0,1]^d$ with bounded sectional variation norm (also called Hardy-Krause variation). We show how a certain representation of functions in $\mathcal{F}_d$ allows to bound the bracketing entropy of sieves of $\mathcal{F}_d$, and therefore derive rates of convergence in nonparametric function estimation. Specifically, for sieves whose growth is controlled by some rate $a_n$, we show that the empirical risk minimizer has rate of convergence $O_P(n^{-1/3} (\log n)^{2(d-1)/3} a_n)$. Remarkably, the dimension only affects the rate in $n$ through the logarithmic factor, making this method especially appropriate for high dimensional problems. In particular, we show that in the case of nonparametric regression over sieves of càdlàg functions with bounded sectional variation norm, this upper bound on the rate of convergence holds for least-squares estimators, under the random design, sub-exponential errors setting.

연구 동기 및 목표

  • 고차원 설정에서 국소적 연속성과 유사한 함수( càdlàg 함수)로 구성된 함수류에 대한 경험적 위험 최소화(empirical risk minimization)의 수렴 속도를 빠르게 확립하는 것.
  • 이 함수류 내의 스크린(sieves)의 브라켓팅 엔트로피를 기술함으로써 비점근적 위험 한계를 가능하게 하는 것.
  • 수렴 속도가 차원에 의해 오직 로그 인자에만 영향을 받는다는 것을 보여주어, 높은 유형의 차원에 대해 확장 가능한 방법을 제공하는 것.
  • 일반적인 설계 조건과 하위지수 오차 가정 하에서 비모수 회귀 및 로지스틱 회귀에 경험적 위험 최소화의 적용 범위를 확장하는 것.

제안 방법

  • 저자들은 국소적 연속성과 유사한 함수의 유계 섹션 변동 노름을 가진 함수들을 유계 변동을 가진 부호 측도의 합으로 표현함으로써 정밀한 엔트로피 제어를 가능하게 한다.
  • 함수류 $ \mathcal{F}_d $ 내의 스크린에 대한 브라켓팅 엔트로피의 경계를 도출하며, 이는 수렴 속도 유도의 핵심이다.
  • 엔트로피 적분을 제어하고 최종 수렴 속도를 유도하기 위해 페링 기법(peeling technique)을 적용한다.
  • 핵심 단계로는 매개변수 공간의 $ L^2 $-노름 브라켓팅을 손실 함수의 버르슈타인 노름(Bernstein norm)과 연결함으로써 농도 부등식의 적용을 가능하게 한다.
  • 랜덤 설계와 하위지수 오차 하에서 최소 제곱 추정에 이 방법을 적용하여, ERM 추정자가 유도된 속도를 달성함을 보여준다.
  • 이론적 결과는 기저 함수를 통한 ERM 추정자의 LASSO 유형 문제로의 표현을 통해 지지되며, 이는 계산 가능성을 보장한다.

실험 결과

연구 질문

  • RQ1고차원 설정에서 국소적 연속성과 유사한 함수( càdlàg 함수)로 구성된 함수류에 대한 경험적 위험 최소화의 수렴 속도를 빠르게 확립할 수 있는가?
  • RQ2이러한 비모수 추정 문제에서 차원 $ d $ 는 수렴 속도에 어떻게 영향을 미치는가?
  • RQ3유도된 속도는 일반적인 손실 함수, 특히 단조 증가 리프시츠 손실 함수를 포함하여 하위지수 오차 모델에서도 달성 가능한가?
  • RQ4이러한 함수류에 대한 경험적 위험 최소화 추정자는 계산적으로 타당한가? 그리고 LASSO 문제로 재구성 가능한가?
  • RQ5하위지수 오차 조건 하에서 비모수 회귀의 최소 제곱 추정자에 대해 수렴 속도 $ n^{-1/3}( ext{log}\,n)^{2(d-1)/3}a_n $ 가 성립하는가?

주요 결과

  • 국소적 연속성과 유사한 함수로 구성된 스크린에 대한 경험적 위험 최소화 추정자는 $ O_P(n^{-1/3}( ext{log}\,n)^{2(d-1)/3}a_n) $ 의 수렴 속도를 달성한다. 여기서 $ a_n $ 은 스크린의 성장률을 제어한다.
  • 차원 $ d $ 는 수렴 속도에 오직 로그 인자에만 영향을 미치며, 이는 고차원 문제에 매우 적합함을 시사한다.
  • 브라켓팅 엔트로피는 국소적 연속성과 유사한 함수를 유게 변동을 가진 부호 측도의 합으로 표현함으로써 유계화되며, 이는 엔트로피 기반 수렴 분석을 가능하게 한다.
  • 수렴 속도는 랜덤 설계와 하위지수 오차 조건 하에서 비모수 회귀의 최소 제곱 추정에 대해 성립하며, 가우시안 또는 격자 설계를 가정하지 않는다.
  • ERM 추정자는 $ O((ne/d)^d) $ 개의 기저 함수를 가진 LASSO 문제로 표현 가능하여 계산 가능성을 보장한다.
  • 결과는 단조 증가 리프시츠 손실 함수로 확장되며, 이는 유계 반응이 있는 비모수 최소 제곱 회귀와 로지스틱 회귀와 같은 중요한 사례를 포함한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.