Skip to main content
QUICK REVIEW

[논문 리뷰] Asymptotic Risk of Least Squares Minimum Norm Estimator under the Spike Covariance Model.

Yasaman Mahdaviyeh, Zacharie Naulet|arXiv (Cornell University)|2019. 12. 31.
Random Matrices and Applications참고 문헌 12인용 수 5
한 줄 요약

이 논문은 표본 크기 n보다 파라미터 수 d가 더 빠르게 증가하는 고차원 선형 회귀에서 최소 노름 최소 제곱 추정량의 渐近적 위험을 분석한다. 고정된 수의 발산하는 고유값을 가진 스피크 공분산 모형 하에서 위험은 0으로 수렴하며, 이는 고차원에서도 최소 노름 추정을 통한 보간이 낮은 渐近적 위험을 낳을 수 있음을 보여준다.

ABSTRACT

One of the recent approaches to explain good performance of neural networks has focused on their ability to fit training data perfectly (interpolate) without overfitting. It has been shown that this is not unique to neural nets, and that it happens with simpler models such as kernel regression, too Belkin et al. (2018b); Tengyuan Liang (2018). Consequently, there has been quite a few works that give conditions for low risk or optimality of interpolating models, see for example Belkin et al. (2018a, 2019b). One of the simpler models where interpolation has been studied recently is least squares solution for linear regression. In this case, interpolation is only guaranteed to happen in high dimensional setting where the number of parameters exceeds number of samples; therefore, least squares solution is not necessarily unique. However, minimum norm solution is unique, can be written in closed form, and gradient descent starting at the origin converges to it (Hastie et al., 2019). This has, at least partially, motivated several works that study risk of minimum norm least squares estimator for linear regression. Continuing in a similar vein, we study the asymptotic risk of minimum norm least squares estimator when number of parameters $d$ depends on $n$, and $\frac{d}{n} ightarrow \infty$. In this high dimensional setting, to make inference feasible, it is usually assumed that true parameters or data have some underlying low dimensional structure such as sparsity, or vanishing eigenvalues of population covariance matrix. Here, we restrict ourselves to spike covariance matrices, where a fixed finite number of eigenvalues grow with $n$ and are much larger than the rest of the eigenvalues, which are (asymptotically) in the same order. We show that in this setting the risk can vanish.

연구 동기 및 목표

  • d/n → ∞ 인 고차원 선형 회귀에서 최소 노름 최소 제곱 추정량의 위험 행동을 이해하는 것.
  • 과다 매개변수화된 상황에서도 최소 노름 해를 통한 보간이 낮은 위험을 낳을 수 있는지 조사하는 것.
  • 구조화된 공분산 모형—특히 유한한 수의 발산하는 고유값을 가진 스피크 공분산 모형—하에서의 渐近적 위험을 분석하는 것.
  • 최소 노름 추정량의 위험이 고차원 설정에서 사라지는 조건을 설정하는 것.

제안 방법

  • 최소 제곱 최소 노름 추정량을 데이터를 정확히 맞추는 조건 하에 L2 노름을 최소화하는 제약 최적화 문제로 수식화한다.
  • d와 n이 모두 무한으로 갈 때 d/n → ∞ 가 되는 고차원 점근적 설정을 가정한다.
  • 설계 행렬에 스피크 공분산 모형을 도입하여, 고정된 수의 고유값이 n과 함께 증가하고, 나머지 고유값은 유계이면서 점근적으로 같은 주기수를 가짐을 가정한다.
  • 무작위 행렬 이론 도구를 사용하여 추정량의 점근적 위험을 유도하며, 특히 지정된 스펙트럼 구조 하에서 추정량의 행동에 초점을 맞춘다.
  • n → ∞ 이고 d/n → ∞ 일 때 위험 표현의 점근적 행동을 분석한다. 스피크 모형 하에서.
  • 스피크 모형 하에서 위험이 0으로 수렴함을 입증하여, 이는 이 설정에서 최소 노름 추정을 통한 보간이 일관된 결과를 낳을 수 있음을 시사한다.

실험 결과

연구 질문

  • RQ1d/n → ∞ 일 때 최소 노름 최소 제곱 추정량의 점근적 위험은 무엇인가?
  • RQ2최소 노름 추정량의 위험이 사라지기 위한 인구 공분산 행렬에 대한 조건은 무엇인가?
  • RQ3유한한 수의 발산하는 고유값을 가진 스피크 공분산 구조는 보간 추정량의 위험 행동에 어떻게 영향을 미치는가?
  • RQ4과다 매개변수화된 고차원 설정에서 최소 노름 해를 통한 보간이 낮은 위험을 낳을 수 있는가?
  • RQ5낮은 차원의 구조(스피크 모형을 통해)가 표본 수를 초과하는 매개변수 수가 있는 상황에서도 일관된 추정을 가능하게 하는가?

주요 결과

  • d/n → ∞ 인 고차원 설정에서 스피크 공분산 모형 하에서 최소 노름 최소 제곱 추정량의 점근적 위험은 0으로 수렴한다.
  • 위험의 사라짐은 스피크 구조에 의해 유도된다: 고정된 유한한 수의 고유값이 n과 함께 증가하고, 나머지 고유값은 유계이면서 점근적으로 같은 주기수를 가진다.
  • 이 결과는 과다 매개변수화된 상황에서도 보간이 보장되지만, 설계 공분산이 낮은 차원의 스피크 구조를 가질 경우 최소 노름 해가 여전히 낮은 위험을 달성할 수 있음을 보여준다.
  • 분석은 최소 노름 해가 고차원 설정에서 본질적으로 높은 위험을 지닌 것은 아니며, 배경 공분산이 스피크 구조를 가진다면 이는 성립함을 확인한다.
  • 이러한 결과는 보간 추정량에서 관찰되는 일반적인 '유해하지 않은 과적합' 현상을 지지하며, 설계에 대한 구조적 가정(예: 스피크 공분산)이 낮은 위험을 보장할 수 있음을 보여준다.
  • 이 결과는 과다 매개변수 모형에서 경사 하강법의 경험적 성공에 대한 이론적 근거를 제공한다. 경사 하강법은 최소 노름 해로 수렴하며, 이 설정에서는 위험이 사라지기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.