Skip to main content
QUICK REVIEW

[논문 리뷰] Correction of overfitting bias in regression models

Emanuele Massa, Marianne A. Jonker|arXiv (Cornell University)|2022. 04. 12.
Statistical Methods and Bayesian Inference인용 수 6
한 줄 요약

이 논문은 $p$가 표본 크기 $n$과 유사한 경우 최대우도추정기의 과적합 편향을 교정하기 위한 새로운 잭나이프 기반 방법을 제안한다. 정규성 가정 하에 이탈한 하나의 관측치 이론에서 비선형 방정식의 단순한 집합을 유도함으로써, 동시에 회귀 및 부수적 매개변수의 편향 교정이 가능해지며, 다양한 $\theta = p/n$ 제도에서 시뮬레이션과 매우 밀접하게 일치하는 정확한 수축 인자들을 도출한다.

ABSTRACT

Regression analysis based on many covariates is becoming increasingly common. However, when the number of covariates $p$ is of the same order as the number of observations $n$, maximum likelihood regression becomes unreliable due to overfitting. This typically leads to systematic estimation biases and increased estimator variances. It is crucial for inference and prediction to quantify these effects correctly. Several methods have been proposed in literature to overcome overfitting bias or adjust estimates. The vast majority of these focus on the regression parameters. But failure to estimate correctly also the nuisance parameters may lead to significant errors in confidence statements and outcome prediction. In this paper we present a jacknife method for deriving a compact set of non-linear equations which describe the statistical properties of the ML estimator in the regime where $p=O(n)$ and under the hypothesis of normally distributed covariates. These equations enable one to compute the overfitting bias of maximum likelihood (ML) estimators in parametric regression models as functions of $ζ= p/n$. We then use these equations to compute shrinkage factors in order to remove the overfitting bias of maximum likelihood (ML) estimators. This new derivation offers various benefits over the replica approach in terms of increased transparency and reduced assumptions. To illustrate the theory we performed simulation studies for multiple regression models. In all cases we find excellent agreement between theory and simulations.

연구 동기 및 목표

  • 표본 크기 $n$과 비슷한 수준에서 $p = O(n)$ 인 경우 고전적 점근적 이론이 실패하는 제도에서 최대우도(ML) 추정기의 체계적 편향과 과도한 분산 문제를 해결하기 위해.
  • 기존의 보정 방법을 회귀 계수를 넘어서 잔차 분산과 같은 부수적 매개변수까지 확장하여 신뢰구간 및 예측구간에 필수적인 요소들을 포함하기 위해.
  • 이탈한 하나의 관측치 이론을 기반으로 하되, 통계역학적 가정에 의존하지 않는 투명하고 복제 기반의 프레임워크를 개발하여 ML 추정기의 점근적 편향과 분산을 유도하기 위해.
  • 모의 실험을 통해 검증된 실용적이고 계산 효율성이 높은 편향 교정 방법을 개발하기 위해.
  • 의료 및 생물통계학적 응용에서 흔히 나타나는 고차원 설정, 즉 $n$이 작고 $p$가 큰 상황에서 정확한 통계적 추론을 가능하게 하기 위해.

제안 방법

  • 이탈한 하나의 관측치 분석에서 유도된 비선형 자기일관 방정식의 집합을 유도하여 $p = \theta n$ 제도에서 ML 추정기의 점근적 행동을 기술한다.
  • 예측변수에 대한 회전 대칭성과 정규성 가정을 활용하여 추정기의 확률적 표현을 도출함으로써 분석적 접근 가능성을 확보한다.
  • 이 방정식들로부터 계산되는 두 가지 핵심 매개변수인 $k_\star$와 $v_\star$를 도입하여 ML 추정기의 편향과 분산을 특징짓는다.
  • 이 매개변수들을 활용하여 $\beta$와 $\sigma$ 추정기의 편향 및 분산 과잉을 동시에 교정하는 수축 인자를 계산한다.
  • 수축 인자에 대한 기하학적 해석을 통해 오버랩 농도 개념을 활용하여 이론 결과를 관측 가능한 양들과 연결한다.
  • 다양한 $\zeta = p/n$ 값에서 보정되지 않은 추정기와 보정된 추정기를 비교한 모의 실험을 통해 방법을 검증한다.

실험 결과

연구 질문

  • RQ1표본 크기 $n$과 비슷한 수준에서 $p$가 과적합 편향을 유발할 경우, 최대우도 추정기의 편향을 어떻게 체계적으로 교정할 수 있는가?
  • RQ2고차원 회귀에서 회귀 계수와 부수적 매개변수(예: 잔차 분산)의 공동 점근적 행동은 어떻게 되는가?
  • RQ3통계역학적 가정에 의존하지 않는 복제 기반의 투명한 방법을 개발하여 편향과 분산 교정을 유도할 수 있는가?
  • RQ4유도된 보정 인자가 유한 표본 설정에서 추정기 정확도를 얼마나 향상시키고 평균제곱오차를 줄이는가?
  • RQ5추정기의 표본분포에 대한 이론적 근사가 다양한 $p/n$ 비율에서 경험적 시뮬레이션과 얼마나 잘 일치하는가?

주요 결과

  • 유도된 자기일관 방정식은 $\zeta = p/n$ 값의 범위에서 ML 추정기의 편향과 분산을 정확히 예측하며, 이론과 시뮬레이션 간의 강력한 일치를 보인다.
  • 보정된 $\hat{\bm{\beta}}_n$ 및 $\hat{\bm{\sigma}}_n$ 추정기는 그 표본분포가 진짜 매개변수 값 주위에 중심을 맞추고 있음을 통해 효과적으로 편향이 제거된 것으로 나타났다.
  • 보정된 추정기 $\tilde{\bm{\beta}}_n$의 근사 점근분포는 $\mathcal{N}(\bm{\beta}_0, v_\star^2 / k_\star^2 p)$로 잘 기술되며, 시뮬레이션 히스토그램에서도 높은 정밀도를 보였다.
  • 특히 $\bm{\beta}_0$가 희박한 경우에 발생하는 고차원 설정에서 $\mathbf{e}_1^\prime\hat{\bm{\beta}}_n$의 분산 과소평가 문제를 성공적으로 교정하였다.
  • 이론은 $\hat{\bm{\sigma}}_n$의 분포의 모드를 정확히 포착하여, 과적합 상황에서도 부수적 매개변수의 신뢰할 수 있는 추정이 가능함을 시사한다.
  • 정규성에서의 이탈에 대해 강건한 성능을 보였으며, 조건부로 $\mathbf{X}_i^\prime\hat{\bm{\beta}}_{(i)}$에 중심극한정리가 적용되는 한, 일반화된 정규분포 외의 예측변수에 대해서도 넓은 적용 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.