[논문 리뷰] The out-of-sample $R^2$: estimation and inference
이 논문은 검정 모델 대비 예측 모델을 비교하는 모델 비교 기준으로서의 샘플 외 $R^2$에 대한 공식 정의를 제안하고, 데이터 분할(예: 교차검증 또는 부트스트랩)을 사용한 비편향 추정기법을 도입하며, 델타 방법을 통해 표준오차를 유도한다. 주요 기여는 고차원 예측 설정에서 샘플 외 $R^2$에 대한 불확실성 정량화가 오랫동안 부족했던 데서 비롯된 통계적 추론(예: 신뢰구간 및 가설검정)을 가능하게 한 것이다.
Out-of-sample prediction is the acid test of predictive models, yet an independent test dataset is often not available for assessment of the prediction error. For this reason, out-of-sample performance is commonly estimated using data splitting algorithms such as cross-validation or the bootstrap. For quantitative outcomes, the ratio of variance explained to total variance can be summarized by the coefficient of determination or in-sample $R^2$, which is easy to interpret and to compare across different outcome variables. As opposed to the in-sample $R^2$, the out-of-sample $R^2$ has not been well defined and the variability on the out-of-sample $\hat{R}^2$ has been largely ignored. Usually only its point estimate is reported, hampering formal comparison of predictability of different outcome variables. Here we explicitly define the out-of-sample $R^2$ as a comparison of two predictive models, provide an unbiased estimator and exploit recent theoretical advances on uncertainty of data splitting estimates to provide a standard error for the $\hat{R}^2$. The performance of the estimators for the $R^2$ and its standard error are investigated in a simulation study. We demonstrate our new method by constructing confidence intervals and comparing models for prediction of quantitative $ ext{Brassica napus}$ and $ ext{Zea mays}$ phenotypes based on gene expression data.
연구 동기 및 목표
- 샘플 외 $R^2$에 대한 공식적 정의와 불확실성 추정의 부재를 해결하기 위해, 이는 일반적으로 점추정치로만 보고된다.
- 샘플 외 $R^2$ 추정기의 표준오차를 제공함으로써 예측 성능에 대한 통계적 추론을 가능하게 하기 위해.
- 독립된 테스트 데이터가 이용 불가한 설정에서 모델 비교 및 가설검정(예: $H_0: R^2 \leq 0$)을 지원하기 위해.
- 표준오차 및 신뢰구간을 함께 보고함으로써 예측 모델의 재현성과 진단가치를 향상시키기 위해.
제안 방법
- 예측 모델과 예측변수를 忽시하는 null 모델을 비교하는 방식으로, 기대 샘플 외 손실을 사용하여 샘플 외 $R^2$를 정의한다.
- 교차검증 폴드 또는 부트스트랩 샘플 간의 $R^2$를 통합하는 추정기법을 제안하여 편향을 감소시키며, 폴드별 평균화보다 이를 우선 권장한다.
- 평균제곱오차(MSE)와 평균제곱총합(MST) 추정치의 비율에 델타 방법을 적용하여 샘플 외 $R^2$의 표준오차를 도출한다.
- 데이터 분할 절차에 대한 표준오차 추정 이론적 진전을 활용하여 타당한 추론을 보장한다.
- 비모수적 또는 잭나이프 추정치를 사용하여 $\text{MSE}$와 $\text{MST}$ 간의 상관관계를 추정함으로써 표준오차 정확도를 향상시킨다.
- 시뮬레이션 연구를 통해 방법의 타당성을 검증하고, 실제 옴믹스 데이터셋(Brassica napus 및 Zea mays)에 적용하여 신뢰구간 구성 및 모델 비교에 활용한다.

실험 결과
연구 질문
- RQ1샘플 외 $R^2$에 대한 공식적이고 해석 가능한 정의를 모델 비교 지표로 설정할 수 있는가?
- RQ2교차검증 또는 부트스트랩과 같은 데이터 분할 방법을 사용할 때 샘플 외 $R^2$에 대한 비편향 추정기법이 존재하는가?
- RQ3신뢰구간 구성 및 가설검정을 가능하게 하기 위해 샘플 외 $R^2$에 대한 신뢰할 수 있는 표준오차를 도출할 수 있는가?
- RQ4유의수준 제어 및 커버리지 측면에서 제안된 표준오차 추정기법이 부트스트랩 기반 대안보다 성능이 뛰어나게 되는가?
- RQ5고차원 옴믹스 데이터에서 $R^2$ 추정의 불확실성이 모델 비교 및 추론에 어느 정도 영향을 미치는가?
주요 결과
- 교차검증 폴드 간의 $R^2$ 통합 추정기법은 거의 비편향이며, 폴드별 평균화보다 우수하며 교차검증과 함께 사용하는 것을 권장한다.
- 델타 방법은 샘플 외 $R^2$에 대한 타당한 표준오차를 제공하며, 이는 신뢰구간 구성 및 $H_0: R^2 \leq 0$ 검정을 가능하게 한다.
- 작은 표본 또는 고차원 설정에서는 표준오차 추정기법이 상향 편향을 보이지만, 예측 능력이 증가할수록 이 편향은 감소한다.
- 부트스트랩 기반 표준오차는 하향 편향을 보여, 반경량 추론과 명목 수준 이하의 신뢰구간 커버리지를 초래한다.
- 고차원 설정에서는 모델 피팅 변동성으로 인해 $R^2$ 추정기의 분산이 상당히 크므로, $R^2$ 값의 미세한 차이를 과도하게 해석해서는 안 된다는 경고가 필요하다.
- 표준오차 및 신뢰구간을 함께 보고함으로써 모델 진단 능력 향상, 재현성 강화, 향후 연구 설계 지원이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.