[論文レビュー] Cross-validation: what does it estimate and how well does it do it?
本論文は、交差検証が特定の最終モデルの誤差ErrXYではなく、訓練セット全体の平均予測誤差 Err を推定することを示し、予測誤差の信頼区間のカバレッジを改善するためのネスト型交差検証(nested cross-validation)を導入している。
Cross-validation is a widely-used technique to estimate prediction error, but its behavior is complex and not fully understood. Ideally, one would like to think that cross-validation estimates the prediction error for the model at hand, fit to the training data. We prove that this is not the case for the linear model fit by ordinary least squares; rather it estimates the average prediction error of models fit on other unseen training sets drawn from the same population. We further show that this phenomenon occurs for most popular estimates of prediction error, including data splitting, bootstrapping, and Mallow's Cp. Next, the standard confidence intervals for prediction error derived from cross-validation may have coverage far below the desired level. Because each data point is used for both training and testing, there are correlations among the measured accuracies for each fold, and so the usual estimate of variance is too small. We introduce a nested cross-validation scheme to estimate this variance more accurately, and we show empirically that this modification leads to intervals with approximately correct coverage in many examples where traditional cross-validation intervals fail.
研究の動機と目的
- 線形モデルを特に対象に、予測モデリングにおける交差検証の推定対象を明確にする。
- CVがErr(訓練セット全体の平均誤差)を推定し、ErrXY(観測された訓練セット上での最終モデルの誤差)を推定することを示す。
- 折りたたみ間の相関に起因する、素朴なCVベースの信頼区間の限界を示す。
- より正確な予測誤差の信頼区間を得るために、ネスト型交差検証(NCV)を提案する。
- データ分割、Mallows Cp、ブートストラップなど、関連する予測誤差推定量とCVを比較する。
提案手法
- ErrXYを、全訓練セット上で適合したモデルのアウト・オブ・サンプル誤差として、Errを未見の訓練セット上の期待値として定義する。
- 線形不変推定量(OLSと二乗誤差を用いたCVを含む)が、Xを条件としてErrXYと条件付き独立であることを証明する(Theorem 1)。
- CVがErrを対象とし、ErrXYではなく、ErrX(Xを与えたときの条件付き平均)がErrに対して母集団におけるより近い類似量であることを確立する(Theorem 2および Corollaries)。
- CVがCV内でより小さな訓練部分集合を使用することによるバイアスを分析する(異なるレジームにおけるバイアスを議論)。
- CVの修正としてネスト型交差検証(NCV)を導入し、バイアスのない標準誤差推定と予測誤差区間のカバレッジ改善をもたらす(Theorem 3)。
- CVとCp型推定量を、同様のターゲット挙動を持つ線形不変推定量として関連づける(Section 3.5)。

実験結果
リサーチクエスチョン
- RQ1予測モデリング、特に線形モデルにおいて、交差検証は正確には何を推定するのか?
- RQ2CVベースの区間は誤差予測のカバレージの観点でどのように機能し、改善できるか?
- RQ3データ分割、Mallows Cp、およびブートストラップは予測誤差の推定量としてどのように比較されるか?
- RQ4修正されたCVスキーム(ネスト型CV)は予測誤差のより正確な信頼区間を提供できるか?
- RQ5高次元/線形設定におけるErr、ErrX、ErrXYとCVが生成する推定量との関係は何か?
主な発見
- CVはErr(訓練セット全体の平均予測誤差)を推定し、ErrXY(観測された訓練セット上で適合したモデルの誤差)を推定するのではない。
- OLSを用いたCVのような線形不変推定量は、ErrまたはErrXを推定する際のMSEが、ErrXYを推定する場合より低い(Theorem 1およびCorollary 1)。
- ErrXと Err は、比例漸近的な漸近で ErrXYより Err に近くなる。Var(ErrX)=Θ(1/n^2) および Var(ErrXY|X)=Θ(1/n)(Theorem 2)。
- 素朴なCV区間は、フォールド誤差間の相関を無視するためしばしばカバーし不足する。NCVは多くの場合ほぼ正確なカバレッジの区間を提供する(Figure 1 の議論および Theorem 3)。
- Mallow’s CpおよびCpベースの方法は線形不変で、Err/ErrXを ErrXY よりも類似のターゲットとして示す(Section 3.5)。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。