Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotics of Cross-Validation

Morgane Austern, Wenda Zhou|arXiv (Cornell University)|Jan 29, 2020
Bayesian Methods and Mixture Models参考文献 9被引用数 12
ひとこと要約

本稿は、一般の安定性条件下の交差検証リスクの漸近的分布を確立し、中心極限定理とBerry-Esseenの上限を証明することで、正確な信頼区間の構築を可能にした。パラメトリックM推定量が訓練損失とテスト損失が一致する場合、交差検証ではK_n-foldの分散低減が達成されるが、補助損失関数や正則化を用いる場合、モデルやデータ分布に応じて分散低減は完全な速度向上を下回ることも、上回ることもある。

ABSTRACT

Cross validation is a central tool in evaluating the performance of machine learning and statistical models. However, despite its ubiquitous role, its theoretical properties are still not well understood. We study the asymptotic properties of the cross validated-risk for a large class of models. Under stability conditions, we establish a central limit theorem and Berry-Esseen bounds, which enable us to compute asymptotically accurate confidence intervals. Using our results, we paint a big picture for the statistical speed-up of cross validation compared to a train-test split procedure. A corollary of our results is that parametric M-estimators (or empirical risk minimizers) benefit from the "full" speed-up when performing cross-validation under the training loss. In other common cases, such as when the training is done using a surrogate loss or a regularizer, we show that the behavior of the cross-validated risk is complex with a variance reduction which may be smaller or larger than the "full" speed-up, depending on the model and the underlying distribution. We allow the number of folds to grow with the number of observations at any rate.

研究の動機と目的

  • 統計学的学習における交差検証リスク推定量の漸近的挙動を理解すること。
  • K-fold交差検証がトレイン・テスト分割に比べて達成する分散低減を定量すること。
  • 交差検証が分散低減において「完全な」速度向上を達成する条件を確立すること。
  • 漸近的分散の推定量を用いて、交差検証リスクの漸近的に正確な信頼区間を構築すること。
  • 正則化および補助損失関数が交差検証の統計的効率に与える影響を分析すること。

提案手法

  • 一般の安定性条件下で交差検証リスクの中心極限定理とBerry-Esseenの上限を導出する。
  • 交差検証における依存するfoldを扱うために、正規近似のためのStein法の応用を採用する。
  • 交差検証リスクの影響関数を分析し、個々の観測値への感度を分解する。
  • 交差検証リスクの漸近的分散およびその推定量の式を導出する。
  • K_n(fold数)が標本サイズnに伴い任意の速度で増加することを許容し、柔軟な漸近的分析を可能にする。
  • 交差検証の漸近的分散をデータ分割のそれと比較し、速度向上を定量する。

実験結果

リサーチクエスチョン

  • RQ1交差検証がトレイン・テスト分割に比べてK_n-倍の分散低減を達成する条件は何か?
  • RQ2補助損失関数や正則化子を用いることで、交差検証の分散低減にどのような影響が生じるか?
  • RQ3一般のモデル安定性下で、交差検証リスクの極限分布は何か?
  • RQ4交差検証リスクに対して漸近的に正確な信頼区間を構築できるか?
  • RQ5異なるモデルクラスにおいて、交差検証の漸近的分散はデータ分割のそれとどのように比較されるか?

主な発見

  • 同じ損失関数で訓練および評価を行うパラメトリックM推定量において、交差検証はトレイン・テスト分割に比べて「完全な」K_n-倍の分散低減を達成する。
  • 補助損失関数や正則化子を用いる場合、モデルや潜在的なデータ分布に応じて、交差検証の分散低減は完全なK_n-倍の速度向上を下回ることも、上回ることもある。
  • 本稿では交差検証リスクに対して中心極限定理を確立し、漸近的に有効な信頼区間の構築を可能にした。
  • Berry-Esseenの上限が導出され、交差検証リスクの正規分布への収束速度が定量的に評価された。
  • 安定性条件の下で、交差検証リスクの漸近的分散がデータ分割推定量のそれよりも小さいことが示された。
  • 本分析により、K_nがnに伴い任意の速度で増加することを許容でき、高次元および大標本設定への応用が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。