[論文レビュー] When to Impute? Imputation before and during cross-validation
本論文は、交差検証の前に行う欠損値補完(I→CV)が、各交差検証fold内で行う補完(CV∘→I)と比較して一般化誤差推定にバイアスをもたらすかどうかを調査する。わずかな楽観的バイアスがあるものの、I→CVは分散を低減し、外部R²を推定する際の総合的平均二乗誤差を低く抑える。チューニング済みモデルでは性能差が最小限であるため、特定の状況では計算コストが低く、妥当な代替手法であると結論づけられる。
Cross-validation (CV) is a technique used to estimate generalization error for prediction models. For pipeline modeling algorithms (i.e. modeling procedures with multiple steps), it has been recommended the entire sequence of steps be carried out during each replicate of CV to mimic the application of the entire pipeline to an external testing set. While theoretically sound, following this recommendation can lead to high computational costs when a pipeline modeling algorithm includes computationally expensive operations, e.g. imputation of missing values. There is a general belief that unsupervised variable selection (i.e. ignoring the outcome) can be applied before conducting CV without incurring bias, but there is less consensus for unsupervised imputation of missing values. We empirically assessed whether conducting unsupervised imputation prior to CV would result in biased estimates of generalization error or result in poorly selected tuning parameters and thus degrade the external performance of downstream models. Results show that despite optimistic bias, the reduced variance of imputation before CV compared to imputation during each replicate of CV leads to a lower overall root mean squared error for estimation of the true external R-squared and the performance of models tuned using CV with imputation before versus during each replication is minimally different. In conclusion, unsupervised imputation before CV appears valid in certain settings and may be a helpful strategy that enables analysts to use more flexible imputation techniques without incurring high computational costs.
研究の動機と目的
- 不審な補完を交差検証の前に行う(I→CV)と、各CVfold内で補完を行う(CV∘→I)と比較して、一般化誤差推定にバイアスが生じるかどうかを評価すること。
- I→CVが、補完の近傍数などのモデルハイパーパrameterを不適切にチューニングし、外部モデル性能を低下させるかどうかを調査すること。
- 欠損データを伴うパイプラインモデリングにおける計算コストと推定精度のトレードオフを評価すること。
- I→CVが、機械学習パイプラインにおける補完のためのCV∘→Iの妥当で実用的な代替手段であるかどうかを特定すること。
提案手法
- 本研究では、I→CV(補完を交差検証の前に行う)とCV∘→I(各CVfold内で繰り返し補完を行う)の2つのワークフローを比較する。
- 性能評価には、欠損データの発生メカニズム(MCAR、MAR)を変化させたシミュレーテッドデータと、実データ(Ames住宅データセット)を用いる。
- 一般化誤差は外部R²を用いて推定され、モデルチューニングは補完の最適な近傍数の選定に基づく。
- 予測分析においてトレーニングセットおよびテストセットの単一および複数の補完を容易にするために、ipa Rパッケージが開発された。
- I→CVとCV∘→Iの間で一般化誤差推定の正確性を比較するために、平均二乗誤差(RMSE)が用いられた。
- バイアス、分散、および総合的推定品質の評価のため、さまざまなサンプルサイズと欠損データのシナリオで統計的比較が行われた。
実験結果
リサーチクエスチョン
- RQ1交差検証の前に行う欠損値補完(I→CV)は、各CVfold内で補完を行う(CV∘→I)と比較して、一般化誤差の推定にバイアスをもたらすか?
- RQ2I→CVは、補完の近傍数といったモデルハイパーパrameterのチューニングを不適切にし、外部モデル性能を低下させるか?
- RQ3さまざまなデータシナリオとサンプルサイズにおいて、I→CVとCV∘→Iの一般化誤差推定のバイアスと分散はどのように比較されるか?
- RQ4I→CVとCV∘→Iの間で計算コストに差があるか。この差がCV∘→Iの実用的妥当性に影響を与えるか?
主な発見
- I→CVは、CV∘→Iと比較してわずかだが一貫した楽観的バイアスを示すが、そのバイアスの大きさは小さい。
- 楽観的バイアスがあるものの、I→CVは分散が著しく低減され、外部R²の真の値を推定する際の総合的平均二乗誤差(RMSE)が低くなる。
- I→CVでチューニングされたモデルの性能は、CV∘→Iでチューニングされたモデルと最小限の差異にとどまり、外部モデル性能の低下は認められない。
- Ames住宅データでは、CV∘→Iを用いた補完時間はI→CVに比べて約10倍にのぼり、繰り返し補完による計算負荷が顕著に現れている。
- すべてのシナリオにおいて、I→CVとCV∘→Iで選ばれた最適な近傍数は一貫して一致しており、チューニングの正確性が同等であることが示された。
- 全体として、すべてのシナリオにおける平均外部R²は、I→CVで40.5%、CV∘→Iで37.8%であり、I→CVはバイアスと分散のバランスが優れている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。