Skip to main content
QUICK REVIEW

[論文レビュー] Cross-validation Approaches for Multi-study Predictions

Boyu Ren, Prasad Patil|arXiv (Cornell University)|Jul 24, 2020
Machine Learning in Healthcare参考文献 23被引用数 4
ひとこと要約

本稿は、異種のデータセットにわたる一般化モデルとスペシャリストモデルを統合する、データ再利用を伴わない(NDR)スタッキングフレームワークを提案する。訓練データの再利用を回避してスタッキング重みを推定することで、過学習を軽減し、オラクルに近い性能を達成する。特に、研究間の差が中程度でサンプルサイズが大きい場合に、精度が向上する。

ABSTRACT

We consider prediction in multiple studies with potential differences in the relationships between predictors and outcomes. Our objective is to integrate data from multiple studies to develop prediction models for unseen studies. We propose and investigate two cross-validation approaches applicable to multi-study stacking, an ensemble method that linearly combines study-specific ensemble members to produce generalizable predictions. Among our cross-validation approaches are some that avoid reuse of the same data in both the training and stacking steps, as done in earlier multi-study stacking. We prove that under mild regularity conditions the proposed cross-validation approaches produce stacked prediction functions with oracle properties. We also identify analytically in which scenarios the proposed cross-validation approaches increase prediction accuracy compared to stacking with data reuse. We perform a simulation study to illustrate these results. Finally, we apply our method to predicting mortality from long-term exposure to air pollutants, using collections of datasets.

研究の動機と目的

  • 予測変数および結果の分布が異なる複数の研究が存在する状況において、頑健な予測モデルを開発する課題に対処すること。
  • 新規で未観測の研究向けの一般化予測(generalist predictions)と、特定の含まれる研究向けのスペシャリスト予測(specialist predictions)の両方を支援するフレームワークを開発すること。
  • 重み最適化中にデータを再利用することによって引き起こされるスタッキングベースのアンサンブルモデルにおける過学習を緩和すること。
  • 提案手法であるデータ再利用なしの手法が、有限標本において従来のデータ再利用手法に比べて、ほぼ最適なスタッキング重みを達成し、予測精度を向上させることを示すこと。

提案手法

  • 個々の研究固有の予測関数(SPFs)を統合して単一のアンサンブル予測関数を構築するため、スタッキングを用いる。
  • SPFの学習と効用関数推定を分離するデータ再利用なし(NDR)手順により、スタッキング重みを推定する。
  • タスク固有の効用関数(例:平均二乗誤差)を用いて重み最適化をガイドし、同じデータを学習と評価の両方で再利用しないようにする。
  • 漸近的理論を用いて、NDRスタッキングモデルが穏やかな正則性条件の下でオラクルに近い性能を達成することを示す。
  • シミュレーションスタディを用いて理論的結果を検証し、平均二乗誤差の観点からNDRと従来のデータ再利用(DR)スタッキングを比較する。
  • NDRがDRを上回る条件を特定する。特に、研究間の不均一性が中程度でサンプルサイズが大きい場合に有効である。

実験結果

リサーチクエスチョン

  • RQ1データ再利用なしスタッキングが、多研究予測においていつデータ再利用スタッキングを上回るのか?
  • RQ2提案されたフレームワークは、漸近的オラクルベンチマークにほぼ同等の性能を達成できるか?
  • RQ3スタッキング予測モデルの精度は、研究数とそのサンプルサイズにどのように依存するか?
  • RQ4研究の不均一性(例:係数分布のばらつき)が、データ再利用あり・なしの両方のスタッキング性能に与える影響は何か?
  • RQ5NDRアプローチは、複数の非交換可能な研究に基づくアンサンブルモデルの過学習を軽減するか?

主な発見

  • データ再利用なし(NDR)スタッキングフレームワークは、穏やかな正則性条件の下で、理論的オラクルベンチマークに近いほぼ最適な性能を持つスターチング予測関数を生成する。
  • 研究数 $K$ および各研究のサンプルサイズ $n_k$ が大きくなると、NDRおよびデータ再利用(DR)スタッキングの両方が、漸近的オラクルに近い性能を達成する。
  • 特別なケースとして $\beta_0 = 0$ の場合、NDR法はDRスタッキングよりも厳密に高い期待予測精度を達成し、任意の $K > 2$ に対して $\mathbb{E}(\psi(\hat{w}^{\text{DR}}) - \psi(\hat{w}^{\text{CS}})) > 0$ が成り立つ。
  • 研究係数が共通値に近い場合($\sigma_\beta \to 0$)、DRとNDRの間の予測誤差の期待差はゼロに近づき、NDRの利点が薄れる。
  • 係数のばらつきが大きくなる($\sigma_\beta \to \infty$)と、DRスタッキングの期待予測誤差はNDRに対して発散するため、NDRは高い不均一性下でもより頑健であることが示される。
  • モンテカルロシミュレーションにより、$\mathbb{E}(\psi(\hat{w}^{\text{CS}}) - \psi(w_g^0))$ が $c_0 + c_1 \log(K)/K$ のように $K$ とともに減少することが確認され、研究数の増加に伴い性能が向上することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。