Skip to main content
QUICK REVIEW

[论文解读] Cross-validation Approaches for Multi-study Predictions

Boyu Ren, Prasad Patil|arXiv (Cornell University)|Jul 24, 2020
Machine Learning in Healthcare参考文献 23被引用 4
一句话总结

本文提出了一种无数据重用(NDR)堆叠框架,用于多研究预测,该框架结合了异质数据集上的通用模型与专用模型。通过在不重用训练数据的情况下估计堆叠权重,该方法在减少过拟合的同时实现了类似最优(oracle-like)的性能,尤其在研究间差异适中且样本量较大时,显著提升了预测准确率。

ABSTRACT

We consider prediction in multiple studies with potential differences in the relationships between predictors and outcomes. Our objective is to integrate data from multiple studies to develop prediction models for unseen studies. We propose and investigate two cross-validation approaches applicable to multi-study stacking, an ensemble method that linearly combines study-specific ensemble members to produce generalizable predictions. Among our cross-validation approaches are some that avoid reuse of the same data in both the training and stacking steps, as done in earlier multi-study stacking. We prove that under mild regularity conditions the proposed cross-validation approaches produce stacked prediction functions with oracle properties. We also identify analytically in which scenarios the proposed cross-validation approaches increase prediction accuracy compared to stacking with data reuse. We perform a simulation study to illustrate these results. Finally, we apply our method to predicting mortality from long-term exposure to air pollutants, using collections of datasets.

研究动机与目标

  • 解决当多个研究的预测变量与结果分布不同时,构建稳健预测模型的挑战。
  • 开发一种支持通用预测(针对新出现的、未见过的研究)和专用预测(针对特定包含的研究)的框架。
  • 缓解堆叠集成模型中因权重优化过程中数据重用而导致的过拟合问题。
  • 证明所提出的无数据重用技术可获得近乎最优的堆叠权重,并在有限样本下相比数据重用方法提升预测准确率。

提出的方法

  • 使用堆叠方法将各研究特定的预测函数(SPFs)整合为单一的集成预测函数。
  • 通过无数据重用(NDR)程序估计堆叠权重,将SPF训练与效用函数估计过程分离。
  • 采用任务特定的效用函数(如均方误差)指导权重优化,避免在同一数据上同时用于训练与评估。
  • 运用渐近理论证明,在较弱正则性条件下,NDR堆叠模型可实现类似最优(oracle-like)的性能。
  • 通过模拟研究验证理论结果,并比较NDR与传统数据重用(DR)堆叠在均方误差方面的表现。
  • 刻画NDR优于DR的条件,尤其在研究异质性适中且样本量较大时。

实验结果

研究问题

  • RQ1在何种条件下,无数据重用堆叠在多研究预测中优于数据重用堆叠?
  • RQ2所提出的框架能否实现接近最优的性能,与渐近最优基准相当?
  • RQ3堆叠预测模型的准确率如何依赖于研究数量及其样本大小?
  • RQ4研究异质性(如系数分布差异)对有无数据重用的堆叠性能有何影响?
  • RQ5NDR方法是否能减少在多个潜在非交换性研究上训练的集成模型中的过拟合?

主要发现

  • 无数据重用(NDR)堆叠框架生成的堆叠预测函数在较弱正则性条件下,其性能接近理论最优基准。
  • 当研究数量 $K$ 和样本量 $n_k$ 趋于无穷大时,NDR 与数据重用(DR)堆叠的性能均接近渐近最优基准。
  • 在 $\beta_0 = 0$ 的特例中,NDR 方法的期望预测准确率严格优于 DR 堆叠,且对任意 $K > 2$,有 $\mathbb{E}(\psi(\hat{w}^{\text{DR}}) - \psi(\hat{w}^{\text{CS}})) > 0$。
  • 当研究系数趋近于同一值时($\sigma_\beta \to 0$),DR 与 NDR 方法在预测误差上的期望差异趋于零,表明 NDR 的增益逐渐减弱。
  • 当系数变异性增加时($\sigma_\beta \to \infty$),DR 堆叠的期望预测误差相对于 NDR 显著发散,表明 NDR 在高异质性下更具鲁棒性。
  • 蒙特卡洛模拟结果表明,$\mathbb{E}(\psi(\hat{w}^{\text{CS}}) - \psi(w_g^0))$ 随 $K$ 按 $c_0 + c_1 \log(K)/K$ 的形式减小,表明随着研究数量增加,性能持续提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。